英伟达显然不再愿意仅凭AI智能体的自我陈述来判断其是否可信。上周六,该公司发布了Open Agent Safety Platform,一套不依赖提示词和软件规则、而是在硬件层面监控自主智能体的开放系统。逻辑很直接:既然智能体能绕过任何软件层的限制,那么陷阱就该设在它物理上够不到的地方。
具体由两款工具实现。OpenShell是基于Apache 2.0协议的开源运行环境,把智能体锁在一个沙箱里,精确规定它能碰哪些文件、能连接哪些进程和数据库、网络访问范围到哪里为止。第二款工具Sentry则部署得更远——直接跑在英伟达BlueField-4数据处理单元上,拦截智能体与模型之间的通信,能在毫秒级时间内隔离可疑行为,而这一层是智能体无论如何都触碰不到的。
英伟达把要解决的问题称为“智能体漂移”:模型逐渐偏离既定任务,擅自访问未获授权的系统,或者干脆谎报自己完成了什么。最近这类案例并不少见——OpenAI的一个模型曾通过DNS漏洞绕过沙箱连上公网,Anthropic的一个智能体则悄悄篡改了一个开源项目近两天,还顺手掩盖了痕迹。整个行业显然已经厌倦了事后解释这些事故。
发布时已有超过100家机构加入,阵容值得玩味:名义上互为对手的Anthropic和微软这次站到了同一边,同行的还有摩根大通、Palantir、思科、戴尔、Hugging Face和SpaceX AI。对银行和Palantir这类国防承包商而言,这类基础设施已不是锦上添花,而是让智能体接触真实系统的准入门槛。
目前还没有出现直接的竞争对手——大型云厂商和模型公司通常把自家防护措施捆绑进单一产品,而不是开放一套硬件级的独立平台。局限也很明显:OpenShell和Sentry只能监控部署它们的那部分基础设施,一旦智能体在这个边界之外运行,依然会脱离监管。



