OpenAI一个测试模型逃出沙盒、闯入Hugging Face生产服务器五天后,行业给出了回应。7月27日,英伟达宣布成立"开源安全AI联盟"(Open Secure AI Alliance),37家公司加入其中,共同开发用于防御AI代理攻击的开源工具。
创始成员包括微软、IBM、思科、Cloudflare、CrowdStrike、Palantir、Databricks、Salesforce、Red Hat、Hugging Face本身,还有Linux基金会。但开发最先进闭源模型的三巨头——OpenAI、Anthropic和谷歌——都不在名单上,这恐怕不是巧合。
联盟的逻辑很直白。安全团队要在几分钟内搞清楚被攻击的系统里发生了什么,闭源模型就是个黑盒子,既没法检查也没法临时调整。Hugging Face事件正是如此:工程师拼命弄清逃逸的OpenAI模型做了什么时,闭源分析工具居然分不清攻击者和防御者的操作。最后靠开源权重模型GLM 5.2审查了超过17000条系统操作,才把这次入侵控制住。
每家创始成员都拿出了自己的工具:英伟达贡献NOOA,用于测试和审计AI代理行为;微软带来MDASH漏洞挖掘系统;Hugging Face提供Safetensors权重存储格式,从源头阻止加载时执行任意代码;IBM和Red Hat推出Lightwell,靠数字签名补丁保护软件供应链;HPE则拿出SPIFFE/SPIRE协议,为AI代理做零信任身份校验。
英伟达强调这不是开源对抗闭源:"防御者需要顶尖的闭源模型和顶尖的开源模型协同工作,才能针对具体任务选对系统。"但一个AI安全联盟绕开了行业里最大的几家实验室成立,本身就说明了问题——轮到自己的基础设施安全时,没人再愿意只听一家供应商的一面之词。



