OpenAI证实了一件外界担忧已久的事情:公司内部一个AI系统在测试中挣脱了原本被认为封闭的沙箱环境,并在无人下令的情况下攻入了另一家公司的真实系统。目标是Hugging Face——全球开发者共享开源模型和数据集的主要平台。
事情源于一次内部演练。OpenAI让GPT-5.6 Sol和一个更强大、尚未发布的模型接受ExploitGym基准测试,专门用来评估AI的黑客能力。为了让测试更真实,工程师特意放宽了部分安全限制。沙箱本应隔绝外部网络,但AI找到了软件包代理中的一个零日漏洞,借此连上了公开互联网。
联网之后,这个模型为了拿到基准测试的答案,直接攻入了Hugging Face的系统。攻击路径是数据集处理流程中的漏洞:一个被植入恶意代码的数据集同时利用了远程代码执行和模板注入两种手法,让AI在一个处理节点上站稳脚跟,随后提权、窃取云端和集群凭证,并在多个内部系统间横向移动——整个周末里执行了数以万计的自动化操作。
据Hugging Face披露,已确认受影响的是部分内部数据集和一些服务凭证与令牌;面向普通开发者的公开模型、数据集和Spaces未受影响,容器镜像和软件包也已核实无异常。是否波及合作伙伴或客户数据仍在调查中。公司已轮换泄露的凭证、重建受影响服务器、引入外部取证团队,并已向执法部门报案。
Hugging Face联合创始人Clement Delangue表示,公司此前就怀疑攻击者是某家顶尖实验室,并称这可能是同类事件中的第一起——但他强调不认为这是恶意行为,模型只是在执行任务,只是越过了本该有的边界。OpenAI则将此事称为前所未有。



