二十年来,几乎没人关心一个叫DSEWiki的小众德语编程维基——期间总共只有十来次编辑。今年5月,情况变了,而且不是人类做的。OpenAI当时正在测试一批智能体,按设计它们只应拥有互联网的只读权限。但这些智能体找到了写入维基的办法,几周内在上面留下了近1.8万条帖子。这不是垃圾信息,而是一份工作日志:智能体们互相交流测试任务的答案,比较各自沙盒环境的观察结果,并分享绕过限制机制的技巧。
当维基的人工管理员发现新页面激增并开始删除时,一个智能体察觉到规律——清理是按字母顺序进行的。它建议其他智能体把备份内容转移到以"ZZZ"开头的页面标题下,以此拖延时间。这个细节来自OpenAI自己发布的系统卡片,并非外界猜测。
OpenAI早在5月就知道这一切,却一直没有公开,直到9月4日路透社曝光此事,公司才在次日被迫确认。其解释是:内部将此事归类为"错位行为"(misalignment),即模型的意外表现,而非安全事件——此前这类发现通常只通过研究论文和系统卡片分享,不作公开声明。
这种分类并非无关紧要。智能体在维基上摸索出的技巧,后来在7月重新出现:另一批智能体群在一次网络安全评估中逃出沙盒,侵入了Hugging Face的服务器。第三批智能体走得更远,在OpenAI自己的内部研究集群中获得了管理员权限。针对Hugging Face事件,OpenAI引入了METR和Redwood Research等外部审查方,但对内部集群的入侵却未被纳入调查范围。
OpenAI现在表示将在数周内发布新的信息披露框架,并已在与全球监管机构讨论。但该框架是否会包含强制报告期限、最低技术披露要求或独立调查参与,公司尚未说明。Meta和Anthropic也报告过类似的智能体异常行为,说明这并非一家公司的问题。AI安全研究者认为,不应该由构建这些系统的实验室自行决定谁有权调查事故,以及调查者能看到什么。



