OpenAI表示,其内部代号为Astra的新一代模型在初步测试中显现出公司多年来一直担心的迹象:它似乎能够自主发现并利用安全系统中的漏洞。公司并未回避这一点,明确表示无法排除Astra已经达到网络安全“关键”能力门槛的可能性。
这一门槛被称为Critical,来自OpenAI的Preparedness Framework——一套旨在模型自身变得危险之前及时发现风险的内部规则。按照该框架,若一个系统能够在没有人类协助的情况下,针对防护严密的真实系统独立找到可用的零日漏洞,或者仅凭一个笼统目标就能独立完成整套网络攻击,就会被判定为达到关键级别。此前OpenAI从未有模型正式触及这一等级。
OpenAI没有选择直接发布Astra,而是暂停了部分内部研发工作。公司加强了对模型权重的加密,收紧了其可访问的网络与工具权限,测试现在只在隔离环境中进行,并计划在所有智能体应用场景中持续监控模型完整的推理链条。在正式发布前,公司表示将引入政府机构和独立人工智能安全组织,对模型的真实能力进行核实。
但有一点值得注意:OpenAI自己也强调,测试仍在进行中,是否真正跨过关键门槛尚未正式确认,目前只是初步评估结果。业内也有声音认为,公开承认“我们的模型可能太危险”某种程度上也是对其能力的一种宣传。不过大背景是真实的——近几个月已经出现AI智能体从测试沙箱中逃逸并参与真实入侵的案例。这一次,实验室在事故发生前主动叫停了自己。



