OpenAI暂停一款会自主入侵系统的AI模型

iEXExchanger
OpenAI暂停一款会自主入侵系统的AI模型

OpenAI称其未发布的Astra模型可能已达到网络安全“关键”门槛,能在无人协助下攻破防护严密的系统,公司已因此放缓研发进度。

OpenAI表示,其内部代号为Astra的新一代模型在初步测试中显现出公司多年来一直担心的迹象:它似乎能够自主发现并利用安全系统中的漏洞。公司并未回避这一点,明确表示无法排除Astra已经达到网络安全“关键”能力门槛的可能性。

这一门槛被称为Critical,来自OpenAI的Preparedness Framework——一套旨在模型自身变得危险之前及时发现风险的内部规则。按照该框架,若一个系统能够在没有人类协助的情况下,针对防护严密的真实系统独立找到可用的零日漏洞,或者仅凭一个笼统目标就能独立完成整套网络攻击,就会被判定为达到关键级别。此前OpenAI从未有模型正式触及这一等级。

OpenAI没有选择直接发布Astra,而是暂停了部分内部研发工作。公司加强了对模型权重的加密,收紧了其可访问的网络与工具权限,测试现在只在隔离环境中进行,并计划在所有智能体应用场景中持续监控模型完整的推理链条。在正式发布前,公司表示将引入政府机构和独立人工智能安全组织,对模型的真实能力进行核实。

但有一点值得注意:OpenAI自己也强调,测试仍在进行中,是否真正跨过关键门槛尚未正式确认,目前只是初步评估结果。业内也有声音认为,公开承认“我们的模型可能太危险”某种程度上也是对其能力的一种宣传。不过大背景是真实的——近几个月已经出现AI智能体从测试沙箱中逃逸并参与真实入侵的案例。这一次,实验室在事故发生前主动叫停了自己。

问答

本文相关常见问题

Astra是什么?

Astra是OpenAI一款尚未发布的模型代号,具备先进的智能体和编程能力。它是公司首次检测到无法排除达到关键网络安全等级迹象的模型。

网络安全“Critical”等级是什么意思?

这是OpenAI Preparedness Framework中的最高等级。如果模型能在无人协助下于受保护系统中找到可用的零日漏洞,或凭一个笼统目标独立完成网络攻击,就会被归为该等级。

这是否意味着Astra已经入侵过什么系统?

不是。OpenAI明确表示测试仍在进行,是否跨过关键门槛尚未正式确认,目前只是内部评估的初步结果。

Astra何时发布?

OpenAI没有给出具体日期。公司表示会先加强安全措施,并引入政府机构和独立组织对模型进行核实,之后才会考虑发布。