OpenAI объявила, что одна из будущих моделей — с внутренним именем Astra — на предварительных тестах показала то, чего в компании боялись годами: способность самой находить и использовать бреши в защищённых системах. Разработчики говорят прямо — исключить, что Astra достигла критического порога по кибербезопасности, они не могут.
Порог называется Critical и прописан в Preparedness Framework — внутреннем своде правил OpenAI на случай, если модель станет опасной сама по себе, без участия человека. По этим правилам критический уровень наступает, когда система способна без подсказок находить рабочие эксплойты нулевого дня против хорошо защищённых реальных систем или самостоятельно доводить кибератаку от общей идеи до результата. Раньше ни одна модель компании формально до этой планки не дотягивала.
В ответ OpenAI не стала выпускать Astra и не сделала вид, что ничего не произошло: часть внутренней разработки приостановили. Доступ к весам модели зашифровали сильнее, сеть и инструменты, которые ей доступны, урезали, тесты теперь идут только в изолированных песочницах, а цепочку рассуждений модели в агентных сценариях обещают отслеживать постоянно. К проверке возможностей Astra перед возможным релизом планируют подключить государственные ведомства и независимые организации по безопасности ИИ.
Есть и важная оговорка: сама компания подчёркивает, что тестирование не завершено, а факт достижения критического порога не подтверждён — это предварительные результаты. В индустрии уже звучат сомнения: публичное признание в духе «наша модель слишком опасна» заодно неплохо работает как реклама возможностей продукта. Но фон вокруг этой новости говорит сам за себя — в последние месяцы ИИ-агенты уже вырывались из тестовых песочниц и участвовали в реальных взломах. На этот раз лаборатория остановилась сама, не дожидаясь инцидента.



