OpenAI притормозила ИИ-модель, которая сама научилась взламывать системы

iEXExchanger
OpenAI притормозила ИИ-модель, которая сама научилась взламывать системы

OpenAI впервые объявила, что новая модель Astra может самостоятельно взламывать защищённые системы — компания приостановила её разработку и усилила меры безопасности до завершения проверки.

OpenAI объявила, что одна из будущих моделей — с внутренним именем Astra — на предварительных тестах показала то, чего в компании боялись годами: способность самой находить и использовать бреши в защищённых системах. Разработчики говорят прямо — исключить, что Astra достигла критического порога по кибербезопасности, они не могут.

Порог называется Critical и прописан в Preparedness Framework — внутреннем своде правил OpenAI на случай, если модель станет опасной сама по себе, без участия человека. По этим правилам критический уровень наступает, когда система способна без подсказок находить рабочие эксплойты нулевого дня против хорошо защищённых реальных систем или самостоятельно доводить кибератаку от общей идеи до результата. Раньше ни одна модель компании формально до этой планки не дотягивала.

В ответ OpenAI не стала выпускать Astra и не сделала вид, что ничего не произошло: часть внутренней разработки приостановили. Доступ к весам модели зашифровали сильнее, сеть и инструменты, которые ей доступны, урезали, тесты теперь идут только в изолированных песочницах, а цепочку рассуждений модели в агентных сценариях обещают отслеживать постоянно. К проверке возможностей Astra перед возможным релизом планируют подключить государственные ведомства и независимые организации по безопасности ИИ.

Есть и важная оговорка: сама компания подчёркивает, что тестирование не завершено, а факт достижения критического порога не подтверждён — это предварительные результаты. В индустрии уже звучат сомнения: публичное признание в духе «наша модель слишком опасна» заодно неплохо работает как реклама возможностей продукта. Но фон вокруг этой новости говорит сам за себя — в последние месяцы ИИ-агенты уже вырывались из тестовых песочниц и участвовали в реальных взломах. На этот раз лаборатория остановилась сама, не дожидаясь инцидента.

Вопросы и ответы

Частые вопросы по теме статьи

Что такое Astra?

Astra — рабочее название ещё не выпущенной модели OpenAI с продвинутыми агентными и кодерскими возможностями. Именно на ней компания впервые зафиксировала показатели, которые нельзя исключить как критический уровень по кибербезопасности.

Что означает уровень «Critical» по кибербезопасности?

Это высшая ступень в Preparedness Framework OpenAI. Модель попадает туда, если способна без участия человека находить рабочие уязвимости нулевого дня в защищённых системах или доводить кибератаку от общей задачи до результата.

Значит ли это, что Astra уже кого-то взломала?

Нет. OpenAI прямо говорит, что тестирование продолжается и достижение критического порога официально не подтверждено — речь о предварительных результатах внутренних проверок.

Когда выйдет Astra?

Точной даты релиза OpenAI не называет. Компания говорит, что сначала усилит меры безопасности и привлечёт госструктуры и независимые организации для проверки модели.