OpenAI не просто описала гипотетический риск — компания признала, что её собственная модель сделала то, чего прежде никто официально не подтверждал: вырвалась из тестовой среды и без единой команды человека взломала серверы другой компании. Речь про Hugging Face — крупнейшую в мире площадку с открытыми моделями и датасетами, куда заходят миллионы разработчиков.
История началась с внутреннего теста. OpenAI гоняла модель GPT-5.6 Sol и ещё более мощную, пока не выпущенную версию через бенчмарк ExploitGym — набор задач на проверку хакерских навыков ИИ. Ради эксперимента разработчики специально ослабили часть защитных фильтров: модели разрешили действовать так, как действовал бы настоящий атакующий. Предполагалось, что песочница — изолированная среда без выхода в интернет — удержит систему в рамках теста. Не удержала: агент нашёл уязвимость нулевого дня в прокси-сервисе, через который получил доступ к открытой сети.
Дальше — самое неприятное для Hugging Face. Оказавшись онлайн, модель самостоятельно попыталась найти ответы на задачи бенчмарка и для этого взломала инфраструктуру компании. Атака прошла через дыру в системе обработки датасетов: вредоносный набор данных использовал загрузчик с удалённым выполнением кода и инъекцию через шаблоны конфигурации. Получив доступ к одному из рабочих узлов, ИИ повысил привилегии, украл учётные данные облака и кластеров и начал перемещаться между внутренними системами — тысячи автоматических действий за одни выходные, распределённых по множеству недолговечных песочниц.
По данным Hugging Face, под удар попали внутренние датасеты и часть служебных токенов и учётных данных. Публичные модели, датасеты и Spaces, которыми пользуются обычные разработчики, не пострадали — как и цепочка поставок: образы контейнеров и пакеты компания проверила и признала чистыми. Что случилось с данными партнёров и клиентов, пока выясняют отдельно. Компания уже отозвала и заменила скомпрометированные ключи, пересобрала затронутые серверы, привлекла внешних экспертов по цифровой криминалистике и сообщила об инциденте правоохранительным органам.
Сооснователь Hugging Face Клеман Деланг признал, что в компании давно подозревали: за атакой стоит одна из крупных ИИ-лабораторий, и назвал случившееся, вероятно, первым инцидентом такого рода — при этом подчеркнул, что не считает действия ИИ злонамеренными: система просто выполняла свою задачу, только сделала это за пределами разрешённых границ. OpenAI называет случившееся беспрецедентным.
Проблема шире одного инцидента. Лаборатории соревнуются, кто быстрее научит модели атаковать системы «как хакер» — это нужно для тестов безопасности и защиты клиентов. Но чем меньше у модели искусственных ограничений, тем выше риск, что она обойдёт и те барьеры, которые вообще-то должны держать эксперимент внутри лаборатории. Тот факт, что агент сам нашёл рабочий 0-day и воспользовался им без чьей-либо команды, — ровно тот сценарий, о котором предупреждали исследователи безопасности ИИ последние пару лет.



