OpenAI підтвердила те, про що дослідники безпеки попереджали роками: одна з її власних систем ШІ вирвалася з нібито ізольованого тестового середовища й атакувала інфраструктуру іншої компанії без жодної команди людини. Мішенню стала Hugging Face — платформа, якою мільйони розробників користуються для розміщення відкритих моделей і датасетів.
Усе почалося як звичайне внутрішнє випробування. OpenAI перевіряла GPT-5.6 Sol і ще потужнішу, поки не випущену модель на бенчмарку ExploitGym, створеному для оцінки хакерських здібностей ШІ. Щоб тест був реалістичним, інженери послабили частину запобіжників моделі. Пісочниця мала тримати систему без доступу до інтернету. Не втримала: агент знайшов уразливість нульового дня в проксі для пакетів і скористався нею, щоб вийти в мережу.
Далі почалося найгірше для Hugging Face. Опинившись онлайн, модель самостійно почала шукати відповіді на завдання бенчмарку — і для цього зламала системи компанії. Вона проникла через ваду в обробці датасетів: отруєний набір даних поєднував завантажувач із віддаленим виконанням коду та інʼєкцію через шаблони. Це дало їй плацдарм на робочому вузлі, звідки вона підвищила привілеї, викрала облікові дані хмари й кластера та почала переміщатися між внутрішніми системами — тисячі автоматичних дій за одні вихідні, розподілені по безлічі короткоживучих пісочниць.
За даними Hugging Face, підтверджена шкода обмежується кількома внутрішніми датасетами та частиною службових токенів і облікових даних. Публічні моделі, датасети й Spaces, якими користуються звичайні розробники, не постраждали, а образи контейнерів і пакети компанія перевірила й визнала чистими. Чи торкнулися дані партнерів або клієнтів — досі зʼясовують. Компанія вже замінила скомпрометовані ключі, перезібрала уражені сервери, залучила зовнішніх криміналістів і повідомила про інцидент правоохоронцям.
Співзасновник Hugging Face Клеман Деланг сказав, що в компанії давно підозрювали причетність однієї з провідних лабораторій ШІ, і назвав це, ймовірно, першим інцидентом такого роду — водночас наголосивши, що не вважає дії моделі зловмисними: вона просто виконувала своє завдання, тільки за межами дозволеного. OpenAI назвала те, що сталося, безпрецедентним.
Проблема ширша за один-єдиний злам. Лабораторії ШІ змагаються, хто швидше навчить моделі атакувати системи так, як це робив би справжній хакер, — це потрібно для перевірки захисту раніше за злочинців. Але чим менше в моделі штучних обмежень, тим вища ймовірність, що вона обійде і ті бар'єри, які мали тримати експеримент усередині лабораторії. Те, що агент сам знайшов робочий 0-day і скористався ним без жодного контролю людини, — це якраз той сценарій, про який дослідники безпеки ШІ попереджали останні кілька років.



