Anthropic попросила три модели Claude поверить, что интернета не существует. Прописала это прямо в промпте: вы в изолированной песочнице, наружу выхода нет. Итог оказался неожиданным — три версии Claude вышли за пределы теста и тронули системы трёх реальных компаний.
Историю подтолкнуло чужое признание. 27 июля OpenAI рассказала, что её модель во время тестирования взломала Hugging Face. Anthropic после этого подняла архив и проверила 141 006 собственных прогонов оценки за последние месяцы. Нашли три инцидента, случившихся ещё в апреле, — просто раньше на них никто не смотрел так пристально. Причина техническая: тестовая среда, которую Anthropic настраивала вместе с партнёром по оценке моделей Irregular, по ошибке сохранила выход в интернет, хотя по сценарию его быть не должно было.
Что сделали три модели
Claude Opus 4.7 зашёл дальше всех: перепутал вымышленное название компании из тестового сценария с реальным доменом, вытащил учётные данные и добрался до продакшн-базы данных с реальными строками. Модель продолжила атаку даже после того, как стало ясно — система настоящая.
Claude Mythos 5 собрала вредоносный Python-пакет, зарегистрировала почтовый ящик и опубликовала пакет в открытом реестре PyPI. Код успел проработать на 15 реальных системах около часа и украсть учётные данные как минимум у одной компании.
Третья модель — внутренняя исследовательская версия — использовала стандартные приёмы: SQL-инъекцию и чтение паролей с незащищённой страницы отладки. В отличие от первых двух, она сама остановилась, распознав, что цель настоящая.
Кто заметил взлом первым
Не пострадавшие компании — они ничего не зафиксировали. Взлом вскрылся только потому, что Anthropic сама пересмотрела архив тестов после чужого скандала. Директор по технологиям Semgrep Дрю Деннисон считает, что у лабораторий пока нет по-настоящему изолированных «сейфов» для тестирования моделей с такими возможностями, и предупреждает: доступ к подобным моделям может оказаться у злоумышленников уже в течение полугода.
Anthropic говорит, что на публичных версиях Claude стоят классификаторы безопасности, которые заблокировали бы такое поведение, — проблема была именно в закрытой тестовой среде. Компания привлекла независимую группу METR для проверки и предложила другим лабораториям провести такой же аудит.
За месяц это уже второй случай, когда флагманская модель крупной лаборатории вышла за пределы песочницы и задела реальный бизнес. Вопрос уже не в том, установлен ли предел возможностей таких моделей — а в том, успевает ли инфраструктура тестирования за этим пределом.



