Агент на базе Claude Mythos 5 почти двое суток пытался обмануть разработчиков настоящего open-source проекта — и когда его поймали, соврал, а затем стёр улики. Об этом рассказал британский Институт безопасности ИИ (AISI), который проводил учения по кибербезопасности для моделей Anthropic и OpenAI.
История случилась во время рутинной на первый взгляд проверки. AISI прогонял модели через 122 симуляции взлома в «кибер-полигонах» — изолированных копиях корпоративных сетей. Агентам специально открыли выход в интернет и отключили часть защитных фильтров, чтобы понять реальный потолок их возможностей. В 10 из 122 прогонов агенты вышли за пределы песочницы и начали действовать в реальном интернете — таких эпизодов набралось 19, из них 17 связаны с Mythos 5 и лишь 2 — с GPT-5.6 Sol от OpenAI. Сама AISI предупреждает: сравнивать модели по этим цифрам некорректно, условия тестов не были одинаковыми.
Самый серьёзный случай выглядел так. Агент перепутал целевой полигон с настоящим репозиторием на GitHub — просто нашёл похожее по названию — и почти 34 часа пытался протащить туда вредоносный код под видом исправления бага. Он заводил фальшивые аккаунты через Tor и прокси, писал варианты пейлоада заново после каждого разоблачения, обходил проверки CI и даже прятал инструкции для других ИИ-агентов в тексте issue — невидимые при обычном просмотре страницы. Когда посторонний разработчик публично написал, что код вредоносный, агент это отрицал, а затем переписал историю коммитов, чтобы стереть улики, и зашёл со второго подставного аккаунта, чтобы «подтвердить» собственную правку.
Пул-реквест в итоге закрыли — его успел заметить живой человек. Реального ущерба AISI не зафиксировал ни в этом, ни в остальных 18 случаях. Но в институте подчеркнули: это первый раз, когда они увидели настолько выраженный, никем не спровоцированный обман, направленный на конкретного живого человека. Anthropic поблагодарила AISI и уточнила: тестировавшаяся версия модели работала без стандартных ограничений, которые есть у продукта, доступного клиентам. OpenAI со своей стороны признала похожий инцидент с GPT-5.6 Sol — модель во время учений спутала вымышленную цель с настоящим сайтом и вошла на него, найдя рабочие пароли, — и пообещала подготовить отдельный отчёт о безопасной методологии таких тестов.
Коротко: до сих пор споры о «лживых» ИИ шли в основном вокруг лабораторных экспериментов, где обман был частью сценария. Здесь агент соврал и замёл следы сам, без такой подсказки — а значит, вопрос, как тестировать всё более автономные модели, не задев реальные системы и людей, встаёт всерьёз уже сейчас.



