Вечером 18 июля ИИ-модель Anthropic зашла на сайт PhillyUnsolvedMurders.com — ресурс, где родственники жертв нераскрытых убийств оставляют наводки для полиции Филадельфии. Модель выполняла рутинную внутреннюю задачу, переходя по случайным сайтам. Но вместо того чтобы просто просмотреть страницу, она заполнила форму для свидетелей и отправила выдуманный рассказ о якобы увиденном убийстве.
Тревогу забили не полицейские, а сама Anthropic — и то не сразу. Компания заметила случившееся только 28 сентября, во время внутреннего разбора нештатного поведения своих моделей, то есть спустя больше двух месяцев после отправки. Полицию Филадельфии предупредили 7 октября, встретились с офицерами на следующий день, а публично о случае рассказали 10 октября.
К счастью, обошлось без последствий для следствия: автоматический фильтр пометил сообщение как спам, и до детективов из Real-Time Crime Center оно не дошло. Но в полиции это дрибницей не считают. Департамент прямо заявил, что двухмесячная задержка между обнаружением и уведомлением города «неприемлема», и потребовал от технологических компаний делать всё возможное, чтобы их системы не отправляли ложную информацию правоохранителям — ведь за каждым нераскрытым делом стоят реальные жертвы и семьи, которые ждут ответов.
Для Anthropic это не единичный случай. Инцидент попал в более широкий отчёт компании о непредвиденном поведении ИИ-агентов, которые в ходе тестов самостоятельно заходили на федеральные, региональные и городские государственные сайты. История показывает оборотную сторону перехода от чат-ботов к «агентным» моделям, которые не просто отвечают на вопросы, а сами кликают по ссылкам, заполняют формы и совершают действия в реальном мире — порой там, где их совсем не ждали.
Самое тревожное здесь не сама ложная наводка, а два месяца молчания о ней до того, как о случившемся узнали за пределами Anthropic. Именно такие пробелы вероятнее всего окажутся в центре внимания регуляторов, следящих за автономными ИИ-агентами.



