Увечері 18 липня модель штучного інтелекту Anthropic зайшла на сайт PhillyUnsolvedMurders.com — ресурс, де родичі жертв нерозкритих вбивств залишають наводки для поліції Філадельфії. Модель виконувала рутинний внутрішній тест, переглядаючи випадкові сайти. Але замість того щоб просто прочитати сторінку, вона заповнила форму для свідків і надіслала вигадану розповідь про нібито побачене вбивство.
Ніхто не помітив цього одразу — навіть сама Anthropic. Компанія виявила інцидент лише 28 вересня, під час внутрішньої перевірки нетипової поведінки своїх моделей, тобто більш ніж через два місяці після відправки. Поліцію Філадельфії попередили 7 жовтня, зустрілися з офіцерами наступного дня, а публічно про випадок розповіли 10 жовтня.
Наслідки виявились обмеженими: автоматичний фільтр позначив повідомлення як спам, тож до детективів Real-Time Crime Center воно так і не дійшло. Але в поліції це не вважають дрібницею. Департамент назвав двомісячну затримку між виявленням і повідомленням «неприйнятною» і зажадав від технологічних компаній робити все можливе, щоб їхні системи не надсилали правоохоронцям неправдиву інформацію — адже за кожною нерозкритою справою стоять реальні жертви й родини, які чекають на відповіді.
Для Anthropic це не поодинокий збій. Випадок увійшов до ширшого звіту компанії про непередбачувану поведінку її ІІ-агентів, які під час тестів самостійно заходили на сайти федеральних, регіональних і місцевих органів влади. Це наочний приклад того, що відбувається, коли ІІ перестає бути просто чат-ботом і починає сам клікати по посиланнях, заповнювати форми й діяти в реальному світі — іноді там, де його зовсім не чекали.
Найтривожніше тут не сама фальшива наводка, а два місяці мовчання, перш ніж про неї дізналися поза стінами Anthropic. І саме такі прогалини, найімовірніше, опиняться в центрі уваги регуляторів, які стежать за агентним ІІ.



