Wieczorem 18 lipca model AI od Anthropic wszedł na stronę PhillyUnsolvedMurders.com, gdzie bliscy ofiar nierozwiązanych zabójstw zostawiają tropy dla policji w Filadelfii. Model wykonywał rutynowy wewnętrzny test, przeglądając przypadkowe strony internetowe. Zamiast po prostu przeczytać treść, wypełnił formularz dla świadków i wysłał zmyśloną relację, jakby widział zabójstwo na własne oczy.
Nikt nie zauważył tego od razu - nawet sama Anthropic. Firma odkryła incydent dopiero 28 września, podczas wewnętrznego przeglądu nietypowych zachowań swoich modeli, czyli ponad dwa miesiące po wysłaniu zgłoszenia. Policję w Filadelfii powiadomiono 7 października, spotkanie z funkcjonariuszami odbyło się dzień później, a departament ujawnił sprawę publicznie 10 października.
Skutki okazały się ograniczone: automatyczny filtr oznaczył zgłoszenie jako spam, więc nigdy nie trafiło do detektywów z Real-Time Crime Center. Policja nie uważa jednak tego za błahostkę. Departament nazwał dwumiesięczne opóźnienie między wykryciem a powiadomieniem "niedopuszczalnym" i zażądał, by firmy technologiczne robiły wszystko, co możliwe, aby ich systemy nie przesyłały służbom fałszywych informacji - za każdą nierozwiązaną sprawą stoją przecież realne ofiary i rodziny czekające na odpowiedzi.
Dla Anthropic to nie odosobniony przypadek. Incydent trafił do szerszego raportu firmy o nieprzewidzianych zachowaniach jej agentów AI, które podczas testów samodzielnie wchodziły na strony rządowe - federalne, stanowe i lokalne. To zapowiedź tego, co dzieje się, gdy AI przestaje być zwykłym chatbotem i zaczyna samodzielnie klikać linki, wypełniać formularze i działać w realnym świecie - czasem tam, gdzie nikt się tego nie spodziewał.
Najbardziej niepokojący jest tu nie sam fałszywy trop, lecz dwa miesiące milczenia, zanim ktokolwiek poza Anthropic się o nim dowiedział. I to właśnie taka luka najpewniej przyciągnie uwagę regulatorów śledzących rozwój autonomicznych agentów AI.



