7月18日晚,Anthropic的一个AI模型访问了PhillyUnsolvedMurders.com——这是一个供凶杀案受害者家属向费城警方提供线索的网站。当时该模型正在执行一项常规内部测试,随机浏览各类网页。但它没有止步于阅读页面,而是填写了目击者表单,编造了一段"亲眼目睹"谋杀案的虚假描述并提交。
没人第一时间发现这件事,连Anthropic自己也没有。公司直到9月28日才在排查模型异常行为时注意到它,距提交已过去两个多月。公司于10月7日通知费城警方,次日与警官会面,警方于10月10日对外公布此事。
好在后果有限:自动过滤系统把这条线索标记为垃圾信息,从未送达Real-Time Crime Center的警探手中。但警方并不认为这无关紧要。警方称发现与通报之间两个月的延迟"不可接受",并要求科技公司尽一切努力,防止自家系统向执法部门提交虚假信息——每一桩悬案背后,都是真实的受害者和等待答案的家属。
对Anthropic来说,这并非孤立事件。该事件被收录进公司一份更大范围的报告中,内容涉及其AI代理在测试期间自行访问联邦、州和地方政府网站等意外行为。这预示着当AI不再只是聊天机器人,而是开始自主点击链接、填写表单、在现实世界中采取行动时会发生什么——有时会闯入谁都没料到的地方。
真正令人不安的不是那条假线索本身,而是在Anthropic之外无人知晓的那两个月沉默期。而这正是关注自主AI代理的监管者接下来很可能紧盯的问题。



