把十分之一的词换成同义词,ChatGPT生成文本的检测准确率就会从92%跌到66%。这个数字是OpenAI自己公布的——在它推出textGrain这套面向欧盟的ChatGPT和Codex隐形水印系统时。
这里没有可以删除的可见符号。一个密钥会轻微引导模型的用词选择,一段文字里这样的"微调"重复上百次,留下读者察觉不到、却能被算法识别的统计规律。textGrain是OpenAI与宾夕法尼亚大学和耶鲁大学的研究人员共同开发的。
时间点并非偶然。欧盟《AI法案》的透明度条款自8月2日起生效,要求企业以可验证的方式标注AI生成内容。未来几周内,欧盟的ChatGPT和Codex用户——从免费版到企业版——都会陆续用上带水印的文本。使用API的开发者现在已经可以在全球范围内为部分模型开启该功能,但默认是关闭的,也还没有成为全球标准。
检测器本身目前并不开放:只有经过审核的研究者和机构才能使用,不是任何雇主或老师想查就能查。方法本身也有明显局限:400个token的文本在1%误报率下准确率可达95%,但只要替换四分之一的词,准确率就会跌到17%。短回答、数学题和翻译文本更难识别,而且没有检测到水印并不能证明文字出自人类。
有意思的是,Anthropic两个月前就为Claude上线了类似的水印机制,结果引来用户的强烈反弹,担心雇主借此在工作邮件里揪出AI生成的内容。OpenAI显然提前想到了这一点:它特别强调水印不会泄露账户、提示词或对话内容,只能证明这段文字是模型写的。



