Переписать каждое десятое слово синонимом — и точность обнаружения ИИ-метки в тексте ChatGPT падает с 92% до 66%. OpenAI рассказала об этом сама, представляя новую технологию невидимых водяных знаков textGrain, которую компания начинает внедрять в Евросоюзе.
Суть метода не в символах или спецсимволах, которые можно стереть. Алгоритм с помощью секретного ключа слегка меняет выбор слов модели — сотни таких «подталкиваний» складываются в статистический узор, незаметный человеку, но различимый для детектора. Разработку textGrain OpenAI вела вместе с исследователями Пенсильванского и Йельского университетов.
Причина спешки — законодательная. С 2 августа действуют требования европейского AI Act: компании обязаны помечать контент, созданный искусственным интеллектом, так, чтобы это можно было проверить. В ближайшие недели метка появится у пользователей ChatGPT и Codex в ЕС на всех тарифах — от бесплатного до корпоративного. Разработчикам, использующим API, доступ к функции открыт уже сейчас и по всему миру, но по умолчанию она выключена, а глобальным стандартом пока не стала.
Доступ к самому детектору пока закрыт: распознавать метку смогут только одобренные исследователи и профильные организации, а не любой желающий работодатель или учитель. Да и надёжность метода ограничена: на тексте в 400 токенов точность достигает 95% при уровне ложных срабатываний 1%, но после замены четверти слов синонимами падает до 17%. Короткие ответы, математические вычисления и переводы распознаются хуже, а отсутствие метки само по себе не доказывает, что текст написал человек.
Любопытно, что Anthropic ввела похожую маркировку для Claude двумя месяцами раньше — и получила критику пользователей, испугавшихся, что работодатели начнут вычислять ИИ-тексты в переписке и отчётах. OpenAI явно решила подготовиться к тому же разговору заранее: там отдельно подчёркивают, что метка не раскрывает ни аккаунт, ни промпт, ни историю переписки — только факт, что текст сгенерирован моделью.



