Zamiana co dziesiątego słowa na synonim wystarcza, by skuteczność wykrywania tekstu generowanego przez AI spadła z 92% do 66%. Tę liczbę opublikowało samo OpenAI, prezentując textGrain — nowy system niewidocznych znaków wodnych dla ChatGPT i Codex w Unii Europejskiej.
Nie ma tu żadnego widocznego symbolu do usunięcia. Tajny klucz nieznacznie naprowadza wybór słów modelu, setki razy w jednym tekście, pozostawiając statystyczny wzór niewidoczny dla czytelnika, ale wykrywalny przez algorytm. OpenAI opracowało textGrain wraz z badaczami z uniwersytetów Pensylvanii i Yale.
Moment nie jest przypadkowy. Przepisy o przejrzystości unijnego AI Act, obowiązujące od 2 sierpnia, zobowiązują firmy do oznaczania treści generowanych przez AI w sposób możliwy do zweryfikowania. W najbliższych tygodniach użytkownicy ChatGPT i Codex w UE — od planu bezpłatnego do firmowego — zaczną otrzymywać oznaczone teksty. Deweloperzy korzystający z API mogą już włączyć tę funkcję na całym świecie dla wybranych modeli, choć domyślnie jest wyłączona i nie stała się jeszcze globalnym standardem.
Sam detektor na razie jest zamknięty: dostęp mają tylko zweryfikowani badacze i uprawnione organizacje, nie każdy pracodawca czy nauczyciel chcący sprawdzić tekst. Metoda ma też realne ograniczenia: na fragmencie 400 tokenów dokładność sięga 95% przy 1% fałszywych alarmów, ale po zamianie co czwartego słowa na synonim spada do 17%. Krótkie odpowiedzi, obliczenia matematyczne i tłumaczenia są trudniejsze do wykrycia, a brak znaku wodnego sam w sobie nie dowodzi ludzkiego autorstwa.
Co ciekawe, Anthropic wprowadziła podobne oznaczanie dla Claude dwa miesiące wcześniej i spotkała się z krytyką użytkowników, którzy obawiali się, że pracodawcy zaczną wyłapywać teksty AI w korespondencji. OpenAI zdaje się przygotowała na podobną dyskusję z wyprzedzeniem: firma podkreśla, że znak nie zdradza ani konta, ani polecenia, ani rozmowy, z której pochodzi tekst — tylko fakt, że napisał go model.



