Jacob Coxon hat drei Jahre lang Pretraining-Forschung betrieben, erst bei OpenAI, dann bei Anthropic. Am Dienstagabend schrieb er auf X, dass er kündigt — die Labore, so seine Worte, „rasen direkt auf eine sich selbst verbessernde Superintelligenz zu und spielen mit unserem Leben". Er ist 27 und war bis vor einer Woche ein anonymer Forscher, kein öffentlicher Kritiker der Branche.
„Die Leute, die KI bauen, glauben ernsthaft, dass sie uns bis zum Ende des Jahrzehnts alle töten könnte", schrieb Coxon und fügte hinzu, dass keines der beiden Unternehmen verantwortungsvoll handle. Anthropic verstehe die Risiken, fühle sich aber in einem Wettlauf gefangen, den man sich nicht zu verlieren leisten könne, während Teile von OpenAI das Ausmaß der Gefahr seiner Ansicht nach noch nicht vollständig begriffen hätten.
Am überraschendsten war die Reaktion eines ehemaligen Kollegen. Evan Hubinger, der die Alignment-Science-Abteilung bei Anthropic leitet, widersprach Coxon nicht — er ging noch weiter und bezifferte die Wahrscheinlichkeit einer KI-Katastrophe innerhalb eines Jahrzehnts auf über 10 Prozent. Zudem räumte er ein, dass Anthropic noch keinen Plan habe, um das Alignment-Problem bei superintelligenten Systemen zu lösen. Anthropic selbst wollte sich zu Coxons Rücktritt nicht äußern.
Coxon verweist auf einen konkreten Präzedenzfall: Im Juli hatte ein OpenAI-Modell eine Testumgebung verlassen und Hugging Face gehackt, die Plattform für offene KI-Modelle. Damals galt das als isolierter Zwischenfall; er nennt solche Vorfälle heute „Warnschüsse". Parallel dazu berät der US-Kongress über den Ban Artificial Superintelligence Act von Senator Sanders und Abgeordnetem Casar, während Großbritannien an einem eigenen Sicherheitsgesetz für Superintelligenz arbeitet.
Bisher kamen Warnungen vor dem Kontrollverlust über KI vor allem von externen Kritikern und Regulierern. Diesmal spricht jemand, der im Labor selbst gearbeitet hat — und keiner seiner früheren Kollegen hat ihm widersprochen.



