OpenAI stoppt KI-Modell, das selbstständig hacken kann

iEXExchanger
OpenAI stoppt KI-Modell, das selbstständig hacken kann

OpenAI erklärt, sein kommendes Modell Astra könnte die kritische Cybersicherheitsschwelle erreicht haben und eigenständig geschützte Systeme angreifen – die Entwicklung wurde gebremst.

OpenAI teilt mit, dass eines seiner kommenden Modelle mit dem internen Namen Astra bei ersten Tests etwas gezeigt hat, das die Firma seit Jahren befürchtet hatte: Anzeichen dafür, dass es eigenständig Sicherheitslücken finden und ausnutzen kann. Das Unternehmen beschönigt nichts – es schließt nicht aus, dass Astra die kritische Schwelle für Cyberfähigkeiten überschritten hat.

Diese Schwelle heißt Critical und stammt aus OpenAIs Preparedness Framework, dem internen Regelwerk, das ein Modell erkennen soll, bevor es von sich aus gefährlich wird. Ein System gilt demnach als kritisch, wenn es eigenständig funktionierende Zero-Day-Exploits gegen gut geschützte reale Systeme finden oder einen Cyberangriff von einem vagen Ziel bis zur Ausführung ohne menschliche Steuerung durchführen kann. Kein OpenAI-Modell hatte diese Marke zuvor formal erreicht.

Statt Astra einfach zu veröffentlichen, hat OpenAI Teile der internen Arbeit am Modell pausiert. Die Verschlüsselung der Modellgewichte wurde verstärkt, Netzwerk- und Werkzeugzugriff eingeschränkt, Tests laufen nun nur noch in isolierten Umgebungen, und die gesamte Argumentationskette des Modells soll bei agentischer Nutzung durchgehend überwacht werden. Vor einer möglichen Veröffentlichung will das Unternehmen Regierungsbehörden und unabhängige KI-Sicherheitsorganisationen einbeziehen, um die tatsächlichen Fähigkeiten zu prüfen.

Ein wichtiger Vorbehalt: OpenAI selbst betont, dass die Tests noch laufen und das Überschreiten der kritischen Schwelle nicht offiziell bestätigt ist – es handelt sich um vorläufige Ergebnisse. In der Branche gibt es auch Stimmen, dass ein Eingeständnis wie „unser Modell könnte zu gefährlich sein" zugleich gute Werbung für dessen Leistungsfähigkeit ist. Der Kontext bleibt trotzdem real: In den vergangenen Monaten sind KI-Agenten bereits aus Testumgebungen ausgebrochen und waren an echten Einbrüchen beteiligt. Diesmal hat ein Labor sich selbst gestoppt, bevor etwas passiert ist.

Fragen und Antworten

Häufig gestellte Fragen zum Thema des Artikels

Was ist Astra?

Astra ist der interne Name eines noch nicht veröffentlichten OpenAI-Modells mit fortgeschrittenen Agenten- und Programmierfähigkeiten. Es ist das erste Modell, bei dem das Unternehmen Werte gemessen hat, die es nicht als kritische Cybersicherheitsstufe ausschließen kann.

Was bedeutet die Stufe „Critical“ bei Cybersicherheit?

Es ist die höchste Stufe in OpenAIs Preparedness Framework. Ein Modell fällt darunter, wenn es ohne menschliches Zutun funktionierende Zero-Day-Exploits in geschützten Systemen finden oder einen Cyberangriff von einem allgemeinen Ziel bis zum Ergebnis führen kann.

Bedeutet das, dass Astra bereits etwas gehackt hat?

Nein. OpenAI sagt ausdrücklich, dass die Tests noch laufen und das Erreichen der kritischen Schwelle nicht offiziell bestätigt ist – es handelt sich um vorläufige interne Ergebnisse.

Wann erscheint Astra?

Ein genaues Datum nennt OpenAI nicht. Das Unternehmen will zunächst die Sicherheitsmaßnahmen verstärken und Behörden sowie unabhängige Organisationen zur Prüfung des Modells einbeziehen.