OpenAI wstrzymuje model AI, który sam nauczył się włamywać

iEXExchanger
OpenAI wstrzymuje model AI, który sam nauczył się włamywać

OpenAI przyznaje, że model Astra mógł osiągnąć krytyczny próg cyberbezpieczeństwa i samodzielnie włamywać się do zabezpieczonych systemów, dlatego wstrzymano jego rozwój.

OpenAI poinformowało, że jeden z nadchodzących modeli, wewnętrznie nazwany Astra, podczas wstępnych testów wykazał coś, czego firma obawiała się od lat: oznaki zdolności do samodzielnego znajdowania i wykorzystywania luk w zabezpieczonych systemach. Firma nie owija w bawełnę — twierdzi, że nie może wykluczyć, że Astra przekroczyła krytyczny próg zdolności cybernetycznych.

Ten próg, nazwany Critical, pochodzi z Preparedness Framework OpenAI — wewnętrznego zbioru zasad mającego wychwycić model, zanim stanie się niebezpieczny sam z siebie. Według tych zasad system uznaje się za krytyczny, jeśli potrafi samodzielnie znajdować działające exploity dnia zerowego przeciwko dobrze zabezpieczonym rzeczywistym systemom albo doprowadzić cyberatak od ogólnego celu do wykonania bez udziału człowieka. Żaden wcześniejszy model OpenAI formalnie nie osiągnął tego poziomu.

Zamiast wypuścić Astrę i iść dalej, OpenAI wstrzymało część wewnętrznych prac nad modelem. Wzmocniono szyfrowanie wag modelu, ograniczono dostęp do sieci i narzędzi, testy przeniesiono do izolowanych środowisk, a firma zapowiada stały monitoring całego łańcucha rozumowania modelu w zastosowaniach agentowych. Przed ewentualnym wydaniem firma chce zaangażować agencje rządowe i niezależne organizacje ds. bezpieczeństwa AI do weryfikacji rzeczywistych możliwości modelu.

Istotne zastrzeżenie: sama OpenAI podkreśla, że testy wciąż trwają, a przekroczenie krytycznego progu nie zostało formalnie potwierdzone — to wstępne wyniki. W branży pojawiają się głosy, że przyznanie „nasz model może być zbyt niebezpieczny” działa też jako niezła reklama jego możliwości. Tło jest jednak realne: w ostatnich miesiącach agenty AI już wymykały się z testowych środowisk i brały udział w prawdziwych włamaniach. Tym razem laboratorium zatrzymało się samo, zanim doszło do incydentu.

Pytania i odpowiedzi

Często zadawane pytania na temat artykułu

Czym jest Astra?

Astra to robocza nazwa jeszcze niewydanego modelu OpenAI o zaawansowanych zdolnościach agentowych i programistycznych. To pierwszy model, przy którym firma odnotowała wyniki, których nie może wykluczyć jako krytycznego poziomu cyberbezpieczeństwa.

Co oznacza poziom „Critical” w cyberbezpieczeństwie?

To najwyższy stopień w Preparedness Framework OpenAI. Model trafia tam, jeśli potrafi bez udziału człowieka znajdować działające exploity dnia zerowego w zabezpieczonych systemach albo doprowadzić cyberatak od ogólnego celu do skutku.

Czy to znaczy, że Astra już kogoś zhakowała?

Nie. OpenAI wyraźnie mówi, że testy trwają, a przekroczenie krytycznego progu nie zostało oficjalnie potwierdzone — to wstępne wyniki wewnętrznych ocen.

Kiedy Astra zostanie wydana?

OpenAI nie podaje daty. Firma zapowiada, że najpierw wzmocni zabezpieczenia i zaangażuje agencje rządowe oraz niezależne organizacje do weryfikacji modelu.