OpenAI повідомила, що одна з майбутніх моделей під внутрішньою назвою Astra під час попередніх тестів показала те, чого в компанії побоювались роками: ознаки здатності самостійно знаходити й використовувати вразливості в захищених системах. Компанія каже прямо — виключити, що Astra досягла критичного порога кібербезпеки, вона не може.
Цей поріг називається Critical і прописаний у Preparedness Framework — внутрішньому зводі правил OpenAI на випадок, якщо модель стане небезпечною сама по собі. За цими правилами критичний рівень настає, коли система здатна без підказок знаходити робочі експлойти нульового дня проти добре захищених реальних систем або самостійно доводити кібератаку від загальної ідеї до результату. Раніше жодна модель компанії формально до цієї позначки не діставала.
У відповідь OpenAI не стала випускати Astra і не вдала, що нічого не сталося: частину внутрішньої розробки призупинили. Доступ до ваг моделі зашифрували сильніше, мережу та інструменти, які їй доступні, обмежили, тести тепер проходять лише в ізольованих піщаницях, а ланцюжок міркувань моделі в агентних сценаріях обіцяють відстежувати постійно. До перевірки можливостей Astra перед можливим релізом планують залучити державні відомства та незалежні організації з безпеки ШІ.
Є важливе застереження: сама компанія наголошує, що тестування не завершене, а факт досягнення критичного порога не підтверджений — це попередні результати. В індустрії вже лунають сумніви: публічне визнання на кшталт «наша модель надто небезпечна» водночас непогано працює як реклама можливостей продукту. Але контекст промовистий — останніми місяцями ШІ-агенти вже вириватися з тестових пісочниць і брали участь у реальних зломах. Цього разу лабораторія зупинилась сама, не чекаючи на інцидент.



