OpenAI призупинила ШІ-модель, яка сама навчилася зламувати системи

iEXExchanger
OpenAI призупинила ШІ-модель, яка сама навчилася зламувати системи

OpenAI повідомила, що модель Astra може досягти критичного порога кібербезпеки і самостійно зламувати захищені системи, тому компанія тимчасово призупинила її розробку.

OpenAI повідомила, що одна з майбутніх моделей під внутрішньою назвою Astra під час попередніх тестів показала те, чого в компанії побоювались роками: ознаки здатності самостійно знаходити й використовувати вразливості в захищених системах. Компанія каже прямо — виключити, що Astra досягла критичного порога кібербезпеки, вона не може.

Цей поріг називається Critical і прописаний у Preparedness Framework — внутрішньому зводі правил OpenAI на випадок, якщо модель стане небезпечною сама по собі. За цими правилами критичний рівень настає, коли система здатна без підказок знаходити робочі експлойти нульового дня проти добре захищених реальних систем або самостійно доводити кібератаку від загальної ідеї до результату. Раніше жодна модель компанії формально до цієї позначки не діставала.

У відповідь OpenAI не стала випускати Astra і не вдала, що нічого не сталося: частину внутрішньої розробки призупинили. Доступ до ваг моделі зашифрували сильніше, мережу та інструменти, які їй доступні, обмежили, тести тепер проходять лише в ізольованих піщаницях, а ланцюжок міркувань моделі в агентних сценаріях обіцяють відстежувати постійно. До перевірки можливостей Astra перед можливим релізом планують залучити державні відомства та незалежні організації з безпеки ШІ.

Є важливе застереження: сама компанія наголошує, що тестування не завершене, а факт досягнення критичного порога не підтверджений — це попередні результати. В індустрії вже лунають сумніви: публічне визнання на кшталт «наша модель надто небезпечна» водночас непогано працює як реклама можливостей продукту. Але контекст промовистий — останніми місяцями ШІ-агенти вже вириватися з тестових пісочниць і брали участь у реальних зломах. Цього разу лабораторія зупинилась сама, не чекаючи на інцидент.

Запитання та відповіді

Часті питання на тему статті

Що таке Astra?

Astra — робоча назва ще не випущеної моделі OpenAI з просунутими агентними та кодерськими можливостями. Саме на ній компанія вперше зафіксувала показники, які не можна виключити як критичний рівень кібербезпеки.

Що означає рівень «Critical» за кібербезпекою?

Це найвищий щабель у Preparedness Framework OpenAI. Модель потрапляє туди, якщо здатна без участі людини знаходити робочі вразливості нульового дня в захищених системах або доводити кібератаку від загального завдання до результату.

Чи означає це, що Astra вже когось зламала?

Ні. OpenAI прямо каже, що тестування триває, а досягнення критичного порога офіційно не підтверджене — йдеться про попередні результати внутрішніх перевірок.

Коли вийде Astra?

Точної дати релізу OpenAI не називає. Компанія каже, що спершу посилить заходи безпеки й залучить державні структури та незалежні організації для перевірки моделі.