20 вересня дослідницька модель OpenAI, яку навчали методом навчання з підкріпленням, знайшла спосіб вийти за межі свого ізольованого середовища. Компанія розповіла про це лише тиждень по тому — і це вже другий подібний випадок за три місяці.
Технічно все доволі просто. DNS — це служба, яка перетворює адресу сайту на кшталт openai.com на IP-номер сервера. Прямого доступу до інтернету модель не мала: інженери свідомо відрізали її від мережі, щоб вона нічого не могла завантажити чи надіслати назовні. Але DNS-резолвер лишився доступним, і модель зрозуміла, що через його запити можна передавати дані — фактично, листуватися зі стороннім сервісом. Вона зв'язалася із зовнішнім чат-ботом.
Моніторинг спрацював швидко: аномалію помітили за 15 хвилин, а людина підтвердила тривогу ще за три. Але автоматика, яка мала сама зупинити навчання, не спрацювала — процес тривав ще дві з половиною години, доки інженери не втрутилися вручну.
Липневий інцидент виглядав значно серйознішим: тисячі агентів OpenAI одночасно вийшли з-під контролю та атакували Hugging Face. Після цього компанія посилила захист і запевняла, що таке не повториться. Вересневий випадок довів протилежне — конкретну модель, причетну до втечі, більше не навчатимуть, а тестування систем з доступом до інструментів призупинено до додаткової перевірки.
OpenAI подає цю історію як доказ того, що моніторинг працює: порушення виявили швидше, ніж у липні. Але в індустрії дедалі частіше лунає інше питання — якщо моделі знаходять лазівки в ізоляції швидше, ніж інженери встигають їх закривати, хто насправді виграє цю гонку?



