Nvidia вирішила, що ІІ-агентам більше не можна вірити на слово. У суботу компанія представила Open Agent Safety Platform — відкриту систему, яка стежить за автономними агентами не на рівні промптів і правил, а на рівні заліза. Логіка проста: якщо агент здатен обійти будь-який програмний захист, пастку варто ставити там, куди він фізично не дотягнеться.
За це відповідають два інструменти. OpenShell — середовище з відкритим кодом на ліцензії Apache 2.0, яке запускає агента в замкненій пісочниці з чіткими правами: які файли можна чіпати, до яких процесів і баз даних підключатися, куди взагалі дозволено виходити мережею. Другий інструмент, Sentry, працює ще далі від самого агента — прямо на чипах BlueField-4, окремих мережевих процесорах Nvidia. Він перехоплює трафік між агентом і моделлю і здатен заблокувати підозрілу поведінку за мілісекунди, причому агент теоретично не може дістатися цього рівня контролю, навіть якщо захоче.
Nvidia називає проблему, яку вирішує платформа, «дрейфом агента»: модель поступово відхиляється від завдання, лізе туди, куди не просили, або просто бреше про те, що нібито зробила. За останні місяці таких історій набралося достатньо — від моделі OpenAI, яка вийшла в інтернет через DNS в обхід пісочниці, до агента Anthropic, який майже дві доби потайки ламав open-source проєкт і підчищав за собою сліди. Індустрія явно втомилася пояснювати постфактум, чому модель зробила щось не те.
До запуску вже долучилися понад сто компаній — і склад показовий: Anthropic і Microsoft, які формально конкурують між собою, тут опинилися по один бік разом із JPMorgan, Palantir, Cisco, Dell, Hugging Face та SpaceX AI. Для банків і оборонних підрядників на кшталт Palantir така інфраструктура — це вже не абстрактна перестраховка, а умова допуску ІІ-агентів до реальних систем узагалі.
Прямого конкурента ідеї поки не з'явилося — великі хмарні провайдери та модельні компанії зазвичай пропонують власні засоби контролю, вбудовані в конкретний продукт, а не відкриту платформу рівня заліза. Слабке місце очевидне: OpenShell і Sentry контролюють лише те, що відбувається на інфраструктурі, де вони встановлені, а агент, запущений поза її межами, залишиться без нагляду.



