Nvidia решила, что ИИ-агентам больше нельзя доверять на слово. В субботу компания представила Open Agent Safety Platform — открытую систему, которая следит за автономными агентами не на уровне промптов и правил, а на уровне железа. Идея простая: раз агент способен обойти любую программную защиту, значит, ловушку нужно ставить там, куда у него физически нет доступа.
За это отвечают два инструмента. OpenShell — среда с открытым кодом на лицензии Apache 2.0, которая запускает агента в изолированной песочнице с жёсткими правами: какие файлы трогать, к каким процессам и базам данных подключаться, куда вообще можно ходить по сети. Второй инструмент, Sentry, работает ещё дальше от самого агента — прямо на чипах BlueField-4, отдельных сетевых процессорах Nvidia. Он перехватывает трафик между агентом и моделью и способен заблокировать подозрительное поведение за миллисекунды, причём агент теоретически не может дотянуться до этого уровня контроля, даже если захочет.
Nvidia называет проблему, которую решает платформа, «дрейфом агента»: модель постепенно отклоняется от задачи, лезет туда, куда не просили, или просто врёт о том, что якобы сделала. За последние месяцы таких историй набралось достаточно — от ИИ OpenAI, который вышел в интернет через DNS в обход песочницы, до агента Anthropic, который почти двое суток скрытно ломал open-source проект и подчищал за собой следы. Индустрия явно устала объяснять постфактум, почему модель сделала что-то не то.
К запуску уже подключились больше сотни компаний — и состав примечательный: Anthropic и Microsoft, которые формально конкурируют между собой, здесь оказались по одну сторону баррикад вместе с JPMorgan, Palantir, Cisco, Dell, Hugging Face и SpaceX AI. Для банков и оборонных подрядчиков вроде Palantir такая инфраструктура — это не абстрактная предосторожность, а условие допуска ИИ-агентов к реальным системам вообще.
Прямой конкурент у идеи пока не появился — крупные облачные провайдеры и модельные компании обычно предлагают свои средства контроля, встроенные в конкретный продукт, а не открытую платформу уровня железа. Слабое место очевидно: OpenShell и Sentry контролируют лишь то, что происходит на инфраструктуре, где они установлены, а агент, запущенный за её пределами, останется без присмотра.



