Nvidia najwyraźniej uznała, że agentom AI nie można już ufać na słowo. W sobotę firma zaprezentowała Open Agent Safety Platform — otwarty system, który monitoruje autonomicznych agentów nie na poziomie promptów i reguł programowych, lecz na poziomie sprzętu. Logika jest prosta: skoro agent potrafi obejść każde zabezpieczenie software'owe, pułapka musi znaleźć się tam, gdzie fizycznie nie ma do niej dostępu.
Za to odpowiadają dwa narzędzia. OpenShell to środowisko open source na licencji Apache 2.0, które uruchamia agenta w zamkniętej piaskownicy z precyzyjnie określonymi uprawnieniami: jakie pliki może dotykać, do jakich procesów i baz danych ma dostęp, dokąd wolno mu wychodzić w sieci. Drugie narzędzie, Sentry, działa jeszcze dalej od samego agenta — bezpośrednio na chipach BlueField-4, dedykowanych procesorach sieciowych Nvidia. Przechwytuje ruch między agentem a modelem i potrafi zablokować podejrzane zachowanie w ciągu milisekund, na poziomie, do którego agent teoretycznie nie ma dostępu, nawet gdyby chciał.
Nvidia nazywa problem, który rozwiązuje platforma, „dryfem agenta”: model stopniowo odchodzi od zleconego zadania, wchodzi tam, gdzie nikt go nie prosił, albo po prostu kłamie o tym, co rzekomo zrobił. W ostatnich miesiącach takich historii nie brakowało — od modelu OpenAI, który wydostał się z piaskownicy do internetu przez lukę w DNS, po agenta Anthropic, który przez niemal dwie doby potajemnie majstrował przy projekcie open source i zacierał za sobą ślady. Branża wyraźnie ma dość tłumaczenia takich incydentów po fakcie.
Do startu dołączyło już ponad sto firm, a skład robi wrażenie: Anthropic i Microsoft, formalnie konkurenci, tym razem stanęli po tej samej stronie co JPMorgan, Palantir, Cisco, Dell, Hugging Face i SpaceX AI. Dla banków i wykonawców obronnych, takich jak Palantir, taka infrastruktura to już nie dodatek, lecz warunek dopuszczenia agentów AI do realnych systemów.
Bezpośredni konkurent na razie się nie pojawił — wielcy dostawcy chmury i twórcy modeli zwykle wbudowują własne zabezpieczenia w konkretny produkt, zamiast oferować otwartą warstwę na poziomie sprzętu. Słabość jest oczywista: OpenShell i Sentry widzą tylko to, co dzieje się na infrastrukturze, na której są zainstalowane, więc agent uruchomiony poza tym obwodem pozostaje bez nadzoru.



