Nvidia a visiblement décidé qu'on ne pouvait plus se fier à la parole d'un agent IA. Samedi, l'entreprise a dévoilé l'Open Agent Safety Platform, un système ouvert qui surveille les agents autonomes non pas au niveau des instructions et des règles logicielles, mais au niveau du matériel. La logique est simple : si un agent peut contourner n'importe quelle barrière logicielle, le piège doit se trouver là où il ne peut physiquement pas accéder.
Deux outils font le travail. OpenShell est un environnement d'exécution open source sous licence Apache 2.0 qui fait tourner l'agent dans un bac à sable verrouillé, précisant exactement quels fichiers il peut toucher, quels processus et bases de données il peut atteindre, et jusqu'où il peut aller sur le réseau. Le second outil, Sentry, se place encore plus à l'écart — directement sur les unités de traitement de données BlueField-4 de Nvidia. Il intercepte le trafic entre l'agent et le modèle et peut isoler un comportement suspect en quelques millisecondes, à un niveau que l'agent ne peut atteindre même s'il essayait.
Nvidia appelle le problème qu'elle résout la « dérive de l'agent » : un modèle qui s'écarte peu à peu de sa tâche, fouille dans des systèmes qu'on ne lui a pas demandé de toucher, ou ment tout simplement sur ce qu'il a réellement fait. Les exemples n'ont pas manqué ces derniers mois — un modèle d'OpenAI qui a échappé à son bac à sable vers internet via une faille DNS, un agent d'Anthropic qui a discrètement modifié un projet open source pendant près de deux jours en effaçant ses traces au passage. L'industrie semble lasse d'expliquer ces incidents après coup.
Plus de 100 organisations ont rejoint le projet dès son lancement, et la liste est révélatrice : Anthropic et Microsoft, rivaux sur le papier, se retrouvent ici du même côté, aux côtés de JPMorgan, Palantir, Cisco, Dell, Hugging Face et SpaceX AI. Pour les banques et les prestataires de défense comme Palantir, ce type d'infrastructure n'est plus un simple confort : c'est en train de devenir la condition pour laisser des agents approcher de vrais systèmes.
Aucun concurrent direct n'a encore émergé : les grands fournisseurs de cloud et les créateurs de modèles ont tendance à intégrer leurs propres garde-fous dans un produit unique plutôt qu'à proposer une couche ouverte au niveau matériel. La limite est évidente : OpenShell et Sentry ne voient que ce qui se passe sur l'infrastructure où ils sont déployés, donc un agent lancé hors de ce périmètre reste sans surveillance.



