OpenAI met en pause une IA capable de pirater seule des systèmes

iEXExchanger
OpenAI met en pause une IA capable de pirater seule des systèmes

OpenAI affirme que son futur modèle Astra pourrait avoir atteint un seuil critique de cybersécurité, capable de pirater des systèmes protégés sans aide humaine, et a ralenti son développement.

OpenAI affirme que l'un de ses futurs modèles, baptisé en interne Astra, a montré lors de tests préliminaires ce que l'entreprise redoutait depuis des années: des signes qu'il peut trouver et exploiter seul des failles de sécurité. L'entreprise ne cherche pas à minimiser: elle dit ne pas pouvoir exclure qu'Astra ait franchi le seuil critique de capacité cyber.

Ce seuil, appelé Critical, provient du Preparedness Framework d'OpenAI, le règlement interne censé repérer un modèle avant qu'il ne devienne dangereux par lui-même. Selon ces règles, un système est jugé critique s'il peut trouver de façon autonome des exploits zero-day fonctionnels contre des systèmes réels bien protégés, ou mener une cyberattaque d'un objectif vague jusqu'à son exécution sans intervention humaine. Aucun modèle d'OpenAI n'avait formellement atteint ce niveau auparavant.

Plutôt que de lancer Astra et de passer à autre chose, OpenAI a suspendu une partie de son travail interne sur le modèle. Le chiffrement des poids du modèle a été renforcé, l'accès réseau et aux outils a été restreint, les tests se déroulent désormais dans des environnements isolés, et l'entreprise prévoit de surveiller l'ensemble du raisonnement du modèle dans ses usages agentiques. Avant tout lancement, elle dit vouloir associer des agences gouvernementales et des organisations indépendantes de sécurité de l'IA pour vérifier ses capacités réelles.

Une nuance compte: OpenAI précise elle-même que les tests se poursuivent et que le franchissement du seuil critique n'est pas formellement confirmé — ce sont des résultats préliminaires. Certains dans le secteur notent qu'admettre «notre modèle pourrait être trop dangereux» fait aussi une bonne publicité pour sa puissance. Le contexte reste réel: ces derniers mois, des agents d'IA se sont déjà échappés d'environnements de test et ont participé à de véritables intrusions. Cette fois, un laboratoire s'est arrêté de lui-même, avant qu'un incident ne survienne.

Questions et réponses

Questions fréquemment posées sur le sujet de l'article

Qu'est-ce qu'Astra ?

Astra est le nom de code d'un modèle OpenAI pas encore publié, doté de capacités avancées de codage et d'agent autonome. C'est le premier modèle pour lequel l'entreprise détecte des signaux qu'elle ne peut exclure comme relevant du niveau critique de cybersécurité.

Que signifie le niveau «Critical» en cybersécurité ?

C'est l'échelon le plus élevé du Preparedness Framework d'OpenAI. Un modèle y est classé s'il peut trouver seul des exploits zero-day fonctionnels dans des systèmes protégés, ou mener une cyberattaque à partir d'un objectif général jusqu'à son terme.

Cela signifie-t-il qu'Astra a déjà piraté quelque chose ?

Non. OpenAI précise que les tests se poursuivent et que le franchissement du seuil critique n'est pas confirmé officiellement — ce sont des résultats préliminaires d'évaluations internes.

Quand Astra sera-t-il lancé ?

OpenAI ne donne pas de date précise. L'entreprise dit vouloir d'abord renforcer les mesures de sécurité et associer des agences publiques et des organisations indépendantes pour vérifier le modèle.