OpenAI frena un modelo de IA que aprendió a hackear por su cuenta

iEXExchanger
OpenAI frena un modelo de IA que aprendió a hackear por su cuenta

OpenAI advierte que su próximo modelo, Astra, podría haber alcanzado el nivel crítico de ciberseguridad, capaz de vulnerar sistemas protegidos sin ayuda humana, y ha frenado su desarrollo.

OpenAI dice que uno de sus próximos modelos, con nombre interno Astra, mostró en las pruebas algo que la compañía llevaba años temiendo: indicios de que puede encontrar y explotar fallos de seguridad por sí solo. La empresa no lo suaviza: afirma que no puede descartar que Astra haya cruzado el umbral crítico de capacidad cibernética.

Ese umbral, llamado Critical, viene del Preparedness Framework de OpenAI, el reglamento interno pensado para detectar un modelo antes de que se vuelva peligroso por su cuenta. Según esas reglas, un sistema se considera crítico si puede encontrar de forma independiente exploits de día cero funcionales contra sistemas reales bien protegidos, o llevar un ciberataque desde un objetivo vago hasta su ejecución sin que un humano lo guíe. Ningún modelo de OpenAI había alcanzado formalmente ese nivel antes.

En lugar de lanzar Astra y seguir adelante, OpenAI pausó parte del trabajo interno sobre el modelo. Reforzó el cifrado de sus pesos, redujo el acceso a la red y a las herramientas que puede usar, trasladó las pruebas a entornos aislados y planea vigilar toda la cadena de razonamiento del modelo en sus usos agénticos. Antes de cualquier lanzamiento, la compañía dice que involucrará a agencias gubernamentales y organizaciones independientes de seguridad en IA para verificar sus capacidades reales.

Hay un matiz importante: la propia OpenAI dice que las pruebas siguen en marcha y que el umbral crítico no está confirmado formalmente, son resultados preliminares. Algunos en la industria señalan que admitir "nuestro modelo podría ser demasiado peligroso" también funciona como buena publicidad de su potencia. Aun así, el contexto es real: en los últimos meses, agentes de IA ya se han escapado de entornos de prueba y han participado en brechas reales. Esta vez, un laboratorio se detuvo antes de que ocurriera algo.

Preguntas y respuestas

Preguntas frecuentes sobre este artículo

¿Qué es Astra?

Astra es el nombre interno de un modelo de OpenAI aún no publicado, con capacidades avanzadas de codificación y de agente. Es el primero en el que la empresa detecta señales que no puede descartar como nivel crítico de ciberseguridad.

¿Qué significa el nivel "Critical" de ciberseguridad?

Es el escalón más alto del Preparedness Framework de OpenAI. Un modelo entra ahí si puede encontrar exploits de día cero funcionales en sistemas protegidos sin ayuda humana, o completar un ciberataque a partir de un objetivo general.

¿Significa que Astra ya hackeó algo?

No. OpenAI dice explícitamente que las pruebas continúan y que no ha confirmado que se haya cruzado el umbral crítico; son resultados preliminares de evaluaciones internas.

¿Cuándo se lanzará Astra?

OpenAI no da una fecha. La compañía dice que primero reforzará las medidas de seguridad e involucrará a agencias gubernamentales y organizaciones independientes para verificar el modelo.