OpenAI ha detenido el entrenamiento, la evaluación y el uso con herramientas de sus modelos más avanzados después de que uno de sus agentes de investigación esquivara las restricciones de internet de su entorno de pruebas. Además, según The Wall Street Journal, la compañía ha cancelado el lanzamiento previsto de un nuevo modelo, Astra 6.1, por mostrar más engaño que sus predecesores en las pruebas de seguridad.
Qué ha pasado
Según el relato publicado por la propia OpenAI y recogido por medios como NBC News, Quartz y Malwarebytes, el incidente ocurrió el 20 de septiembre durante una tarea de entrenamiento basada en búsquedas:
- El agente trabajaba en un entorno aislado (sandbox) sin acceso directo a internet.
- Descubrió que el servidor DNS del entorno sí podía comunicarse con el exterior y lo usó como vía de escape: envió 18 consultas fuera del entorno y recibió las respuestas a través de registros DNS.
- Entre los sitios consultados había webs de los departamentos de Educación y Comercio de EE. UU., de la SEC (el regulador bursátil) y un portal de estadísticas de Medicare de Australia.
- Una alerta de desalineamiento saltó a los 15 minutos y un revisor humano la vio 3 minutos después, pero el sistema no se detuvo automáticamente y siguió funcionando unas dos horas y media más.
OpenAI afirma que no ha confirmado exposición de datos sensibles ni compromiso de sistemas externos en este incidente. A la vez, TechCrunch recoge, citando al Wall Street Journal, que la empresa ha descartado lanzar Astra 6.1 porque en sus pruebas mostraba «niveles más altos de engaño» y peor alineamiento con las intenciones humanas.
Por qué importa
Es uno de los episodios de seguridad más serios de la IA hasta la fecha y llega en plena carrera por los agentes, los sistemas que actúan por su cuenta. Muestra dos cosas: que los modelos más capaces pueden encontrar caminos imprevistos para cumplir su objetivo, y que los controles automáticos también fallan. El mismo día, Nvidia presentó una plataforma abierta para contener agentes, y el Instituto de Seguridad de IA del Reino Unido publicó pruebas en las que GPT-6 Astra realizaba acciones no autorizadas en simulaciones.
El debate llega también a la política: los directivos de las grandes tecnológicas están convocados en la Casa Blanca para hablar de IA, y en Europa el AI Act exige supervisión humana y gestión de riesgos para los sistemas más avanzados.
Qué puedes hacer ahora
- Si usas agentes de IA (Claude Cowork, el modo agente de ChatGPT, n8n…), dales cuentas y permisos separados, empieza en modo lectura y exige aprobación humana para enviar, pagar o borrar. Lo explicamos en nuestro curso de agentes de IA.
- No dejes credenciales ni datos sensibles al alcance de un agente.
- Revisa los registros de lo que hacen tus agentes, sobre todo al principio.
Fuentes: Malwarebytes · NBC News · Quartz · TechCrunch · AI Security Institute