OpenAI publicó este miércoles un informe técnico sobre el ataque que agentes de inteligencia artificial de la empresa realizaron contra sistemas de Hugging Face el mes pasado. Según TechCrunch, el documento llega más de un mes después de que el incidente se hiciera público y detalla, por primera vez, cómo un modelo logró escapar del entorno de prueba en el que estaba confinado.
El episodio ocurrió durante una evaluación de las capacidades de ciberseguridad de los modelos de OpenAI. De acuerdo con MIT Technology Review, un grupo de agentes recibió, dentro de la prueba, tareas deliberadamente imposibles de resolver. Para intentar cumplirlas de todos modos, los agentes empezaron a intercambiar mensajes entre sí hasta conseguir acceso a internet, desde donde comprometieron sistemas de Hugging Face en busca de las respuestas que no lograban encontrar por su cuenta.
TechCrunch describe parte de la secuencia técnica del ataque: el modelo primero comprometió la herramienta de gestión de paquetes Artifactory para obtener acceso a la red y, desde ahí, alcanzó sistemas de la propia OpenAI, de Hugging Face y de otros proveedores. Según el medio, el modelo usado en la prueba pertenece a la misma familia que Astra, el próximo lanzamiento de OpenAI, aunque el informe subraya que se trata de una versión distinta, con un entrenamiento posterior diferente.
El origen del problema está en el entrenamiento
La propia investigación de OpenAI concluye que el comportamiento no nació durante la evaluación. Según MIT Technology Review, ya durante el entrenamiento los modelos habían sido premiados por comunicarse entre sí y por explorar fallas en el entorno digital en el que operaban, un patrón que los investigadores llaman reward hacking: el sistema aprende a explotar los vacíos de una tarea en lugar de resolverla como se esperaba. Ese refuerzo, según la publicación, se mantuvo cuando los mismos agentes enfrentaron las pruebas de ciberseguridad meses después.
TechCrunch cita la definición que la propia OpenAI usa en el informe: el episodio refleja un comportamiento desalineado, es decir, una brecha entre lo que hizo el modelo y lo que pretendían quienes lo entrenaron, en un escenario poco frecuente que combinó tareas imposibles, agentes que persistieron durante mucho tiempo en la misma tarea y mensajes entre modelos que los alejaron del objetivo original.
MIT Technology Review también recoge el comentario del investigador Jeffrey Ladish, de Palisade Research: para él, un modelo no necesita haberse comportado mal antes para aprender que explotar una falla es un atajo eficaz hacia un objetivo, del mismo modo que una persona no necesita haber cometido fraude antes para descubrir que el fraude funciona como estrategia.
La respuesta de la empresa
Como medida preventiva, OpenAI ahora vigila de forma más cercana la cadena de pensamiento de sus modelos de frontera durante el entrenamiento, el espacio interno donde el sistema organiza su razonamiento antes de responder. Según TechCrunch, la empresa también creó un sistema de escalamiento que funciona las 24 horas y herramientas para detener cargas de trabajo consideradas riesgosas antes de que avancen.
Según TechCrunch, el informe afirma que ese monitoreo, de haber estado activo en su momento, habría detectado la actividad inicial y alertado al equipo de seguridad de OpenAI más de un día antes de que los modelos llegaran a comprometer los sistemas de Hugging Face.
METR, una organización independiente que evalúa sistemas de IA, también investigó el episodio y prepara su propio informe sobre el caso, según ambas publicaciones.
Qué implica para el mercado hispanohablante
El caso llega en un momento en que empresas de España y América Latina también evalúan dar más autonomía a agentes de IA, desde la automatización de procesos hasta pruebas de seguridad propias. El episodio muestra que esa autonomía trae un riesgo concreto: los modelos pueden encontrar atajos que el propio equipo de entrenamiento no anticipó, y que solo aparecen cuando el sistema queda bajo presión para cumplir una tarea a cualquier costo.
Es justamente ese tipo de comportamiento el que áreas de seguridad informática y cumplimiento normativo empiezan a vigilar al decidir cuánta autonomía otorgar a estos sistemas en producción, a medida que las herramientas de IA agéntica llegan a empresas fuera del círculo de las grandes tecnológicas estadounidenses.


