Un equipo de tres investigadores de seguridad de la startup Hacktron AI vulneró sistemas internos de OpenAI con la ayuda de Claude, el chatbot de Anthropic, dentro de un programa de recompensas por fallos (bug bounty) de la propia OpenAI, según The Guardian, TechCrunch, The Verge y TechRadar.

Todo el proceso, desde el descubrimiento de la falla hasta el acceso al repositorio de código de OpenAI en GitHub, tardó menos de 72 horas, según TechCrunch, The Verge y TechRadar.

Cómo ocurrió el ataque

La puerta de entrada fue una falla en Discourse, el software de terceros que aloja el foro de la comunidad de OpenAI, según TechCrunch, The Verge y TechRadar. El problema estaba en una biblioteca llamada libheif, usada para convertir imágenes en formato HEIC/HEIF —el estándar de fotos del iPhone— a archivos JPEG comunes.

Según TechCrunch, una imagen manipulada a propósito engañaba a libheif y permitía ejecutar código en el servidor del foro. La falla ya había sido corregida meses antes por los propios desarrolladores de la biblioteca, pero nunca recibió un número oficial de identificación de vulnerabilidad (CVE), lo que según Hacktron podría explicar por qué Discourse seguía usando la versión vulnerable.

Con el control del servidor de Discourse, los investigadores tomaron la cuenta de ChatGPT de un empleado de OpenAI. Como el Codex de ese empleado estaba conectado al GitHub de la empresa, el equipo obtuvo acceso al repositorio interno de OpenAI, según TechCrunch y The Verge. Los investigadores afirman que llegaron a tener acceso al código, pero no lo descargaron: solo enviaron un cambio inofensivo (pull request) para demostrar el acceso, de acuerdo con The Guardian y The Verge.

El salto de capacidad entre versiones de Claude

Según TechCrunch y TechRadar, el equipo primero probó con Claude Opus 4.8, una versión liberada para investigadores de ciberseguridad, pero el modelo "tuvo dificultades en varias sesiones para producir un exploit funcional", según el propio relato de Hacktron. Eso cambió cuando Anthropic lanzó Claude Opus 5: con el nuevo modelo, el equipo logró crear un exploit funcional en pocas horas.

OpenAI confirmó que corrigió las vulnerabilidades explotadas y pagó 6.500 dólares a Hacktron a través de su programa de recompensas, según The Guardian, TechCrunch, The Verge y TechRadar. El caso fue reportado primero por The Wall Street Journal.

La cronología del ataque

Según TechCrunch, los investigadores encontraron la vía de entrada a través de Discourse el 25 de julio. The Verge, por su parte, relata que Anthropic lanzó Claude Opus 5 en la noche del 24 de julio, y que hacia las 10 de la mañana siguiente el equipo ya había logrado ejecutar código remotamente en la instancia de Discourse usada por OpenAI, una señal de cuánto aceleró el proceso el nuevo modelo respecto a los intentos anteriores con Opus 4.8.

La misma falla en otras empresas

La vulnerabilidad en libheif no era exclusiva de OpenAI: según TechRadar y The Verge, el mismo tipo de falla afectaba a otras plataformas que también dependen de esa biblioteca para procesar imágenes, entre ellas Slack, Meta y GitHub Enterprise. De acuerdo con ambos medios, adaptar el ataque a cada una de esas empresas llevó poco tiempo y costó menos de 3.000 dólares en tokens de IA en total.

Pese a haber probado la falla contra varios objetivos, los investigadores afirman que solo una empresa detectó la actividad: Shopify, según TechRadar y The Verge, incluso después de que se enviaran miles de imágenes para forzar el error en sus sistemas de procesamiento.

Un episodio más en una serie de incidentes

El caso se suma a otros incidentes de seguridad relacionados con IA este año. En julio, agentes autónomos creados por la propia OpenAI vulneraron Hugging Face durante una prueba de ciberseguridad, y la empresa no lo notó durante más de una semana, según The Guardian.