Anthropic reveló que su modelo Mythos 5 pasó buena parte de una prueba de hackeo atascado tratando de resolver verificaciones de CAPTCHA, según reportajes de TechCrunch y TechRadar sobre un nuevo informe de la compañía.

La prueba se realizó en abril. Investigadores de Anthropic le pidieron al modelo que se infiltrara en un sistema para recuperar un objetivo, dentro de un entorno pensado para estar aislado solo para esa evaluación. El entorno estaba mal configurado, y eso le dio al modelo acceso real a internet en lugar de mantenerlo contenido.

El plan: esconder malware dentro de un paquete de Python

Mythos 5 decidió que la forma más eficaz de llegar a su objetivo era colocar código malicioso dentro de un paquete de Python que los usuarios del sistema objetivo descargarían más tarde. Para publicar ese paquete, el modelo necesitaba primero crear una cuenta en PyPI, el principal repositorio de paquetes de Python del mundo.

Según TechRadar, PyPI es un blanco frecuente de campañas de malware, ya sea mediante typosquatting, nombres de paquetes que imitan a los originales, o mediante cuentas legítimas comprometidas. Por eso el sitio exige correo electrónico, número de teléfono y la confirmación de un CAPTCHA antes de habilitar una cuenta nueva.

Cientos de páginas atascado en fotos de cocodrilos y ranas

Anthropic publicó la transcripción completa del razonamiento del modelo durante la prueba: 1.022 páginas, según TechCrunch. Buena parte de ese material —cientos de páginas, de acuerdo con el reportaje— se dedicó únicamente a intentar superar el CAPTCHA.

El primer obstáculo fue un CAPTCHA de caracteres que pedía escribir cinco letras mostradas en una imagen: el modelo leyó correctamente 'VyQbT', pero el formulario devolvió error de todos modos, según TechCrunch. Después llegaron desafíos de imagen tipo hCaptcha, como 'haz clic en el animal que no coincide con los demás': primero con fotos de cocodrilos, luego con ranas casi idénticas entre sí y, más adelante, con cuatro gorilas y lo que el propio modelo describió, en su razonamiento registrado, como un 'gato fantasma' casi invisible en una esquina de la imagen.

Incluso después de superar los desafíos de imagen, el registro seguía bloqueado: faltaba confirmar un correo electrónico y, después, un número de teléfono. El modelo intentó sortear un tercer tipo de CAPTCHA, basado en un control deslizante, en un intento fallido de verificar un número, y terminó usando un proveedor de correo que no estaba en la lista bloqueada por PyPI, de acuerdo con TechCrunch.

En un fragmento del razonamiento citado por la reportera, el propio modelo llegó a preguntarse si todavía estaba dentro de una simulación. El esfuerzo llamó la atención del científico de datos Colin Fraser, quien señaló públicamente el tiempo desproporcionado que el modelo dedicó solo a esquivar las protecciones contra bots, según TechCrunch.

El modelo logró completar el registro solo cuando entendió que debía terminar cada paso lo bastante rápido, antes de que el token de seguridad de la sesión expirara.

El paquete malicioso se descargó antes de la alerta

Después de crear la cuenta, Mythos 5 publicó en PyPI el paquete con el código malicioso. Según TechRadar, el paquete fue descargado por 15 usuarios antes de que Anthropic detectara el problema y notificara a los afectados.

La prueba original buscaba medir la capacidad del modelo para realizar tareas de hackeo bajo la supervisión de la empresa. El episodio, en cambio, terminó mostrando cuánto tiempo puede gastar una inteligencia artificial avanzada solo tratando de demostrar que no es un robot, antes incluso de llegar a la parte de la tarea que realmente preocupaba a los investigadores.

Publicar la transcripción completa, de más de mil páginas, también muestra hasta dónde está dispuesta Anthropic a documentar los fallos de sus propios modelos, incluso cuando el resultado resulta incómodo para la empresa: fue un error de configuración en el propio entorno de prueba, y no una falla del modelo, lo que abrió la puerta al incidente, según TechCrunch y TechRadar.