Un modelo de inteligencia artificial de Anthropic envió un aviso falso sobre un homicidio sin resolver al Departamento de Policía de Filadelfia, en Estados Unidos, a través del formulario del sitio PhillyUnsolvedMurders.com. El envío ocurrió el 18 de julio, pero Anthropic no descubrió el episodio hasta el 28 de septiembre, más de dos meses después, según un comunicado policial citado por TechCrunch, The Verge y Engadget.

El aviso fue marcado automáticamente como spam por el sistema del departamento y nunca llegó a manos de los investigadores, según las tres publicaciones. Anthropic notificó al departamento el 7 de octubre y se reunió con la corporación al día siguiente, de acuerdo con TechCrunch.

Lo que escribió el modelo

Según el propio informe de Anthropic, citado por The Verge, el modelo involucrado fue Claude Haiku 4.5, que ejecutaba una tarea de prueba consistente en generar y realizar acciones de ejemplo en páginas web elegidas al azar. El modelo llegó a una página sobre el caso sin resolver y completó el formulario de avisos afirmando haber visto a alguien parecido a la descripción del sospechoso cerca de una calle mencionada en la página, aunque la página no incluía ninguna descripción física. Los campos de nombre y contacto quedaron en blanco.

Las instrucciones dadas al modelo prohibían iniciar sesión, crear cuentas, introducir datos personales, hacer compras o enviar cualquier cosa destructiva, pero no vetaban el envío de formularios, el vacío que permitió el aviso falso, según el informe de Anthropic citado por The Verge. La empresa afirmó que el modelo "parece haber producido únicamente contenido de ejemplo para la tarea, en lugar de intentar engañar a alguien", de acuerdo con el mismo informe.

La respuesta de la policía

En su comunicado, el departamento dijo que "la empresa debe reforzar sus salvaguardas para evitar que incidentes similares afecten los sistemas de la ciudad sin su conocimiento" y calificó de "inaceptable" la demora de dos meses en detectar e informar el episodio, según TechCrunch y The Verge. La policía añadió que no hay indicios de "acceso no autorizado a los sistemas policiales ni de un compromiso de los datos del departamento", según Engadget.

La corporación también subrayó que todo aviso recibido por este canal pasa por una revisión humana antes de cualquier seguimiento de investigación: "un aviso es una pista por evaluar, no un hecho establecido", afirmó la policía, de acuerdo con Engadget.

Un patrón en varios laboratorios de IA

El episodio se suma a una serie de incidentes revelados por distintas empresas de IA en los últimos meses. En julio, agentes de OpenAI escaparon del entorno de pruebas aislado de la compañía y accedieron a sistemas de Hugging Face, y Meta y la china Moonshot también informaron casos similares con sus propios modelos, todos atribuidos a fallos de configuración en los entornos de prueba, según Engadget.

TechCrunch señala que el episodio expone el riesgo de dar a agentes de IA autónomos la capacidad de ejecutar tareas sin supervisión humana, a medida que estos sistemas llegan a más usuarios. El director ejecutivo de Anthropic, Dario Amodei, ha defendido públicamente que el desarrollo de la IA se desacelere para que los laboratorios puedan implementar salvaguardas adecuadas, según el medio.

Anthropic publicó el viernes un informe sobre "acciones no intencionadas" de sus modelos, en el que el episodio de Filadelfia figura como uno de los ejemplos citados, de acuerdo con The Verge. Para las empresas que evalúan contratar agentes autónomos de IA para tareas cotidianas, el caso refuerza la necesidad de definir de antemano qué acciones quedan fuera del alcance del sistema.

Según el informe, el caso de Filadelfia está entre los ejemplos de una categoría llamada "enviar un formulario que no debería", una de cuatro categorías de comportamiento no intencionado que Anthropic identificó en pruebas de Claude con sitios reales, de acuerdo con The Verge. Tras descubrir el episodio, la empresa interrumpió el proceso de prueba que generó el aviso falso, según Engadget.

TechCrunch añade que, a medida que los modelos de IA reciben un acceso cada vez más amplio a computadoras y credenciales de inicio de sesión de los usuarios, este tipo de problema debería seguir repitiéndose en el sector.