Anthropic anunció el viernes que eligió a Accenture como su primera "evaluadora integrada" (embedded evaluator): personal externo que pasa a trabajar dentro de la empresa para revisar la seguridad de sus modelos de inteligencia artificial, según CNBC y TechCrunch.
La alianza es el primer paso concreto para poner en marcha el plan de tres etapas que el CEO de Anthropic, Dario Amodei, publicó el fin de semana anterior para frenar el ritmo de desarrollo de la IA de frontera, de acuerdo con ambos medios.
1.000 millones de dólares en cinco años
Anthropic y Accenture se comprometieron a invertir al menos 1.000 millones de dólares durante los próximos cinco años en el proyecto, según CNBC y TechCrunch. Según el comunicado de Anthropic, citado por CNBC, Accenture incorporará personal de su división de inteligencia artificial, Faculty, dentro de Anthropic.
Según TechCrunch y CNBC, el personal de Faculty evaluará y pondrá a prueba (red-team) los modelos de Anthropic, realizará evaluaciones de alineación y verificará si el comportamiento de los sistemas coincide con valores humanos.
El primer paso de un plan mayor
La primera etapa del plan de Amodei otorga a evaluadores externos un acceso equivalente al de un empleado, para verificar prácticas de seguridad y reportar incidentes, según CNBC. Anthropic dijo que se comprometió a este paso de forma "unilateral" y animó a otras empresas de IA a hacer lo mismo.
Según CNBC y TechCrunch, Anthropic también está en conversaciones con la organización sin fines de lucro METR y otros terceros para sumar más evaluadores. La empresa afirmó que la alianza con Accenture no es exclusiva.
Qué es el red-teaming
El término "red-teaming", usado por CNBC y TechCrunch, describe la práctica de formar un equipo cuya función es intentar romper las defensas de un sistema a propósito, simulando ataques o usos indebidos antes de que ocurran fuera del laboratorio. Aplicado a modelos de inteligencia artificial, significa probar si el sistema puede ser inducido a comportarse de forma peligrosa o a ignorar sus propias reglas de seguridad.
Tanto CNBC como TechCrunch reportaron que todavía no existen estándares definidos para el nivel de acceso o la forma de comunicación de los evaluadores externos, y que Anthropic espera que ese modelo evolucione a medida que el sector madure.
Según TechCrunch, la elección de Accenture sorprendió a parte de los observadores del mercado, ya que el debate sobre evaluadores integrados hasta ahora giraba en torno a organizaciones dedicadas específicamente a la investigación de seguridad en IA. El medio también citó a críticos para quienes el plan de autorregulación propuesto por Amodei podría servir para que la industria evite una fiscalización más estricta, una lectura que Anthropic rechaza.
Según TechCrunch, las evaluaciones externas ya forman parte del proceso de lanzamiento de nuevos modelos de lenguaje, pero el formato de evaluador integrado amplía ese seguimiento más allá del lanzamiento, con el personal de Faculty manteniendo una presencia constante dentro de Anthropic. El medio también informó que una de las opciones en discusión con METR y otras organizaciones es probar elementos de este modelo de evaluación usando financiamiento propio de los evaluadores, antes de cualquier arreglo de financiamiento más amplio.
Quién paga la cuenta
Anthropic dijo que, por ahora, financiará directamente el trabajo de Accenture, ya que todavía no existe un fondo público o conjunto del sector para pagar este tipo de evaluación, según CNBC. La empresa afirmó que espera que, a largo plazo, ese financiamiento provenga de fuentes públicas o compartidas entre compañías.
Anthropic subrayó, según CNBC y TechCrunch, que la presencia de evaluadores externos no reduce su propia responsabilidad sobre la seguridad de sus modelos de inteligencia artificial.


