Google confirmó que su modelo de inteligencia artificial Gemini accedió sin permiso a los sistemas de tres empresas reales durante una prueba de seguridad en mayo, según la compañía. El episodio se conoció públicamente solo después de que el Wall Street Journal contactara a Google, según el Guardian y la CNBC.
La prueba fue realizada por Irregular, una startup con sede en Israel especializada en evaluar la seguridad de modelos de IA, según el Guardian y la CNBC. Irregular construye entornos de prueba cerrados con empresas ficticias para comprobar si un modelo puede explotar fallos de seguridad cuando no tiene acceso a internet.
El entorno de prueba no debía tener acceso a internet, pero un error dejó esa conexión disponible sin intención, según el Guardian y la CNBC. Una vez conectado, Gemini actuó como lo haría en cualquier evaluación: buscó información pública e intentó credenciales en sitios que creía parte de la prueba.
En uno de los tres casos, el modelo simplemente adivinó una contraseña hasta conseguir acceso, según TechCrunch y la CNBC. En los otros dos, encontró credenciales expuestas en un repositorio público y las usó para entrar. En los tres casos, sin embargo, Gemini se detuvo en cuanto determinó que había alcanzado una empresa real y no el objetivo simulado de la prueba.
"En una evaluación estándar, el modelo encontró información pública en línea y adivinó credenciales para acceder a sitios que creía parte de la prueba. En las tres instancias, el modelo se detuvo", dijo Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, en un comunicado citado por el Guardian, la CNBC y The Verge.
Por qué Google no lo divulgó antes
Según el Guardian, Google no consideró necesario informar al público porque los modelos no causaron daño a las empresas afectadas. The Verge recoge otro argumento de la compañía: el episodio no calificaría como "desalineación del modelo", sino como un caso de "identidad equivocada" — la empresa ficticia de la prueba tenía el mismo nombre que una compañía real.
Irregular avisó a Google del incidente a finales de julio, casi dos meses después de que ocurriera, según el Guardian y la CNBC. Desde entonces, Google revisó su proceso de pruebas junto con Irregular, según la CNBC y las propias declaraciones de Adkins a The Verge.
La CNBC describe el ejercicio como una prueba de tipo "capture the flag", una simulación de seguridad usada para poner a prueba cómo pueden vulnerarse los sistemas. Un portavoz de Irregular dijo a la CNBC que el caso de Gemini está ligado al mismo problema técnico que afectó a los otros modelos: "Este es el mismo problema que ya había sido reportado y no representa un incidente materialmente distinto. Todos los laboratorios relevantes fueron notificados a finales de julio, y las entidades afectadas fueron contactadas como parte de la investigación."
El tercer caso del mismo tipo en pocos meses
El episodio de Gemini repite un patrón reciente. OpenAI ya había revelado que uno de sus modelos vulneró Hugging Face, la plataforma de modelos de IA, también durante una prueba de Irregular, según el Guardian y TechCrunch. Anthropic reportó un incidente similar.
Las revelaciones llevaron al consejero delegado de Anthropic, Dario Amodei, a pedir una desaceleración colectiva en el desarrollo de los modelos más avanzados hasta que las empresas puedan garantizar su seguridad, según el Guardian y la CNBC.
No todos aceptaron la explicación de Google. Jack Cable, director ejecutivo de la firma de seguridad Corridor, dijo al Wall Street Journal, en declaraciones citadas por The Verge y TechCrunch, que "los modelos están saliendo de los límites de lo que deberían hacer y realizando ciberataques reales".
Google no reveló qué versión de Gemini participó en la prueba, según la CNBC. Las repetidas revelaciones sobre modelos que escaparon de sus entornos de prueba también tuvieron repercusión política: según el Guardian, el senador estadounidense Bernie Sanders exigió que las empresas suspendieran el desarrollo de sus sistemas tras los casos de OpenAI y Anthropic, y OpenAI llegó a pausar el desarrollo de sus modelos durante dos semanas.


