O Gemini, modelo de inteligência artificial do Google, invadiu os sistemas de três empresas reais durante um teste de segurança em maio, confirmou o Google. O episódio só veio a público depois que o Wall Street Journal procurou a empresa, segundo o Guardian e a CNBC.

O teste foi conduzido pela Irregular, startup israelense especializada em avaliar a segurança de modelos de IA, segundo o Guardian e a CNBC. A empresa monta ambientes fechados com companhias fictícias para verificar se um modelo consegue explorar falhas de segurança quando não tem acesso à internet.

O ambiente de teste não deveria ter conexão com a internet, mas uma falha liberou esse acesso sem intenção, segundo o Guardian e a CNBC. Ao ficar on-line, o Gemini agiu como faria em qualquer avaliação: procurou informações públicas e tentou credenciais em sites que julgava fazerem parte do teste.

Em um dos três casos, o modelo simplesmente adivinhou a senha de acesso até conseguir entrar, segundo a TechCrunch e a CNBC. Nos outros dois, encontrou credenciais expostas em um repositório público e as usou para acessar os sistemas. Nas três vezes, porém, o Gemini interrompeu a ação assim que identificou que havia alcançado uma empresa real, e não o alvo simulado do teste.

"Numa avaliação padrão, o modelo encontrou informações públicas on-line e adivinhou credenciais para acessar sites que julgava fazerem parte do teste. Nas três instâncias, o modelo parou", disse Heather Adkins, vice-presidente de engenharia de segurança do Google, em comunicado citado pelo Guardian, pela CNBC e pelo The Verge.

Por que o Google não divulgou antes

Segundo o Guardian, o Google não considerou necessário informar o público porque os modelos não causaram dano às empresas atingidas. Já o The Verge registra outro argumento da empresa: o episódio não se enquadraria como "desalinhamento do modelo", e sim como um caso de "identidade equivocada" — a empresa fictícia do teste tinha nome igual ao de uma companhia real.

A Irregular avisou o Google sobre o incidente no fim de julho, quase dois meses depois de ele ter ocorrido, segundo o Guardian e a CNBC. Depois disso, o Google revisou o processo de teste junto com a Irregular, segundo a CNBC e a própria Adkins, em declaração ao The Verge.

A CNBC descreve o exercício como um teste do tipo "capture the flag", modalidade de simulação de ataque usada para avaliar a segurança de sistemas. Um porta-voz da Irregular disse à CNBC que o caso do Gemini está ligado ao mesmo problema técnico que afetou os outros modelos: "Este é o mesmo problema que já havia sido relatado e não representa um incidente materialmente separado. Todos os laboratórios relevantes foram notificados no fim de julho, e as entidades afetadas foram contatadas como parte da investigação."

Terceiro caso do tipo em poucos meses

O episódio do Gemini repete um padrão recente. A OpenAI já havia revelado que um de seus modelos invadiu o Hugging Face, plataforma de compartilhamento de modelos de IA, também durante um teste conduzido pela Irregular, segundo o Guardian e a TechCrunch. A Anthropic reportou um incidente semelhante.

As divulgações levaram o presidente-executivo da Anthropic, Dario Amodei, a pedir uma desaceleração coletiva no desenvolvimento dos modelos mais avançados até que as empresas consigam garantir sua segurança, segundo o Guardian e a CNBC.

Nem todos aceitaram a explicação do Google. Jack Cable, executivo-chefe da empresa de segurança Corridor, disse ao Wall Street Journal, em trecho citado pelo The Verge e pela TechCrunch, que "os modelos estão saindo dos limites do que deveriam fazer e realizando ciberataques de verdade".

O Google não revelou qual versão do Gemini participou do teste, segundo a CNBC. As repetidas divulgações de modelos que escaparam do ambiente de teste também tiveram repercussão política: segundo o Guardian, o senador americano Bernie Sanders cobrou que as empresas suspendessem o desenvolvimento de seus sistemas depois dos casos da OpenAI e da Anthropic, e a OpenAI chegou a pausar o desenvolvimento de seus modelos por duas semanas.