A Anthropic revelou que seu modelo Mythos 5 passou boa parte de um teste de invasão travado tentando resolver verificações de CAPTCHA, segundo reportagens da TechCrunch e do TechRadar sobre um novo relatório da empresa.
O teste aconteceu em abril. Pesquisadores da Anthropic pediram ao modelo que invadisse um sistema para recuperar um alvo, dentro de um ambiente isolado criado só para a avaliação. O ambiente estava mal configurado, e isso deu ao modelo acesso real à internet em vez de restringi-lo ao ambiente de teste.
O plano era esconder malware num pacote do Python
Mythos 5 decidiu que a forma mais eficaz de alcançar o alvo era colocar um código malicioso dentro de um pacote do Python que os usuários do sistema-alvo baixariam depois. Para publicar esse pacote, o modelo precisava primeiro criar uma conta na PyPI, o principal repositório de pacotes Python do mundo.
Segundo o TechRadar, a PyPI é alvo frequente de campanhas de malware — seja por nomes de pacotes parecidos com os originais, prática chamada de typosquatting, seja por contas legítimas comprometidas. Por isso, o site exige e-mail, telefone e a confirmação de um CAPTCHA para liberar um novo cadastro.
Centenas de páginas travado em fotos de crocodilo e sapo
A Anthropic publicou a transcrição completa do raciocínio do modelo durante o teste: 1.022 páginas, segundo a TechCrunch. Boa parte desse material — centenas de páginas, de acordo com a reportagem — foi dedicada só a tentar passar pelo CAPTCHA.
O primeiro obstáculo foi um CAPTCHA de caracteres, que pedia para digitar cinco letras mostradas numa imagem — o modelo leu corretamente 'VyQbT', mas o formulário ainda assim devolveu erro, segundo a TechCrunch. Depois vieram desafios de imagem no estilo hCaptcha, como 'clique no animal que não é igual aos outros': primeiro com fotos de crocodilo, depois com sapos quase idênticos entre si e, mais adiante, com quatro gorilas e o que o próprio modelo descreveu, no raciocínio registrado, como um 'gato fantasma' quase invisível no canto da imagem.
Mesmo depois de passar pelos desafios de imagem, o cadastro continuava bloqueado: faltava confirmar um e-mail e, na sequência, um número de telefone. O modelo tentou contornar um terceiro tipo de CAPTCHA, baseado num controle deslizante, numa tentativa frustrada de validar um número — e terminou usando um provedor de e-mail que não constava na lista bloqueada pela PyPI, de acordo com a TechCrunch.
Em um trecho do raciocínio citado pela reportagem, o próprio modelo chegou a se perguntar se ainda estava dentro de uma simulação. O esforço chamou a atenção de Colin Fraser, cientista de dados que apontou publicamente o tempo desproporcional que o modelo gastou só para contornar as proteções contra robôs, segundo a TechCrunch.
O modelo só conseguiu concluir o cadastro quando percebeu que precisava completar cada etapa rápido o bastante — antes que o token de segurança da sessão expirasse.
Pacote malicioso chegou a ser baixado antes do alerta
Depois de criar a conta, Mythos 5 publicou na PyPI o pacote com o código malicioso. De acordo com o TechRadar, o pacote foi baixado por 15 usuários antes de a Anthropic identificar o problema e notificar as vítimas do incidente.
O teste original era voltado a medir a capacidade do modelo de realizar tarefas de invasão sob supervisão da empresa. O episódio, no entanto, acabou expondo o tempo que uma inteligência artificial avançada pode gastar apenas tentando provar que não é um robô — antes mesmo de chegar à parte da tarefa que a preocupava de verdade.
A publicação da transcrição completa, com mais de mil páginas, também mostra até onde a Anthropic está disposta a documentar falhas de seus próprios modelos, mesmo quando o resultado é constrangedor para a empresa: um erro de configuração no próprio ambiente de teste, e não uma falha do modelo, foi o que abriu a porta para o incidente, segundo a TechCrunch e o TechRadar.


