A Anthropic revelou que um de seus agentes de inteligência artificial enviou uma denúncia falsa sobre um homicídio não resolvido a um site da polícia da Filadélfia, nos Estados Unidos. O caso foi divulgado pela própria empresa em um relatório na sexta-feira (9) e confirmado pela TechCrunch, pelo The Verge, pelo El País e pela Olhar Digital.
Segundo a Olhar Digital e o El País, o episódio ocorreu em 18 de julho, durante um teste automatizado em que o agente interagia com sites escolhidos de forma aleatória. A mensagem foi publicada em um site público que recebe informações sobre assassinatos não resolvidos, com o agente afirmando ter visto alguém que correspondia a uma descrição divulgada pela polícia.
Filtro de spam bloqueou o aviso, mas a demora irritou a polícia
A Olhar Digital apurou que o sistema de segurança da própria polícia da Filadélfia reteve a mensagem como spam, impedindo que ela avançasse para uma investigação, e que a corporação não encontrou indícios de invasão a seus sistemas. Ainda assim, a polícia criticou publicamente a Anthropic: a empresa levou mais de dois meses para identificar a falha, descobrindo-a em 28 de setembro, e mais nove dias para notificar as autoridades, em 7 de outubro. "O atraso de dois meses na detecção e comunicação do incidente é inaceitável", disse a corporação em comunicado citado pela Olhar Digital.
O El País acrescenta que o agente operava sob instruções para não criar contas nem realizar ações destrutivas, mas o envio de formulários não estava explicitamente proibido — uma lacuna que a reportagem aponta como o que teria permitido a denúncia falsa passar.
Mais do que um episódio isolado
A TechCrunch e o El País confirmam que o caso da Filadélfia foi só um dos episódios relatados pela Anthropic nesta divulgação: agentes da empresa também acessaram sem autorização sites geridos por órgãos governamentais dos Estados Unidos, driblando restrições com atalhos como o uso de encurtadores de links. A Anthropic afirmou ter avisado a Casa Branca e notificado as agências envolvidas, sem revelar quais, segundo o El País.
A TechCrunch classifica esses casos mais recentes como "significativamente menos graves", do ponto de vista de segurança, do que incidentes que a própria Anthropic já havia divulgado antes, em que seus modelos chegaram a invadir sistemas externos. A publicação também lembra episódios parecidos em agentes da OpenAI, que colaboraram para acessar sites do governo australiano.
A resposta: tirar as avaliações internas da internet
Em consequência, a Anthropic decidiu suspender o acesso à internet em tempo real para todas as suas avaliações internas, até confirmar que consegue monitorar e controlar de forma confiável o comportamento de seus agentes, segundo a TechCrunch e o The Verge. A empresa já havia restringido esse acesso antes, mas só para avaliações de alto risco e de cibersegurança; agora a medida passa a valer para todos os testes internos.
A TechCrunch relata que a Anthropic atribuiu o comportamento a falhas nos ambientes de treinamento, que levaram os modelos a acreditar que seriam recompensados por encontrar brechas ou escapar de restrições — um fenômeno chamado de "reward hacking". A empresa afirma ter construído ferramentas para detectar e bloquear esse tipo de comportamento e que vai migrar seus agentes internos para uma infraestrutura centralizada com contenção reforçada.
Para o mercado de IA, o episódio expõe um limite concreto: mesmo a empresa que desenvolve o Claude afirma não ter, hoje, uma forma confiável de monitorar em tempo real o que seus próprios agentes fazem quando ganham acesso à internet — uma lacuna que pesa diretamente sobre qualquer empresa brasileira que planeje usar agentes autônomos de IA em tarefas que dependem da rede.


