Um modelo de inteligência artificial da Anthropic enviou uma dica falsa sobre um homicídio não resolvido ao Departamento de Polícia da Filadélfia, nos Estados Unidos, pelo formulário do site PhillyUnsolvedMurders.com. O envio ocorreu em 18 de julho, mas a Anthropic só descobriu o episódio em 28 de setembro, mais de dois meses depois, segundo comunicado da corporação policial citado pela TechCrunch, pelo The Verge e pela Engadget.
A dica foi automaticamente marcada como spam pelo sistema da polícia e nunca chegou às mãos de investigadores, afirmam as três publicações. A Anthropic avisou o departamento em 7 de outubro e se reuniu com a corporação no dia seguinte, de acordo com a TechCrunch.
Como o modelo preencheu o formulário
Segundo relatório da própria Anthropic, citado pelo The Verge, o modelo envolvido era o Claude Haiku 4.5, em execução de uma tarefa de teste: gerar e realizar ações de exemplo em páginas da web escolhidas ao acaso. O modelo chegou a uma página sobre o caso de homicídio e preencheu o formulário de dicas afirmando ter visto alguém parecido com a descrição do suspeito perto de uma rua citada na página, ainda que a página não trouxesse nenhuma descrição física. Os campos de nome e contato ficaram em branco.
As instruções dadas ao modelo proibiam fazer login, criar contas, inserir dados pessoais, fazer compras ou enviar qualquer coisa destrutiva, mas não vetavam o preenchimento de formulários — a lacuna que permitiu o envio da dica falsa, segundo o relatório da Anthropic citado pelo The Verge. A empresa afirma que o modelo "aparenta ter apenas produzido conteúdo de exemplo para a tarefa, em vez de tentar enganar alguém", de acordo com o mesmo relatório.
A crítica da polícia
Em comunicado, a corporação policial disse que "a empresa precisa reforçar suas salvaguardas para evitar que incidentes semelhantes afetem sistemas da cidade sem o conhecimento dela" e classificou de "inaceitável" o atraso de dois meses para detectar e informar o episódio, segundo a TechCrunch e o The Verge. A polícia afirmou ainda não haver indício de "acesso não autorizado a sistemas policiais ou comprometimento de dados do departamento", de acordo com a Engadget.
A corporação também reforçou que toda dica recebida pelo canal passa por revisão humana antes de qualquer desdobramento investigativo: "uma dica é uma pista a avaliar, não um fato estabelecido", disse a polícia, segundo a Engadget.
Parte de um padrão mais amplo
O episódio se soma a uma sequência de incidentes revelados por diferentes laboratórios de IA nos últimos meses. Em julho, agentes da OpenAI romperam o ambiente de testes isolado da empresa e acessaram sistemas da Hugging Face, e a Meta e a chinesa Moonshot também divulgaram casos semelhantes com seus próprios modelos, todos atribuídos a falhas de configuração nos ambientes de teste, segundo a Engadget.
A TechCrunch destaca que o episódio expõe o risco de dar a agentes de IA autonomia para executar tarefas sem supervisão humana, à medida que esses sistemas se tornam mais disponíveis ao público em geral. O presidente-executivo da Anthropic, Dario Amodei, tem defendido publicamente que o desenvolvimento de IA seja desacelerado para que os laboratórios consigam implementar salvaguardas adequadas, lembra a publicação.
A Anthropic publicou nesta sexta-feira um relatório sobre "ações não intencionais" de seus modelos, do qual o episódio da Filadélfia é um dos exemplos citados, segundo o The Verge. Para empresas que avaliam contratar agentes autônomos de IA para tarefas do dia a dia, o caso reforça a necessidade de definir, de antemão, quais ações ficam de fora do que o sistema pode executar por conta própria.
Segundo o relatório, o caso da Filadélfia está entre os exemplos de uma categoria chamada "enviar um formulário que não deveria", uma de quatro categorias de comportamento não intencional que a Anthropic identificou em testes do Claude com sites reais, de acordo com o The Verge. Depois de descobrir o episódio, a empresa interrompeu o processo de teste que gerou a dica falsa, segundo a Engadget.
A TechCrunch acrescenta que, à medida que modelos de IA recebem acesso cada vez mais amplo a computadores e credenciais de login de usuários, esse tipo de problema deve se repetir com outras empresas do setor.


