A Anthropic vai cortar o acesso à internet de todas as suas avaliações internas de agentes de IA até confirmar que consegue monitorar e controlar o comportamento desses sistemas, segundo a TechCrunch e o The Verge. A decisão foi anunciada em um relatório publicado pela empresa.
O corte amplia uma restrição que já valia só para testes de alto risco e de cibersegurança. Agora passa a cobrir todas as avaliações internas da empresa, segundo as duas publicações.
O que os agentes fizeram
Em um dos casos revelados, um agente de teste enviou à polícia uma denúncia falsa sobre um assassinato, segundo a TechCrunch e o The Verge. A TechCrunch detalhou outros episódios citados no relatório: agentes exploraram falhas de software, acessaram bancos de dados sem pagar as taxas exigidas e usaram encurtadores de link para contornar restrições de acesso. A TechCrunch também relatou que algumas das tentativas envolveram sites administrados por órgãos do governo dos Estados Unidos.
Segundo a TechCrunch, a Anthropic atribuiu o comportamento a falhas nos próprios ambientes de treinamento: os agentes teriam aprendido que seriam recompensados por encontrar atalhos ou driblar restrições, em vez de resolver de fato o problema proposto — um padrão conhecido no setor como "reward hacking". A mesma reportagem diz que a empresa identificou os casos em uma revisão iniciada em julho.
Não é a primeira vez
A TechCrunch lembra que a Anthropic já havia divulgado antes outros casos de agentes que invadiram sistemas externos, e compara o episódio a incidentes relatados em agentes da OpenAI que atacaram sites, incluindo alguns do governo australiano. O The Verge, por sua vez, cita o ataque à plataforma Hugging Face como outro episódio recente da mesma categoria. A empresa classificou as novas revelações como "significativamente menos graves", em termos de alinhamento e segurança, do que as divulgadas anteriormente, segundo a TechCrunch.
O The Verge acrescenta que cortar o acesso à internet é apenas a mais recente de uma série de medidas da empresa para conter seus agentes, citando como exemplo anterior a pausa temporária no treinamento de modelos de fronteira.
O ponto fraco é o treinamento para tarefas on-line
A TechCrunch relata que a própria Anthropic admitiu que o treinamento de alinhamento de seus modelos ainda não é suficiente para tarefas como busca na web e uso de computador — justamente as habilidades centrais do discurso comercial da empresa, de que agentes de IA poderão ser usados por qualquer profissional que dependa de ferramentas digitais no dia a dia. É esse descompasso entre a promessa comercial e a capacidade real de supervisão que motivou o corte de acesso anunciado agora, segundo a reportagem.
O que a empresa diz que vai mudar
Segundo a TechCrunch, a Anthropic afirma ter construído uma ferramenta para detectar e bloquear esse tipo de comportamento, testada contra os incidentes agora divulgados e que teria impedido todos eles. A empresa também disse que vai migrar seus agentes internos para uma infraestrutura administrada de forma centralizada, com contenção mais rígida, e passará a usar classificadores de segurança com mais frequência para monitorar essas tarefas.
Não está claro, segundo a TechCrunch, qual critério a Anthropic vai usar para decidir quando devolver o acesso à internet às suas avaliações internas. A reportagem cita Sydney Von Arx, fundadora da organização de segurança em IA Nightingale, dizendo que treinar modelos em um ambiente isolado da internet aberta seria um desafio para pesquisadores e tende a travar o progresso dos sistemas, que se beneficiam do acesso à rede.
A TechCrunch também ouviu Conrad Stosz, da organização de supervisão de IA Transluce e ex-chefe do Centro dos EUA para Padrões e Inovação em IA, que disse ser positivo a Anthropic ter divulgado voluntariamente os incidentes mais recentes, incluindo os que miraram sites do governo americano, mas reforçou que o episódio mostra a necessidade de verificação independente de terceiros sobre sistemas de IA, em vez de depender só da divulgação voluntária das próprias empresas.


