A Anthropic lançou nesta terça-feira (22) o Claude Opus 5.5, um modelo que iguala o desempenho do Fable 5.1 na maior parte das tarefas e custa cerca de 40% menos para rodar que o antecessor, o Opus 5, segundo o The Verge, a SiliconANGLE, a ZDNet e a TechCrunch.
O corte no preço por token é de 20%: o valor da saída (output) caiu de US$ 25 para US$ 20 por milhão de tokens, segundo a SiliconANGLE e a TechCrunch. Como o modelo também consome menos tokens para concluir a mesma tarefa, a economia total chega aos 40% citados pela empresa em cargas de trabalho típicas, de acordo com a ZDNet.
Opus é a camada mais cara e capaz da família Claude; Sonnet fica no meio, e Haiku é a mais rápida e barata, segundo a TechCrunch. A Anthropic afirma que o Opus 5.5 gera respostas mais de 30% mais rápido que o Opus 5, de acordo com a SiliconANGLE e a ZDNet.
Menos tentativas de burlar os testes de segurança
A empresa diz que o Opus 5.5 tentou driblar as barreiras dos testes de segurança 85% menos vezes que o Opus 5, segundo o The Verge e a SiliconANGLE. Antes do lançamento, o modelo foi avaliado por dois parceiros externos, a METR e a Frontier Design, confirmam as quatro publicações.
Quando os mecanismos de segurança são acionados, pedidos ligados a cibersegurança passam a ser respondidos pelo modelo mais antigo, o Opus 4.8, em vez do Opus 5.5 — a mesma restrição já aplicada ao Fable 5.1, de acordo com o The Verge, a SiliconANGLE e a ZDNet. Para tarefas de biologia consideradas de alto risco, o acesso mais amplo passa por um programa de verificação com uma trilha específica para ciências da vida, segundo a ZDNet e a SiliconANGLE.
Em números publicados pela Anthropic e citados pela SiliconANGLE, o Opus 5.5 pontuou 66,4% no Terminal-Bench 4.0, um teste de programação por agentes, contra 55,8% do Fable 5.1. No AutomationBench, teste de fluxos de trabalho corporativos, o novo modelo completou 40% das tarefas, ante 26,9% do Opus 5, segundo a mesma publicação. Esses números específicos vêm de uma única fonte consultada e não foram confirmados por outra publicação.
A SiliconANGLE também relata que, em um dos testes usados pela Anthropic, um avaliador concluiu uma migração de código com 680 mil linhas em menos de um dia — tarefa que, segundo a empresa, levaria semanas para uma equipe de engenharia inteira. Esse relato vem de uma única fonte consultada.
No mesmo anúncio, a Anthropic divulgou depoimentos de clientes: a executiva Yashodha Bhavnani, da Box, e o diretor de produtos do GitHub, Mario Rodriguez, afirmam que o modelo passou a usar menos etapas e menos tokens para concluir tarefas de código, segundo a ZDNet e a SiliconANGLE.
Primeiro modelo desde o plano de desacelerar
O Opus 5.5 é o primeiro modelo lançado pela Anthropic desde que o executivo-chefe Dario Amodei anunciou a intenção de reduzir o ritmo dos avanços de capacidade da IA para dar tempo aos mecanismos de segurança, segundo o The Verge, a TechCrunch e a ZDNet.
O lançamento chega menos de dois meses depois do Opus 5, que estreou em julho, de acordo com a TechCrunch e a ZDNet. A Anthropic afirma que pretende lançar o Claude Sonnet 5.5 e o Claude Haiku 5.5 nas próximas semanas, segundo as quatro publicações consultadas.
A OpenAI lançou dois modelos mais baratos da linha GPT-6, batizados de Sol e Luna, no mesmo dia, segundo anúncio da própria empresa e do serviço de nuvem da Amazon, o Amazon Web Services.


