A Anthropic lançou nesta segunda-feira o Claude Sonnet 5.5, segundo modelo da nova família Claude 5.5, com a promessa de respostas mais de 30% mais rápidas e custo por tarefa até 30% menor que o do Sonnet 5, segundo a AWS Machine Learning e a Canaltech. O lançamento segue o do modelo de topo Opus 5.5, em 22 de setembro, de acordo com a SiliconANGLE.

O modelo já está disponível no Amazon Bedrock e no Claude Platform on AWS, segundo a própria AWS, além do Google Cloud e da Microsoft Azure, conforme a Olhar Digital e a Canaltech — os três provedores de nuvem mais usados por empresas no Brasil. Os preços por token não mudaram em relação ao Sonnet 5: US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de saída e US$ 0,20 por milhão em leituras de cache, o equivalente a cerca de R$ 10,42, R$ 52,10 e R$ 1,04, segundo a conversão feita pela Olhar Digital.

Mesmo preço por token, menos tokens por tarefa

A economia não vem de um corte no preço, mas de eficiência: segundo a SiliconANGLE, a Hipertextual e a Canaltech, o Sonnet 5.5 costuma precisar de até 30% menos tokens que o Sonnet 5 para concluir o mesmo trabalho, o que reduz o custo total mesmo com o valor por token mantido. Tokens são as pequenas unidades de texto que um modelo processa para entender um pedido e gerar uma resposta.

A velocidade de geração de respostas também subiu mais de 30% frente à geração anterior, tornando o Sonnet 5.5 o modelo Sonnet mais rápido já lançado pela empresa, segundo a SiliconANGLE e a Olhar Digital. A Canaltech destaca que, no nível de esforço padrão dos aplicativos Claude, o modelo supera a pontuação máxima do Sonnet 5 gastando cerca de um décimo do custo por tarefa.

Salto em programação e leitura de gráficos

No Terminal-Bench 4.0, teste que mede a capacidade de completar tarefas em várias etapas usando linha de comando, o Sonnet 5.5 atingiu 70,6% de acerto, ante 10,3% do Sonnet 5, segundo a SiliconANGLE, a Olhar Digital e a Canaltech. A Canaltech afirma que o resultado supera até o do próprio Opus 5.5, que marcou 66,4% no mesmo teste — número também citado pela Hipertextual.

A Canaltech relatou ainda um salto no Chartography, benchmark que mede a leitura de gráficos e tabelas: de 15,6% no Sonnet 5 para 61,6% no Sonnet 5.5, sem uso de ferramentas externas. A SiliconANGLE e a Canaltech afirmam que o Sonnet 5.5 é o primeiro modelo da linha a zerar o jogo Pokémon Red usando apenas capturas de tela, teste usado por pesquisadores para medir raciocínio de longo prazo e compreensão de imagens.

Novas salvaguardas e o Haiku 5.5 a caminho

O Sonnet 5.5 é o primeiro modelo da linha a ser lançado com salvaguardas de cibersegurança e mecanismos de fallback semelhantes aos criados para modelos mais avançados, como o Opus 5.5, segundo a SiliconANGLE e a Olhar Digital. Essas proteções podem direcionar pedidos ligados a cibersegurança ou biologia para um tratamento mais restrito, embora as empresas afirmem que a maior parte do trabalho de desenvolvimento de software e de ciências da vida segue sem alteração.

"Sem alterar nossos prompts, o Claude Sonnet 5.5 teve desempenho melhor que o Sonnet 5 em quase todas as nossas avaliações internas do Slackbot", disse Curtis Allen, engenheiro principal do Slack, à Olhar Digital. A Anthropic também confirmou, segundo a SiliconANGLE, a Olhar Digital e a Canaltech, que vai lançar o Claude Haiku 5.5, modelo mais barato e rápido da nova família, nas próximas semanas.