Anthropic lanzó este lunes Claude Sonnet 5.5, el segundo modelo de la nueva familia Claude 5.5, con respuestas más de 30% más rápidas y un costo por tarea hasta 30% menor que el de Sonnet 5, según AWS Machine Learning e Hipertextual. El lanzamiento llega pocos días después del estreno de Opus 5.5, el 22 de septiembre, de acuerdo con SiliconANGLE.
El modelo ya está disponible en Amazon Bedrock y en Claude Platform on AWS, según la propia AWS, además de Google Cloud y Microsoft Azure, de acuerdo con Canaltech y Olhar Digital. Los precios por token se mantienen iguales a los de Sonnet 5: 2 dólares por millón de tokens de entrada, 10 dólares por millón de salida y 0,20 dólares por millón en lecturas de caché, según SiliconANGLE e Hipertextual.
Mismo precio por token, menos tokens por tarea
El ahorro no viene de una rebaja de precio, sino de eficiencia. Según SiliconANGLE, Hipertextual y Canaltech, Sonnet 5.5 necesita hasta un 30% menos de tokens que Sonnet 5 para completar tareas comparables, lo que reduce el costo total aunque el valor por token no cambie. Los tokens son las pequeñas unidades de texto que un modelo procesa para entender una solicitud y generar una respuesta.
La velocidad de generación de respuestas también aumentó más de un 30% frente a la generación anterior, lo que convierte a Sonnet 5.5 en el modelo Sonnet más rápido lanzado hasta ahora por la compañía, según SiliconANGLE y Olhar Digital. Según Hipertextual, la aplicación de Claude ya usa Sonnet 5.5 como modelo por defecto del chatbot.
Salto en programación y lectura de gráficos
En Terminal-Bench 4.0, prueba que mide la capacidad de completar tareas de varios pasos desde una línea de comandos, Sonnet 5.5 alcanzó 70,6% de aciertos, frente al 10,3% de Sonnet 5, según SiliconANGLE, Olhar Digital y Canaltech. Canaltech informó que ese resultado se acerca al del propio Opus 5.5, que anotó 66,4% en la misma prueba, cifra que también citó Hipertextual.
Canaltech también reportó una mejora en Chartography, un banco de pruebas para la lectura de gráficos y tablas, que pasó de 15,6% con Sonnet 5 a 61,6% con Sonnet 5.5 sin usar herramientas externas. SiliconANGLE y Canaltech coinciden en que Sonnet 5.5 es el primer modelo de la línea Sonnet en completar el videojuego Pokémon Red usando solo capturas de pantalla, una prueba que los investigadores usan para medir el razonamiento a largo plazo y la comprensión de imágenes.
Nuevas salvaguardas y el Haiku 5.5 en camino
Sonnet 5.5 es el primer modelo de la línea en lanzarse con salvaguardas de ciberseguridad y mecanismos de respaldo similares a los creados para modelos más avanzados, como Opus 5.5, según SiliconANGLE y Olhar Digital. Esas protecciones pueden derivar a un tratamiento más restringido las solicitudes relacionadas con ciberseguridad o biología, aunque ambas fuentes señalan que la mayoría del trabajo de desarrollo de software y ciencias de la vida no se ve afectada.
"Alimentamos a Claude Sonnet 5.5 con cientos de casos reales de soporte, entre respuestas y escalamientos", dijo Abhinay Kathuria, director de IA de Zendesk, según SiliconANGLE. "Tomó menos decisiones equivocadas y resolvió tickets más rápido que los modelos de Claude que usamos hoy en producción", añadió, señalando una mejora del 20% en la velocidad de resolución. "Sin cambiar nuestros prompts, Claude Sonnet 5.5 tuvo mejor desempeño que Sonnet 5 en casi todas nuestras evaluaciones internas del Slackbot", dijo por su parte Curtis Allen, ingeniero principal de Slack, a Olhar Digital.
Anthropic también confirmó, según SiliconANGLE, Olhar Digital y Canaltech, que lanzará Claude Haiku 5.5, el modelo más pequeño y económico de la nueva familia, en las próximas semanas.


