
Anthropic presentou Claude Sonnet 5.5, o segundo modelo da familia Claude 5.5, cunha mellora destacada no rendemento fronte a Sonnet 5 e unha velocidade de xeración superior nun 30 %. O novo modelo mantén os prezos do seu predecesor, pero a súa maior eficiencia permite reducir ata un 30 % o custo por tarefa.
Sonnet 5.5 sitúase como unha alternativa máis rápida e económica a Claude Opus 5.5. Mentres Opus está orientado a traballos complexos que requiren un razoamento prolongado e capacidade de decisión, Sonnet 5.5 busca ofrecer un equilibrio entre velocidade, custo e capacidade para tarefas ben delimitadas, programación, corrección de erros e creación de documentos, presentacións e follas de cálculo.
Anthropic tamén destaca as capacidades visuais do modelo, especialmente na interpretación de imaxes e gráficos. De feito, Sonnet 5.5 é o primeiro modelo da serie Sonnet que conseguiu completar Pokémon Red traballando unicamente a partir de capturas de pantalla. A familia incorporarase proximamente cun terceiro integrante, Claude Haiku 5.5, deseñado para aplicacións de gran volume e especial sensibilidade ao custo.
Un salto importante na programación
Os resultados publicados por Anthropic mostran unha mellora especialmente notable nas tarefas de programación con axentes. Sonnet 5.5 obtivo un 70,6 % en Terminal-Bench 4.0, fronte ao 10,3 % de Sonnet 5. Nesta proba, que mide a capacidade para completar tarefas profesionais complexas e con múltiples pasos desde unha interface de liña de comandos, o novo modelo supera amplamente o seu predecesor.
En FrontierCode 1.1 alcanza o 46,2 % con configuración Max, fronte ao 42,4 % de Sonnet 5, mentres que en CursorBench 4.0 pasa do 34,1 % ao 55,5 %. Opus 5.5 continúa por diante nestas probas concretas, cun 54,4 % e un 57,8 %, respectivamente.
O modelo tamén busca reducir o número de operacións necesarias para completar unha tarefa. As primeiras probas realizadas por desenvolvedores apuntan a unha maior capacidade para comprender rapidamente bases de código e agrupar chamadas a ferramentas, o que pode reducir tanto o número de pasos como o consumo de tokens.
«En Epic, as primeiras probas de Sonnet 5.5 superaron o nivel de calidade que esperariamos dun modelo de categoría superior», sinala Daniel Vogel, director de operacións de Epic Games. Segundo explica, o modelo foi capaz de traballar con decenas de miles de liñas de código relacionadas coa arquitectura de sistemas de xogo, manter respostas rápidas e completar tarefas de varias horas con menos instrucións específicas.
Case ao nivel de Opus en traballo profesional
As melloras tamén se estenden ás tarefas de coñecemento. En GDPval-AA v2.1, unha avaliación baseada en traballos reais de 44 profesións e nove grandes sectores, Sonnet 5.5 obtén 1.844 puntos, fronte aos 1.449 de Sonnet 5 e moi preto dos 1.846 puntos de Opus 5.5.
En AA-Briefcase v1.1 alcanza 1.811 puntos, tamén preto dos 1.822 de Opus 5.5 e por riba dos 1.359 de Sonnet 5. En tarefas de razoamento multidisciplinar, obtén un 64,5 % en Humanity’s Last Exam con ferramentas, fronte ao 54,9 % de Sonnet 5.
As capacidades para traballar con interfaces tamén melloran. Sonnet 5.5 chega ao 80,1 % en OSWorld 2.1, fronte ao 57 % do modelo anterior, mentres que en Chartography, unha proba de recoñecemento de gráficos, pasa do 15,6 % ao 61,6 % sen ferramentas.
As primeiras probas externas tamén apuntan a melloras na creación de presentacións e interfaces. Anthropic asegura que Sonnet 5.5 pode seguir modelos de diapositivas e producir presentacións que requiren poucas modificacións posteriores. Nunha proba interna, o modelo recibiu materiais trimestrais e transcricións dunha conferencia de resultados dunha empresa cotizada, xunto cun modelo de presentación, e xerou un informe operativo de dez diapositivas que dous expertos consideraron listo para enviar.
Slack tamén observou unha mellora nas súas probas internas. «Sen modificar ningunha das nosas indicacións, Claude Sonnet 5.5 obtivo mellores resultados que Sonnet 5 en case todas as nosas avaliacións de Slackbot, con menos pasos e arredor dun 14 % menos de tokens de saída», explica Curtis Allen, enxeñeiro principal de Slack.
O mesmo prezo, menor custo por tarefa
Sonnet 5.5 conserva as tarifas de Sonnet 5: 2 dólares por millón de tokens de entrada, 10 dólares por millón de tokens de saída e 0,20 dólares por millón de tokens nas lecturas da caché. A escritura na caché ten un custo de 2,50 dólares por millón de tokens.
A diferenza está no número de tokens necesarios para completar cada tarefa. Anthropic asegura que Sonnet 5.5 pode custar ata un 30 % menos por tarefa que Sonnet 5 grazas á súa maior eficiencia.
A velocidade de xeración tamén aumenta máis dun 30 %, o que converte Sonnet 5.5 no modelo Sonnet máis rápido desenvolvido ata o momento. O nivel de esforzo empregado permite ademais axustar o equilibrio entre velocidade, consumo e calidade. Claude Code e as aplicacións de Claude establecen por defecto un nivel medio, mentres que Claude Platform emprega un nivel alto.
Novas medidas de seguridade
O incremento das capacidades de ciberseguridade levou Anthropic a aplicar a Sonnet 5.5 medidas de protección similares ás utilizadas en Opus 5.5. As tarefas habituais de desenvolvemento de software continúan dispoñibles, mentres que determinadas operacións de maior risco poden provocar unha derivación a Sonnet 5.
A compañía tamén introduciu medidas específicas contra os ataques de destilación, nos que se empregan grandes cantidades de contas para extraer capacidades dun modelo e empregalas posteriormente para desenvolver outros sistemas sen as mesmas salvagardas. Sonnet 5.5 é o primeiro modelo Sonnet que incorpora clasificadores destinados a impedir a extracción do seu razoamento.
As salvagardas relacionadas coa bioloxía mantéñense no mesmo nivel que en Sonnet 5 e están dirixidas principalmente a solicitudes de risco elevado. Anthropic sinala que a maior parte do traballo científico, educativo e clínico non se ve afectado.
Claude Sonnet 5.5 xa está dispoñible en todas as plataformas nas que se ofrece Claude, incluídos Amazon Web Services, Google Cloud e Microsoft Azure. Na plataforma de Anthropic pódese acceder ao modelo mediante o identificador claude-sonnet-5-5, con soporte para retención cero de datos.

