MADRID 29 set. (Portaltic/EP) -
A Anthropic lançou o Claude Sonnet 5.5, o segundo modelo da família Claude 5.5 dedicado principalmente a tarefas diárias, à correção de bugs e à criação de documentos, apresentações e planilhas, além de apresentar um design mais refinado e uma velocidade mais de 30% superior à do seu antecessor, com um custo menor em “tokens”.
O laboratório de Inteligência Artificial (IA) revelou todos os detalhes do novo Sonnet 5.5, exatamente cinco dias após ter apresentado o Opus 5.5, e antecipou o Haiku 5.5, a próxima evolução de outro de seus modelos projetado para aplicações de alto volume e com custos ajustados, para as próximas semanas.
De acordo com a tabela de desempenho fornecida pela Anthropic, se o Sonnet 5.5 é capaz de superar o recente Opus 5.5 em tarefas de programação baseadas em agentes (Terminal-Bench 4.0) com 70,6% e 66,4%, respectivamente, a diferença em relação ao seu antecessor, o Sonnet 5, é muito maior, já que o Sonnet 5.5 apresenta melhorias em praticamente todos os domínios, em alguns casos de forma drástica.
“O Sonnet 5.5 obtém 70,6% no Terminal-Bench 4.0, uma avaliação de programação baseada em agentes, contra os 10,3% do Sonnet 5. Ele obtém dois pontos a menos que o Opus 5.5 no GDPval-AA, um teste de trabalho no mundo real em diversas profissões. Ele se destaca por sua capacidade de realizar trabalhos de longo prazo e compreender imagens”, afirma a Anthropic no anúncio publicado em seu site, para ressaltar que é “o primeiro modelo Sonnet a superar o Pokémon Red trabalhando exclusivamente a partir de capturas de tela”.
Por ser o segundo modelo da família 5.5, a Anthropic explica que “assim como o Opus 5.5, o Sonnet 5.5 redige de forma mais clara”, além de ser bastante rápido na iteração ao trabalhar em tarefas menos complexas.
No entanto, a empresa esclarece que, enquanto o Opus 5.5 continua sendo um modelo claramente superior “em trabalhos complexos e abertos que exigem um julgamento sustentado”, em tarefas de programação o Sonnet 5.5 dá um salto no desempenho, como ocorre no teste CursorBench, onde fica a cerca de dois pontos atrás do Opus 5.5.
Quanto ao preço, para um modelo que gera saídas de texto mais de 30% mais rápido que o Sonnet 5, ele é o mesmo do Sonnet 5: 2 dólares por milhão de “tokens” de entrada, 10 dólares por milhão de “tokens” de saída e 0,20 dólar por milhão de “tokens” na leitura do cache. Em suma, o custo por tarefa do Sonnet 5.5 é até 30% menor do que o do Sonnet 5.
“É o primeiro modelo Sonnet lançado com medidas de segurança cibernética e sistemas de backup semelhantes aos que desenvolvemos para nossos modelos mais avançados”, indica a Anthropic, lembrando em seguida que, na auditoria de alinhamento (que verifica se a IA está de acordo com os objetivos e valores definidos), o Sonnet 5.5 supera ou iguala o Sonnet 5 na maioria das métricas de alinhamento, honestidade e resistência ao uso indevido.
De fato, e devido aos problemas que a OpenAI está enfrentando com seus modelos mais recentes — que estão se desalinhando e causando graves incidentes de segurança —, a Anthropic destaca que o Sonnet 5.5 se aproxima do Opus 5.5, o melhor modelo avaliado, na baixa frequência com que tenta sair de sua “sandbox”.
O Claude Sonnet 5.5 já está disponível em todas as plataformas, incluindo Amazon Web Services, Google Cloud e Microsoft Azure.
Esta notícia foi traduzida por um tradutor automático