Modelos e LLMs

Claude Opus 5.5 lidera ranking de inteligência, mas modo "max" divide desenvolvedores

O modelo mais recente da Anthropic tirou 58 pontos no Artificial Analysis Intelligence Index, colocando-se em primeiro lugar entre 212 modelos avaliados.

Reprodução · artificialanalysis.ai

O modelo mais recente da Anthropic tirou 58 pontos no Artificial Analysis Intelligence Index, colocando-se em primeiro lugar entre 212 modelos avaliados. O problema é que esse ranking mede performance com o modo "max" de reasoning, e vários desenvolvedores que testaram essa configuração relatam que ela simplesmente não entrega resultado usable. O debate no Hacker News tem 94 comentários e expõe uma confusão que afecta quem escolhe modelo para produção.

"Max" gastou 128 mil tokens só pensando

A crítica mais concreta veio de Simonw, desenvolvedor conhecido por ferramentas como Datasette. Ele tentou gerar um SVG simples de um pelican bicicleta usando o setting "max" duas vezes e ambas as tentativas esgotaram o orçamento de 128 mil tokens enquanto o modelo ainda estava no meio do raciocínio. "É suspeito que 'max' possa ser virtualmente inútil se é tão fácil ele pensar demais a ponto de não chegar a uma resposta", escreveu. O modo "max" existe para forçar o modelo a gastar mais tokens pensando antes de responder, mas segundo Simonw isso vira armadilha em tarefas straightforward.

另一位 desenvolvedor, sharktheone, disse que usou o Opus 5 antes do lançamento e não notou melhoria significativa. "Ainda não é ótimo em qualidade de código. Talvez seja um pouco menos frustrante de trabalhar, mas ainda é AI." A queixa sugere que o salto no índice de inteligência não se traduz em experiência prática linearmente melhor.

Benchmarks podem regredir após launch

Um ponto que cruza as críticas é a desconfiança sobre a confiabilidade dos números. breckenedge começou a re-rodar avaliações do modelo interno da empresa dele semanas depois do lançamento e descobriu que o desempenho tinha regredido. "Os provedores de modelo querem provar rapidamente que são os melhores, as pessoas migram para eles, depois puxam o tapete." A observação ecoa uma queixa recorrente: benchmarks de lançamento nem sempre refletem a performance que o modelo terá quando as pessoas realmente tentarem usar em produção.

linuxrebe1 contou que voltou para a versão 4.8 porque o Opus 5 não seguia instruções direito. "Eu me pegava repetindo muitas vezes o que queria e o que estava tentando fazer. O Opus 5 era mais como haiku do que como 4.8 nesse aspecto." A comparação com Claude Haiku — modelo mais simples e barato — sugere que a versão mais recente sacrificou obediência em troca de capacidade bruta.

Do outro lado, mchusma defendeu que o setting "high" é o sweet spot. Benchmarks platô após "high", segundo ele, e seus testes iniciais mostram o modo funcionando muito bem. A página oficial da Artificial Analysis confirma que "high" aparece em outro link separado, indicando que é uma configuração diferente com resultados próprios.

O que todos reconhecem é que o Opus 5.5 é inteligente — o índice coloca ele bem acima da mediana de 25 pontos entre modelos comparáveis. A divergência está em quanto dessa inteligência chega ao código que desenvolvedor escreve no dia a dia. O contexto de 1 milhão de tokens ajuda, o preço de $4 entrada e $20 saída por milhão de tokens é "um pouco caro" segundo a própria análise, e o modelo gera 260 milhões de tokens no índice — quase três vezes mais verboso que a mediana.

Para quem avalia qual modelo usar em produção, o que resta é que "max" parece ser mais problema que solução na maioria dos casos práticos, "high" merece testes próprios, e benchmark de lançamento é ponto de partida, não verificação final. A única forma de saber se o modelo funciona para um caso específico continua sendo testar com dados reais e re-testar semanas depois.

Fontes

Modelos e LLMsHacker News
Como apuramos: as fontes consultadas estão indicadas nesta matéria para que você possa conferir as informações. Os números de estrelas e a posição no ranking refletem o momento da coleta. Conheça os critérios editoriais.