Modelos e LLMs

Anthropic promete desempenho de ponta por metade do preço

A empresa diz que o modelo supera concorrentes em código e tarefas de conhecimento.

Reprodução · anthropic.com

Anthropic anunciou Claude Opus 5 em 24 de julho de 2026. A página não registra comentários, e não há lados documentados na disputa técnica. Segundo a empresa, o modelo entrega inteligência próxima à de Claude Fable 5 por metade do preço e lidera avaliações de código e trabalho de conhecimento. Isso interessa a equipes que precisam automatizar software, pesquisa científica e tarefas no computador sem pagar o custo dos modelos mais fortes.

Claude Opus 5 combina pontuação e custo por tarefa

Claude Opus 5 é descrito pela Anthropic como um modelo de uso diário, mais eficiente que outros modelos e disponível imediatamente. A empresa afirma que ele virou o modelo padrão do Claude Max e o modelo mais forte do Claude Pro. Essa é a promessa central: “chega perto da inteligência de fronteira do Claude Fable 5 pela metade do preço”, segundo a Anthropic.

O número mais forte aparece no Frontier-Bench v0.1. A empresa diz que Opus 5 supera todos os outros modelos e mais que dobra o desempenho do Opus 4.8. Também reduz o custo por tarefa.

No CursorBench 3.2, a comparação muda. Com esforço máximo, o modelo fica a 0,5% da pontuação máxima de Fable 5, mas custa metade por tarefa.

Esse detalhe importa. Quem usa escolhe o nível de esforço do modelo para priorizar inteligência ou economizar tokens, acelerar respostas e reduzir custo. No cenário descrito pela Anthropic, Opus 5 entrega desempenho maior para um mesmo orçamento nos níveis high, xhigh e max.

A vantagem aparece também na execução completa. No ARC-AGI 3, o modelo alcança pontuação três vezes maior que a do segundo colocado. No Zapier AutomationBench, passa cerca de 1,5 vez mais tarefas que o próximo modelo pelo mesmo custo, inclusive quando roda no menor nível de esforço.

O modelo lidera testes, mas fica atrás em cibersegurança

O teste OSWorld 2.0 mede uso de computador. Nele, Anthropic afirma que Opus 5 supera os demais modelos em qualquer custo comparável. A empresa diz que ele ultrapassa o melhor resultado de Fable 5 gastando pouco mais de um terço. A lista de avaliações adicionais inclui GDPval-AA v2, HLE, AutomationBench e DeepSearchQA.

A melhora também chega à pesquisa científica. Opus 5 supera o antecessor em todas as avaliações de ciências da vida citadas pela Anthropic, que cobrem biologia estrutural, química orgânica e bioinformática. Em química orgânica, marca 10,2 pontos percentuais a mais no benchmark interno. Em tarefas sobre proteínas, fica 7,7 pontos percentuais acima.

As imagens mostram saídas mais fortes. A Anthropic apresenta uma visualização do fluxo de ar sobre objetos aerodinâmicos e não aerodinâmicos e uma ilustração interativa simplificada de uma célula. Esses exemplos apontam para usos que combinam código, imagem e interação. Ainda assim, não substituem uma avaliação independente.

A cibersegurança traz a ressalva técnica mais clara. O anúncio diz que Opus 5 continua atrás de Mythos 5. A própria Anthropic também afirma que o modelo verifica melhor o próprio trabalho e repete etapas até obter sucesso. O trecho disponível termina durante um exemplo de Frontier-Bench sobre reconstruir uma peça de máquina em 3D, sem informar o resultado.

A página consultada não traz comentários. O Hacker News registra zero pontos e zero comentários. Por isso, não há declarações de usuários, críticas ou contrapontos atribuíveis para sustentar dois lados do debate. Ainda está em aberto se as vantagens relatadas se mantêm fora dos testes da Anthropic e como o custo por tarefa muda em cargas reais. Equipes técnicas precisam medir esses pontos antes de trocar o modelo padrão.

Fontes

Modelos e LLMsHacker News
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.