Anthropic lança Claude Haiku 5.5 com corte de até 90% no preço dos tokens
Modelo compacto supera antecessor em tarefas autônomas, amplia janela de contexto para 1 milhão de tokens e chega às principais nuvens.
Edição: Anderson Gomes
· 3 min de leitura

A Anthropic lançou o Claude Haiku 5.5 em 7 de outubro de 2026 como seu modelo compacto mais rápido e barato. A empresa reduziu o custo dos tokens em até 90% para requisições de até 100.000 tokens, enquanto o desempenho no teste de uso de computador OSWorld-2.1 saltou de 15,7% para 72,4%. O pacote atende engenheiros que consultam bancos de dados em massa, classificam registros e prestam atendimento ao cliente em tempo real. As três grandes nuvens já distribuem o modelo.
Quando programa com agentes autônomos, o modelo marcou 39,2% no Terminal-Bench 4.0, teste em que o Haiku 4.5 havia zerado. No exame de conhecimento GDPval-AA v2.1, a pontuação subiu de 735 para 1.620 pontos. Já no Humanity's Last Exam, o índice foi de 10,2% para 45,9% sem ferramentas e atingiu 57,4% com recursos externos. A empresa também expandiu a janela de contexto de 200.000 tokens para 1 milhão de tokens. O avanço técnico impressiona. Quem paga a conta, porém, precisa examinar as regras de cobrança.
Gasto maior de tokens corrói o desconto na ponta
Cerca de 90% das requisições anteriores da família Haiku entram na faixa de desconto de até 100.000 tokens, segundo a fornecedora. Nesses limites, ler o cache custa $0.01 por milhão de tokens, escrever no cache sai a $0.125, enviar entradas custa $0.10 e receber saídas fica em $0.50. Acima de 100.000 tokens, a tabela quintuplica: $0.05 para ler cache, $0.625 para gravar, $0.50 na entrada e $2.50 na saída por milhão. Para complicar, a Anthropic adotou um tokenizador novo que gasta mais tokens por tarefa, repetindo o salto de cerca de 30% no consumo visto nos modelos Opus 4.x. A economia real encolhe.
Pesquisadores da plataforma independente Artificial Analysis confirmam essa pressão no volume de saída. No Intelligence Index, o Haiku 5.5 lidera entre os modelos pequenos com nota 43, superando GLM-5.3 Flash (42), Gemini 3.8 Flash (41) e GPT-6 Luna (38). Para atingir essa nota máxima, contudo, quem opera o modelo gasta cerca de 162.000 tokens de saída por tarefa. A cifra mais que triplica os 50.000 tokens exigidos pelo concorrente direto GPT-6 Luna. No esforço alto, ambos empatam com nota 38, mas a Anthropic ainda consome 55.000 tokens contra 50.000 do rival. Passar do nível extra-alto para o esforço máximo rende apenas dois pontos extras e encarece o uso em 1,8 vez. O ganho marginal custa caro.
OpenAI vence em eficiência e cobra menos por tarefa
Ao medir a fronteira de Pareto entre desempenho e recursos consumidos, a OpenAI assume a dianteira. No esforço máximo, o Haiku 5.5 atinge nota 43 ao custo de $0.21 por tarefa, enquanto o GPT-6 Luna alcança patamar similar por cerca de um terço desse valor. A precisão factual também expõe contrastes. O Haiku 5.5 acertou 36% das perguntas no teste AA-Omniscience, contra 44% do concorrente da OpenAI. Em compensação, quem usa o modelo da Anthropic sofre menos com alucinações: ele errou em 40% dos casos avaliados, contra 77% do GPT-6 Luna, e admitiu com mais frequência quando não sabia a resposta.
Provedores de tecnologia abriram uma guerra de preços para reter desenvolvedores de alto tráfego. Além de baratear o modelo de entrada, a Anthropic cortou pela metade o custo para ler o cache do Claude Sonnet 5.5 e liberou créditos mensais de API para assinantes. A hierarquia entre as categorias continua nítida. O Haiku 5.5 ainda fica 13 pontos atrás do Sonnet 5.5 no ranking da Artificial Analysis e pontua abaixo dele em todas as tarefas complexas de trabalho. O modelo menor ganha velocidade e automação operacional, mas não substitui a camada superior de raciocínio.
- The Decoder
- Modelos e LLMs

xAI lança modelo de voz 2.0 com foco em áudio ruidoso e telefonia
· 3 min de leitura

xAI lança Grok 4.7 com foco em código e corte agressivo de preço
· 3 min de leitura


Executivos da OpenAI sabiam que pirataria em massa para IA era ilegal
· 3 min de leitura