Modelos e LLMs

OpenAI põe GPT-5.6 contra Claude Fable 5 em custo e código

A disputa envolve desempenho de agentes, preço por token e a escolha entre Codex e Claude Code.

A OpenAI lançou a família GPT-5.6 para uso geral, com os modelos Sol, Terra e Luna. O Sol marcou 53,6 no Agents’ Last Exam, 13,1 pontos acima do Claude Fable 5. A diferença interessa a equipes que escolhem modelos para programação, pesquisa e fluxos de trabalho longos. A página recebeu 1.561 pontos e 1.113 comentários no Hacker News.

O debate compara desempenho medido com uso real

A OpenAI apresenta o GPT-5.6 como uma família com três posições claras. Sol concentra a maior capacidade, Terra equilibra desempenho e custo, e Luna busca o menor custo entre os três. O modo ultra coordena múltiplos agentes em fluxos paralelos para acelerar tarefas complexas. O modelo também recebeu melhorias em uso de computador e julgamento de design.

Os números favorecem o Sol nos testes divulgados pela OpenAI. No Agents’ Last Exam, que mede fluxos profissionais longos em 55 áreas, o Sol superou o Fable 5 por 13,1 pontos no modo de raciocínio máximo e por 11,4 pontos no modo médio, com custo estimado de cerca de um quarto. Terra e Luna também superaram o Fable 5, segundo a empresa, por cerca de um dezesseis avos do custo.

O resultado muda conforme o teste. No Artificial Analysis Intelligence Index, o Sol ficou a menos de um ponto do Fable 5, terminou as tarefas 61% mais rápido e custou cerca de metade. No Artificial Analysis Coding Agent Index, alcançou 80, 2,8 pontos acima do Fable 5, usando menos da metade dos tokens de saída e custando cerca de um terço a menos. Esses números descrevem avaliações específicas, não garantem o mesmo ganho no código de cada empresa.

Syntaf resumiu a dúvida prática: “Sou usuário do Claude Code há muito tempo; ultimamente comecei a perceber que existem outros modelos excelentes que eu deveria testar, mas hesito em deixar o Claude Code para trás por algo novo. Qual é o consenso hoje sobre Codex contra Claude Code? Isso realmente importa mais?” A pergunta trata menos de uma tabela e mais de troca de ferramenta, integração e hábito de trabalho.

saberience aceitou a força dos resultados, mas pediu validação no uso: “São alegações e resultados bastante grandes! Estou animado para ver como será durante o uso.” O comentário também defendeu manter os dois modelos: “Tenho usado Fable e 5.5 intensamente e ainda acho que ambos têm lugar no meu conjunto de ferramentas.” Ele descreveu um processo em que um modelo cria planos e o outro faz uma revisão adversarial. A competição ajuda quando a equipe consegue comparar respostas em vez de confiar em uma só saída.

O custo menor não encerra a escolha

O preço também divide a leitura. A página lista o Sol a $5 por 1 milhão de tokens de entrada e $30 de saída; Terra custa $2.50 e $15; Luna, $1 e $6. Em 30 de julho de 2026, a OpenAI informou que reduziu o preço do Luna em 80% e o do Terra em 20%. rvz, porém, chamou atenção para a conta: “GPT‑5.6 tem preço por 1M tokens em três tamanhos de modelo: Sol custa $5 de entrada / $30 de saída; Terra custa $2.50 de entrada / $15 de saída; e Luna custa $1 de entrada / $6 de saída. Tão caro quanto Fable 5.”

A própria documentação da OpenAI recomenda mudar a forma de usar o modelo. Segundo minimaxir, instruções de sistema mais curtas melhoraram os resultados internos em cerca de 10% a 15%, reduziram os tokens em 41% a 66% e cortaram o custo em 33% a 67%. O guia também diz que o GPT-5.6 preserva as dimensões originais de imagens enviadas com detalhe original ou automático. Há uma ressalva operacional: o modelo responde pior a ordens genéricas como “seja conciso” e “mantenha curto”.

A decisão continua aberta porque os dados não mostram toda a experiência de desenvolvimento. O thread reúne muita participação, mas apenas cinco comentários foram coletados para análise. Quem escolhe entre Codex e Claude Code precisa medir suas próprias tarefas, o custo total dos tokens e a qualidade das revisões. O GPT-5.6 oferece bons números; a equipe ainda precisa descobrir se eles se repetem no próprio fluxo.

Fontes

Modelos e LLMsHacker News
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.