OpenAI reduz em até 80% o custo de uso dos modelos GPT-5.6
Luna fica 80% mais barata, Terra cai 20% e Sol ganha modo até 2,5 vezes mais rápido na API.
Luna fica 80% mais barata, Terra cai 20% e Sol ganha modo até 2,5 vezes mais rápido na API.
A OpenAI anunciou em 2026-07-30 cortes de até 80% nos preços dos modelos GPT-5.6 Luna e Terra, além de um modo mais rápido para o GPT-5.6 Sol na API. Luna atende trabalhos em alto volume; Terra mira tarefas cotidianas; Sol preserva a inteligência e reduz o tempo de resposta. As mudanças valem a partir do anúncio e também alteram como o uso entra nas assinaturas pagas do Codex e do ChatGPT Work.
A OpenAI cortou em 80% o custo do Luna e em 20% o do Terra. A empresa chama Luna de seu modelo mais rápido e acessível, enquanto posiciona Terra para o trabalho diário. O comunicado não informa valores absolutos.
Luna também usa ferramentas e conclui fluxos com várias etapas. Isso amplia, segundo a OpenAI, os casos em que empresas conseguem rodar tarefas de alto volume sem pagar pelo nível máximo de inteligência em todas as etapas. A escolha depende do resultado exigido, do custo do erro, da urgência e da escala.
A empresa afirma que Luna entrega desempenho comparável ao de modelos que eram de fronteira um ano atrás, por cerca de 6 centavos do custo por tarefa e com quase nove vezes mais velocidade. No Agents’ Last Exam, a OpenAI diz que Luna superou Fable 5 em trabalho profissional, com custo estimado por tarefa quase 99% menor. Esses números vêm do comunicado da própria empresa.
Um fluxo de programação pode usar Sol para resolver incertezas e montar o plano. Depois, Luna implementa mudanças definidas, escreve e executa testes e avalia os resultados. A OpenAI apresenta esse arranjo como uma forma de combinar modelos conforme o valor de cada etapa, não como uma exigência para usar a família GPT-5.6.
A OpenAI substituiu o Priority Processing pelo Fast mode na API. No GPT-5.6 Sol, o modo entrega velocidade de até 2,5 vezes a do processamento Standard, pelo dobro do preço, sem mudança declarada na inteligência do modelo. Solicitações marcadas com priority passam automaticamente a usar o Fast mode.
A empresa atribui os cortes a melhorias no modelo, nos sistemas de inferência e no mecanismo que conecta agentes a ferramentas e contexto. Melhor roteamento mantém o hardware ocupado, o software de produção gera tokens com mais eficiência e o gerenciamento de contexto evita repetir trabalho concluído. A OpenAI diz que isso reduz tempo, tokens e custo por resultado com o mesmo poder computacional.
Segundo o comunicado, o próprio Sol reescreveu e otimizou kernels de produção, criou e executou centenas de experimentos para melhorar a geração de tokens e monitorou o treinamento. A OpenAI afirma que o trabalho nos kernels reduziu em 20% o custo total de servir o modelo, enquanto os experimentos elevaram a eficiência da geração de tokens em mais de 15%. O texto não apresenta código, metodologia detalhada ou validação independente desses resultados.
A disponibilidade começa no próprio dia do anúncio. A OpenAI não detalha requisito técnico de acesso, limite de uso ou quais recursos ainda não foram liberados. O comunicado também não informa valores absolutos, regiões atendidas nem condições específicas além da API, do Codex e do ChatGPT Work.