Modelos e LLMs

OpenAI atribui triplo de pontuação a duas configurações de API

A empresa diz que GPT-5.6 Sol subiu de 13.3% para 38.3% no conjunto público do teste.

A OpenAI anunciou em 2026-07-29 que duas configurações da Responses API quase triplicaram a pontuação do GPT-5.6 Sol no ARC-AGI-3, teste com jogos de quebra-cabeça em 2D. A empresa ativou retained reasoning e compaction, preservando o raciocínio entre ações e resumindo o histórico quando necessário. No conjunto público, o modelo passou de 13.3% com o harness oficial para 38.3% com as duas opções. Isso muda a leitura para quem compara agentes: o resultado depende não só do modelo, mas também da forma como a API mantém contexto.

O harness apagava o raciocínio a cada jogada

O ARC-AGI-3 apresenta jogos desconhecidos sem instruções explícitas. O agente precisa explorar cada fase e descobrir sozinho como ela funciona. O teste usa um harness genérico, sem ferramentas ou recursos especiais, para expor limitações dos modelos e facilitar comparações entre eles.

A OpenAI diz que esse desenho descartava todo o raciocínio privado depois de cada ação. GPT-5.6 Sol ainda recebia o registro dos movimentos anteriores e notas breves, mas perdia os planos e as conclusões que levaram a cada jogada. O modelo precisava interpretar o jogo novamente a cada turno.

O harness também aplicava uma janela de truncamento progressivo. Conforme o histórico crescia, ações antigas deixavam de aparecer. O agente perdia tanto o raciocínio quanto parte da memória das próprias ações. A empresa atribui parte da dificuldade a essa combinação.

A OpenAI compara esse comportamento com o uso de GPT-5.6 em ChatGPT e Codex. Nesses produtos, as mensagens privadas de pensamento permanecem no histórico da conversa. Quando o contexto fica longo demais, o sistema resume o conteúdo e continua.

Respostas preservadas reduziram tokens e elevaram a nota

Para reproduzir esse arranjo, a OpenAI adaptou o teste à Responses API. Em GPT-5.6, o desenvolvedor passa o ID da resposta anterior, e a API preserva o raciocínio entre chamadas de ferramenta e turnos. Esse é o requisito técnico descrito para manter o contexto entre ações.

O modelo passou menos tempo pensando antes de cada jogada. Ele não precisou reconstruir o estado do jogo do zero. A compaction também reduziu em seis vezes a quantidade de tokens de saída no conjunto público, segundo a OpenAI.

A empresa cita resultados diferentes para recortes diferentes. No ARC-AGI-3, GPT-5.6 Sol marcou 7.8%, enquanto GPT-5.5 marcou 0.4%. No conjunto público avaliado com o harness oficial, GPT-5.6 Sol marcou 13.3%; com retained reasoning e compaction, chegou a 38.3%.

A métrica compara a eficiência das ações do modelo com uma linha de base humana. A OpenAI estima que o testador humano médio marcou 48%, usando registros oficiais de partidas. Os modelos não recebem a própria pontuação durante o jogo e veem apenas uma representação textual de cada quadro e o nível atual.

O anúncio também afirma que GPT-5.6 Sol resolve os seis níveis de um jogo mostrado no vídeo, enquanto nenhum modelo de fronteira no placar resolve além do primeiro com o harness oficial. A demonstração sustenta o efeito naquele jogo. Ela não prova que as configurações produzirão o mesmo ganho em todos os testes.

A OpenAI não informa no comunicado uma nova versão pública do ARC-AGI-3, uma oferta comercial específica ou um acesso separado às configurações. O texto cita a Responses API e os usos em ChatGPT e Codex, mas não detalha quais contas podem usar esses recursos. A limitação declarada permanece: o resultado depende do harness, das opções da API e do conjunto de tarefas avaliado.

Fontes

OpenAIModelos e LLMs
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.