Modelos e LLMs

Codex cria jogo de guaxinins em 52 minutos com GPT-5.6

Simon Willison comparou o resultado com Claude Fable 5 e encontrou um bug visual que o agente não detectou sozinho.

Reprodução · Simon Willison

Simon Willison publicou em 7 de agosto de 2026 um jogo criado pelo Codex Desktop com GPT-5.6 Sol Ultra. O projeto levou 52 minutos e coloca três guaxinins em um museu para roubar uma sardinha dourada. A versão pode ser jogada no navegador, e o código está no GitHub.

O agente criou uma missão mais próxima do conceito original

Willison usou exatamente o mesmo prompt que havia enviado ao Claude Fable 5. A ideia original surgiu de um texto criado com GPT-3 e DALL-E quatro anos atrás: uma equipe de guaxinins dedicada a roubos.

Claude Fable 5 transformou essa proposta em um jogo de um guaxinim correndo por um quintal para coletar moedas e peixes. GPT-5.6 Sol Ultra criou uma missão diferente. O jogador entra em um museu, resgata dois companheiros e empilha os três animais para retirar a sardinha dourada de uma vitrine.

A versão de Codex rodou no modo em que Sol usa subagentes de forma “aggressive”, segundo a descrição de Willison. O autor afirmou que o resultado ficou “much better”. Essa avaliação vem do próprio autor, não de um benchmark independente.

O projeto publicado se chama Moonlight & Mayhem. O repositório no GitHub reúne as texturas e os prompts que o sistema gerou com gpt-image-2. Willison também compartilhou a transcrição completa da sessão do Codex.

A demonstração mostra um jogo funcional. Ela não prova que GPT-5.6 Sol Ultra supera Claude Fable 5 em qualquer tarefa de criação de jogos. A comparação usa um único prompt e dois projetos.

A primeira versão também trouxe um defeito visual evidente. Cada guaxinim tinha uma esfera preta enorme sobre a cabeça, como se fosse um olho ampliado.

Willison revisou capturas de tela durante o desenvolvimento, mas o Codex não percebeu nem corrigiu o problema. O autor resolveu a falha com duas instruções: “Why do the raccoons have huge black spheres on them?” e, depois, “Fix it”.

O resultado corrigido está disponível em outra versão jogável. O episódio expõe uma limitação do processo: examinar capturas de tela não garantiu que o agente encontrasse um erro visual básico.

A sessão consumiu 52 minutos. Willison incluiu uma estimativa do AgentsView para o custo caso o usuário pagasse os preços integrais da API, em vez de usar uma assinatura mensal do Codex. O post não informa o valor dessa estimativa.

As versões prontas podem ser acessadas pelo navegador, e o código pode ser consultado no GitHub. Para repetir a sessão, o leitor precisa usar o Codex Desktop com GPT-5.6 Sol Ultra; o anúncio não informa uma liberação separada do modelo nem requisitos de hardware.

O teste faz parte de uma sequência de experiências de Willison com agentes de código. Em 5 de agosto de 2026, ele publicou o jogo criado com Claude Fable 5; em 7 de agosto de 2026, mostrou a alternativa feita pelo Codex. O material sustenta uma comparação prática, não uma conclusão ampla sobre os dois sistemas.

Fontes

Simon WillisonModelos e LLMs
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.