Simon Willison mostra jogo criado pelo Codex em 52 minutos
A demonstração repete o mesmo prompt usado com Claude Fable 5 e expõe um bug visual.
A demonstração repete o mesmo prompt usado com Claude Fable 5 e expõe um bug visual.
Simon Willison publicou em 7 de agosto de 2026 um jogo criado pelo Codex Desktop com GPT-5.6 Sol Ultra. O sistema levou 52 minutos para produzir Moonlight & Mayhem, uma aventura jogável com guaxinins. Willison afirmou que o resultado ficou “much better”. O caso interessa a quem usa agentes para criar jogos a partir de uma única instrução.
Willison repetiu no Codex Desktop o prompt usado com Claude Fable 5. A ideia original nasceu de uma descrição criada com GPT-3 e DALL-E quatro anos atrás. Na versão de Fable, o jogador controlava um único guaxinim no quintal, coletando moedas e peixes.
A criação do GPT-5.6 Sol Ultra leva a ação para um museu. O jogador precisa resgatar dois companheiros e empilhar os três guaxinins para retirar uma sardinha dourada de uma vitrine. A missão se aproxima mais do conceito original de uma equipe especializada em roubos.
O modo usado pelo Codex faz uso agressivo de subagentes. O post não informa quantos agentes participaram nem como o sistema dividiu o trabalho. O único tempo divulgado é o total de 52 minutos.
O resultado está disponível em uma página publicada por Willison. O repositório no GitHub reúne o código do projeto, as texturas e os prompts gerados com gpt-image-2. Willison também publicou a transcrição completa da sessão do Codex.
A primeira versão tinha um defeito visual evidente. Cada guaxinim aparecia com uma esfera preta enorme sobre a cabeça, descrita por Willison como um olho ampliado ao tamanho de uma esfera gigante flutuante. O agente não percebeu o erro, mesmo depois de revisar capturas de tela durante o desenvolvimento.
Willison corrigiu o problema com duas instruções: “Why do the raccoons have huge black spheres on them?” e “Fix it”. O Codex gerou então uma nova versão. A correção exigiu intervenção manual.
A demonstração mostra que o agente produziu um jogo funcional a partir de um prompt único. Ela não mostra que o Codex consegue revisar sozinho todos os defeitos do projeto. Nesse teste, o próprio autor precisou apontar o problema visual.
O acesso descrito por Willison envolve o Codex Desktop com GPT-5.6 Sol Ultra. Ele usou uma assinatura mensal do Codex e consultou o AgentsView para estimar quanto a sessão custaria com os preços integrais da API. O post não informa o valor dessa estimativa.
A página pública permite jogar a versão criada pelo Codex. O repositório oferece os arquivos e a transcrição para quem quiser examinar o processo. O comunicado não informa requisitos de hardware para executar o jogo, nem anuncia uma versão separada do modelo ou uma distribuição fora desses links.
A comparação coloca Claude Fable 5 e GPT-5.6 Sol Ultra diante do mesmo prompt. Willison considerou a criação do Codex superior, mas a evidência apresentada é um jogo, não um benchmark controlado. O resultado também inclui um bug que o agente não detectou sozinho.