Modelos e LLMs

Grok 4.5 chega com 80 TPS e resultados mistos em código

A SpaceXAI lançou o modelo em 16 de julho de 2026 para tarefas de programação, agentes e trabalho técnico.

Reprodução · x.ai

A disputa sobre o Grok 4.5 envolve uma pergunta direta: ele supera rivais em engenharia ou apenas combina bons resultados com uma divulgação favorável? A SpaceXAI lançou o modelo em 16 de julho de 2026, com velocidade declarada de 80 TPS e treinamento em dezenas de milhares de GPUs NVIDIA GB300. O modelo interessa a equipes que usam agentes para programar, operar terminais e criar aplicações.

Os testes mostram vantagem em apenas parte dos casos

A SpaceXAI afirma que o Grok 4.5 é “nosso modelo mais forte até agora”. A empresa treinou o sistema com dados de programação, ciência, engenharia e matemática. Também aplicou deduplicação, quality scoring e seleção por domínio para montar os dados.

Os resultados sustentam parte dessa promessa. No SWE Marathon, o modelo alcançou 29,0% de resolução pass@1, acima de Opus 4.8 (max), com 26,0%, e Fable (max), com 24,0%. No Terminal Bench 2.1, marcou 83,3%, praticamente empatado com GPT 5.5 (xhigh), que registrou 83,4%.

A liderança desaparece em outros testes. No DeepSWE 1.0, o Grok 4.5 chegou a 62,0%, abaixo de Fable (max), com 66,1%, e GPT 5.5 (xhigh), com 64,31%. No DeepSWE 1.1, marcou 53%, atrás de Fable (max), GPT 5.5 (xhigh) e Opus 4.8 (max).

No SWE Bench Pro, a diferença ficou maior. O Grok 4.5 alcançou 64,7%, enquanto Fable (max) chegou a 80,4% e Opus 4.8 (max), a 69,2%. O resultado superou GPT 5.5 (xhigh), com 58,6%, mas não colocou o modelo no topo.

A comparação exige cuidado porque os testes não usaram sempre o mesmo método. No DeepSWE 1.0, cada modelo rodou com o harness do próprio provedor. No DeepSWE 1.1, a Datacurve usou o mini-swe-agent harness. A SpaceXAI diz que os números dos concorrentes vieram de system cards ou leaderboards publicados por seus desenvolvedores.

Não existem comentários para representar lados opostos. O registro informa 0 pontos e 0 comentários no Hacker News. Por isso, não há nomes de comentaristas nem citações atribuíveis a participantes; as frases citadas aqui vêm da página da SpaceXAI, a única fonte disponível.

A velocidade depende da eficiência prometida

A SpaceXAI diz que o Grok 4.5 é “mais rápido que modelos flash”. A empresa declara 80 TPS e afirma que o modelo entrega “duas vezes mais eficiência de tokens” que modelos líderes recentes nas mesmas tarefas. O trecho disponível não informa a tabela completa usada para calcular essa média.

A diferença pode reduzir latência em agentes que executam muitas etapas. Também pode cortar o volume de tokens processados. Isso só ajuda se o modelo mantiver a qualidade quando a tarefa exige várias ações.

A empresa afirma que o treinamento cobriu centenas de milhares de tarefas. O foco ficou em software engineering de várias etapas e outros trabalhos técnicos. Avaliadores automáticos e baseados em modelos deram as notas.

A infraestrutura usou dezenas de milhares de GPUs NVIDIA GB300. A pilha também permite treinamento assíncrono, enquanto agentes executam tarefas por muitas horas. A SpaceXAI resume o efeito assim: “o resultado é um raciocínio mais inteligente e eficiente em tarefas reais de engenharia e agentic”.

O modelo ainda foi treinado ao lado do Cursor. A página não explica como essa colaboração alterou os dados, o treinamento ou os resultados. Também mostra aplicações criadas com um único prompt, incluindo uma simulação do universo em Three.js.

Para uma equipe técnica, o ponto em aberto permanece concreto. O Grok 4.5 lidera o SWE Marathon, quase empata no Terminal Bench 2.1 e perde em DeepSWE e SWE Bench Pro. Sem comentários públicos e sem a tabela completa de eficiência, a decisão precisa usar tarefas e métricas próprias.

Fontes

Modelos e LLMsHacker News
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.