Moonshot anuncia Kimi K3 com 2.8 trilhões de parâmetros
O modelo já roda no site e na API, mas terá pesos abertos até 27 de julho.
O modelo já roda no site e na API, mas terá pesos abertos até 27 de julho.
A Moonshot AI anunciou o Kimi K3 em 16th July 2026 como seu modelo mais capaz, com 2.8 trillion parameters. O sistema já está disponível pelo site e pela API da empresa, enquanto a versão com pesos abertos só chega “by July 27, 2026”. A novidade interessa a quem usa modelos para programação, geração de conteúdo e tarefas longas, mas os principais resultados ainda vêm de benchmarks divulgados pela própria empresa.
A Moonshot AI chama o K3 de primeiro “open 3T-class model”. O número arredonda os 2.8 trillion parameters para 3T e supera o DeepSeek’s 1.6T v4 Pro, que antes ocupava essa posição segundo o anúncio. O K3 também tem mais que o dobro do tamanho do Kimi K2.6, descrito como um modelo de 1T.
O preço acompanha o salto. A empresa cobra $3/million input tokens e $15/million output tokens, o mesmo nível da série Claude Sonnet e o maior preço já aplicado por um AI lab chinês, segundo Simon Willison’s Weblog. O Kimi K2.6 custava $0.95/$4. Mais capacidade custa mais.
A Artificial Analysis calculou custo médio de $0.94 por tarefa para o K3. O valor fica próximo do GPT-5.6 Sol, com $1.04, equivale a cerca de metade do custo do Opus 4.8, de $1.80, e supera os concorrentes de pesos abertos citados no relatório. O modelo também usou 21% menos output tokens que o K2.6 no Artificial Analysis Intelligence Index.
Os números de desempenho têm uma ressalva importante. A Moonshot AI afirma que o K3 supera principalmente Claude Opus 4.8 max e GPT-5.5 high, mas perde para Claude Fable 5 e GPT-5.6 Sol. No teste privado de trabalho intelectual de longa duração da Artificial Analysis, o modelo alcançou Elo de 1547, 732 pontos acima do Kimi K2.6 e atrás apenas do Claude Fable 5.
No Arena.ai’s Frontend Code arena, o K3 aparece como líder, acima até do Claude Fable 5. Simon Willison chegou a essa versão usando OpenRouter, sem criar uma chave de API da Moonshot, e executou o comando llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'. O modelo recebeu 95 input tokens e gerou 16,658 output tokens.
Desse total, 13,241 tokens vieram do raciocínio. A tarefa custou 25 cents. Quando Willison reenviou ao K3 a imagem SVG gerada, o modelo descreveu a cena por 0.6 cents, mostrando que aceita image input, mas o teste não mede uso confiável de ferramentas em conversas longas.
Willison diz que o benchmark do pelicano, criado 21 months ago, perdeu a relação com a qualidade geral dos modelos. Ele afirma que os resultados de GPT-5.6 e Claude Fable 5 ficam atrás do GLM-5.2, embora não considere o GLM um modelo da classe Fable. O próprio autor trata o teste como um estímulo para executar uma tarefa real, não como placar definitivo.
A limitação declarada é central: o pelicano não avalia agentic tool calling nem a capacidade de operar ferramentas com confiabilidade conforme a conversa cresce. O K3 também oferece apenas um nível de raciocínio, “max”, e gastou 13,241 reasoning tokens para produzir 3,417 tokens de resposta. O comunicado demonstra a geração do SVG e a entrada visual; os demais resultados dependem de relatos da Moonshot AI e de avaliações externas citadas por Willison.