Reprodução · miro.medium.com

O kimi-k3-in-c roda o modelo Kimi K3 em uma única CPU, sem GPU ou serviço externo. Fareed Khan criou o projeto em 2026-08-01 e publicou o código em C99 sob a licença Apache-2.0. O número que chama atenção é o tamanho: 2,78 trilhões de parâmetros em um checkpoint de 1,56 TB, com pico medido de 8,24 GB de RAM. A ferramenta serve a quem aceita gerar texto lentamente para manter a inferência na própria máquina.

O motor combina disco, RAM e pesos compactados

O repositório FareedKhan-dev/kimi-k3-in-c implementa o motor sem BLAS, framework de aprendizado profundo ou GPU. O cálculo roda localmente em CPU, e o dossiê não descreve dependência de API ou serviço externo para gerar tokens.

O tronco denso fica na memória até a profundidade escolhida. O restante sai do disco sob demanda. Os 1,45 TB de especialistas roteados nunca ficam residentes, porque o motor multiplica esses pesos diretamente em formato compactado de 4 bits.

A arquitetura usa KDA para manter uma memória que não cresce com a sequência. A MLA troca 96 cabeças por uma representação latente. O modelo tem 93 camadas e escolhe 16 especialistas entre 896.

O código empacota o tronco para fazer uma leitura por camada. Kernels fundidos para fp32, bf16 e MXFP4 reduziram em cerca de oito vezes o cálculo por token. Os caminhos escalar e AVX2 mantêm saída idêntica bit a bit.

A versão v1.0.0 também paraleliza a recorrência KDA entre cabeças. A flag --spec N ativa decodificação especulativa exata. O recurso acelera a geração sem alterar os tokens produzidos.

Baixar 1,56 TB define o primeiro uso

A adoção começa com o clone do repositório e a compilação do motor C99. O comando rápido do README compila e verifica o código sem baixar o modelo. Para gerar texto, o operador precisa executar o caminho completo e obter o checkpoint.

O script download-model.sh fixa uma revisão imutável, verifica o checksum e recusa continuar quando falta espaço livre. Os scripts já vêm marcados como executáveis. O primeiro comando documentado funciona em um clone limpo.

A opção --preset auto calcula os orçamentos do tronco e do cache de especialistas com base na RAM livre da máquina. O cálculo prioriza o tronco. Em máquinas com pouca memória, o motor lê o modelo do disco a cada passo.

A RAM muda o relógio, não a resposta. O README registra 26,5 segundos por token com 8 GB, 24,2 segundos com 32 GB, 19,8 segundos com 64 GB e 5,6 segundos com 128 GB ou mais. Os tokens permaneceram idênticos byte a byte entre esses orçamentos.

O disco continua importante nas máquinas menores. Com 128 GB ou mais, o modelo cabe inteiro na memória e deixa de esperar pelo armazenamento. --save-state e --load-state retomam uma conversa sem reler o prompt, com ganho de 3,9 vezes na segunda rodada.

O Kimi K3 é um modelo-base, sem template de chat. Uma continuação como “Paris.” segue o texto recebido, em vez de responder a uma conversa formatada. A ferramenta não serve a quem precisa de baixa latência, não tem 1,56 TB livres ou depende de GPU.

O projeto tinha 3.841 estrelas, 593 forks e 6 issues abertas. Fareed Khan publicou o último commit em 2026-08-07, mesma data da versão v1.0.0. Com idade registrada de 7 dias, o interesse cresceu rápido, mas o histórico ainda é curto para avaliar manutenção prolongada.

A licença Apache-2.0 permite usar, modificar e redistribuir o código conforme suas condições. O motor inteiro mede 176 KB. Ele atende pesquisadores de inferência em C e usuários dispostos a trocar velocidade por execução local.

Fontes

CApache-2.0Projetos e FerramentasTrendshift
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.