AirLLM roda Kimi K3 de 2.8T com 3.72 GB de VRAM
Projeto de lyogavin divide modelos grandes em camadas para executar inferência com pouca memória.
Projeto de lyogavin divide modelos grandes em camadas para executar inferência com pouca memória.
O AirLLM é uma ferramenta de código aberto que executa modelos de linguagem grandes em GPUs com pouca memória. lyogavin criou o projeto em 2023-06-12. Na versão v3.1.0, o AirLLM rodou o Kimi K3 (2.8T) com pico de 3.72 GB de VRAM. Isso interessa a quem precisa fazer inferência local sem uma GPU de alta capacidade.
Nos modelos esparsos MoE, o AirLLM transmite um especialista por vez, em vez de manter a camada inteira na GPU. O Kimi K3 tem 896 especialistas por camada, mas cada token aciona somente 16 deles. Uma camada expandida ocupa cerca de 55GB; cada token precisa de aproximadamente 1GB.
Os pesos MXFP4 atravessam o PCIe compactados e expandem na GPU. Esse processo movimenta 4x menos dados. A execução fica limitada pelo acesso ao disco.
O teste usou uma RTX 6000 Ada (48GB) contra o checkpoint completo de 1.56TB. O pico de VRAM chegou a 3.72 GB durante a geração e a 0.83 GB depois da inicialização. A inicialização levou 900 s, enquanto a geração consumiu 292 s/token.
O armazenamento também exige uma técnica própria. Uma divisão ingênua pediria 3.12TB para um modelo de 1.56TB, mas os shards do Kimi K3 contêm um módulo cada. O AirLLM cria hardlinks para as camadas divididas, sem copiar os arquivos originais.
A instalação do Kimi K3 começa com três pacotes:
pip install airllm compressed-tensors flash-attn
O flash-attn é obrigatório porque o código do Kimi K3 substitui qualquer implementação de atenção escolhida pelo usuário. A máquina precisa de uma compilação do PyTorch para CUDA 12, já que não existe wheel pré-compilado do flash-attn para CUDA 13.
O transformers deve ficar na série 4.56.x. O código remoto do Kimi K3 não carrega na série 5.x. Esses requisitos pertencem ao Kimi K3 e não aparecem como exigência geral para todos os modelos compatíveis.
Depois da instalação, o usuário informa o repositório do modelo no Hugging Face ou aponta para um caminho local. Na primeira execução, o AirLLM separa o modelo em camadas e grava os shards no cache do Hugging Face ou no caminho configurado. O disco precisa comportar essa etapa.
A inferência roda localmente, mas a adoção pode depender do Hugging Face para obter o modelo. O projeto também registra suporte a inferência em CPU, modelos não fragmentados e execução no MacOS. A CPU não resolve, porém, o tempo de geração medido para o Kimi K3.
O README cita Llama 3.1 405B em 8GB, DeepSeek-V3 (671B) em ~12GB e Qwen3-235B em ~3GB. A compressão baseada em quantização por blocos promete acelerar a inferência em até 3x, com perda de precisão descrita como quase ignorável. Quem precisa de resposta rápida deve considerar os 900 s de inicialização e os 292 s/token medidos no Kimi K3.
O repositório tem 30.177 estrelas, 3.210 forks e 133 issues abertas. Criado há 1153 dias, ele recebeu o último commit em 2026-08-08 e está na versão v3.1.0, publicada em 2026-07-29. O projeto usa Jupyter Notebook como linguagem e adota a licença Apache-2.0, que permite uso, modificação e redistribuição conforme seus termos. A ferramenta não serve para quem não tem CUDA 12, espaço para checkpoints grandes ou tolerância à geração lenta.