Reprodução · toolerific.ai

O AirLLM é uma ferramenta de código aberto que executa modelos de linguagem grandes em GPUs com pouca memória. lyogavin criou o projeto em 2023-06-12. Na versão v3.1.0, o AirLLM rodou o Kimi K3 (2.8T) com pico de 3.72 GB de VRAM. Isso interessa a quem precisa fazer inferência local sem uma GPU de alta capacidade.

O AirLLM carrega apenas os especialistas usados

Nos modelos esparsos MoE, o AirLLM transmite um especialista por vez, em vez de manter a camada inteira na GPU. O Kimi K3 tem 896 especialistas por camada, mas cada token aciona somente 16 deles. Uma camada expandida ocupa cerca de 55GB; cada token precisa de aproximadamente 1GB.

Os pesos MXFP4 atravessam o PCIe compactados e expandem na GPU. Esse processo movimenta 4x menos dados. A execução fica limitada pelo acesso ao disco.

O teste usou uma RTX 6000 Ada (48GB) contra o checkpoint completo de 1.56TB. O pico de VRAM chegou a 3.72 GB durante a geração e a 0.83 GB depois da inicialização. A inicialização levou 900 s, enquanto a geração consumiu 292 s/token.

O armazenamento também exige uma técnica própria. Uma divisão ingênua pediria 3.12TB para um modelo de 1.56TB, mas os shards do Kimi K3 contêm um módulo cada. O AirLLM cria hardlinks para as camadas divididas, sem copiar os arquivos originais.

Kimi K3 exige versões específicas

A instalação do Kimi K3 começa com três pacotes:

pip install airllm compressed-tensors flash-attn

O flash-attn é obrigatório porque o código do Kimi K3 substitui qualquer implementação de atenção escolhida pelo usuário. A máquina precisa de uma compilação do PyTorch para CUDA 12, já que não existe wheel pré-compilado do flash-attn para CUDA 13.

O transformers deve ficar na série 4.56.x. O código remoto do Kimi K3 não carrega na série 5.x. Esses requisitos pertencem ao Kimi K3 e não aparecem como exigência geral para todos os modelos compatíveis.

Depois da instalação, o usuário informa o repositório do modelo no Hugging Face ou aponta para um caminho local. Na primeira execução, o AirLLM separa o modelo em camadas e grava os shards no cache do Hugging Face ou no caminho configurado. O disco precisa comportar essa etapa.

A inferência roda localmente, mas a adoção pode depender do Hugging Face para obter o modelo. O projeto também registra suporte a inferência em CPU, modelos não fragmentados e execução no MacOS. A CPU não resolve, porém, o tempo de geração medido para o Kimi K3.

O README cita Llama 3.1 405B em 8GB, DeepSeek-V3 (671B) em ~12GB e Qwen3-235B em ~3GB. A compressão baseada em quantização por blocos promete acelerar a inferência em até 3x, com perda de precisão descrita como quase ignorável. Quem precisa de resposta rápida deve considerar os 900 s de inicialização e os 292 s/token medidos no Kimi K3.

O repositório tem 30.177 estrelas, 3.210 forks e 133 issues abertas. Criado há 1153 dias, ele recebeu o último commit em 2026-08-08 e está na versão v3.1.0, publicada em 2026-07-29. O projeto usa Jupyter Notebook como linguagem e adota a licença Apache-2.0, que permite uso, modificação e redistribuição conforme seus termos. A ferramenta não serve para quem não tem CUDA 12, espaço para checkpoints grandes ou tolerância à geração lenta.

Fontes

Jupyter NotebookApache-2.0IA Local e Self-HostedTrendshift
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.