JustVugg apresenta motor para modelos de 2,8 trilhões de parâmetros
Projeto em C usa disco, RAM e VRAM como uma hierarquia única, mas não traz benchmark independente no debate.
Projeto em C usa disco, RAM e VRAM como uma hierarquia única, mas não traz benchmark independente no debate.
O Colibrì é um motor de inferência em C que roda modelos MoE gigantes no hardware disponível. O projeto JustVugg não informa quando publicou a ferramenta, mas diz suportar modelos de 744B a 2.8T parâmetros, sem dependências de engine. A proposta serve a quem quer testar modelos grandes sem depender apenas de muita VRAM, embora a página não mostre debate público: o Hacker News registra 0 pontos e 0 comentários.
Modelos MoE ativam apenas parte dos especialistas a cada token, mas ainda precisam armazenar os pesos desses especialistas. O Colibrì divide esse trabalho entre VRAM, RAM e disco, que trata como uma única hierarquia de memória. Quando falta memória rápida, o programa mantém especialistas no armazenamento e os carrega durante a inferência.
A página chama essa técnica de “AI memory multitiering”. O ganho é caber em máquinas que não comportariam todos os pesos na VRAM. O custo aparece no tempo de acesso ao disco, que pode reduzir a velocidade de geração.
O repositório lista cinco famílias: GLM-5.2, com 744B; Inkling, com 975B; Kimi K3, com 2.8T; DeepSeek V4 Flash, com 284B; e OLMoE, com 7B. Cada modelo usa um arquivo C, mas todos compartilham as interfaces coli chat, coli serve e coli web.
O exemplo exibido pelo projeto usa ./coli chat com o GLM-5.2 em int4 e modo streaming CPU. O programa informa inicialização em 32s e 9.9 GB de memória residente. É uma demonstração de uso, não uma comparação controlada com outros motores.
O ponto técnico em disputa seria claro: vale trocar velocidade e simplicidade por uma arquitetura que usa disco para executar modelos enormes? Quem prioriza acesso pode aceitar a lentidão; quem precisa de latência previsível pode rejeitar a troca. Mas os dados disponíveis não registram nenhum comentário, autor ou argumento contrário.
Por isso, não há como apresentar dois lados com citações diretas dos comentaristas. O assunto no Hacker News tem 0 pontos e 0 comentários, e o link associado leva ao próprio repositório no GitHub. Qualquer frase atribuída a uma pessoa sobre desempenho, custo ou arquitetura ultrapassaria o que a fonte informa.
Ainda assim, o próprio JustVugg expõe a posição técnica do projeto: “o Colibrì é um motor de inferência que você pode executar hoje e uma plataforma aberta de pesquisa”. A página também declara que o objetivo é medir desempenho “em toda a fronteira entre software e hardware”, incluindo formato de modelo, hierarquia de memória, entrada e saída de armazenamento, alocação, escalonamento, kernels, especulação e sobreposição entre CPU e GPU.
Essa ambição impõe uma ressalva importante. O projeto afirma que não oferece garantia de velocidade, mas mantém uma “garantia rígida sobre a semântica”: a política padrão nunca altera silenciosamente a precisão do modelo nem a semântica do roteador. Em termos práticos, a falta de memória rápida deve deixar a execução mais lenta, não mudar escondido o comportamento do modelo.
A página mostra um painel web com 4 tok/s, TTFT de 1.6 s e disco em 0, usando 6× RTX 5090 para manter os especialistas residentes. Esses números descrevem uma configuração específica e não revelam consumo, comparação ou estabilidade em outras máquinas. Para uma decisão técnica, ainda faltam medições reproduzíveis sobre diferentes discos, CPUs, GPUs e modelos. O projeto oferece uma hipótese de engenharia; o debate público, por enquanto, não oferece evidência independente para confirmá-la ou contestá-la.