Modelos e LLMs

JustVugg apresenta motor para modelos de 2,8 trilhões de parâmetros

Projeto em C usa disco, RAM e VRAM como uma hierarquia única, mas não traz benchmark independente no debate.

Reprodução · pasqualepillitteri.it

O Colibrì é um motor de inferência em C que roda modelos MoE gigantes no hardware disponível. O projeto JustVugg não informa quando publicou a ferramenta, mas diz suportar modelos de 744B a 2.8T parâmetros, sem dependências de engine. A proposta serve a quem quer testar modelos grandes sem depender apenas de muita VRAM, embora a página não mostre debate público: o Hacker News registra 0 pontos e 0 comentários.

A proposta troca memória rápida por uma hierarquia maior

Modelos MoE ativam apenas parte dos especialistas a cada token, mas ainda precisam armazenar os pesos desses especialistas. O Colibrì divide esse trabalho entre VRAM, RAM e disco, que trata como uma única hierarquia de memória. Quando falta memória rápida, o programa mantém especialistas no armazenamento e os carrega durante a inferência.

A página chama essa técnica de “AI memory multitiering”. O ganho é caber em máquinas que não comportariam todos os pesos na VRAM. O custo aparece no tempo de acesso ao disco, que pode reduzir a velocidade de geração.

O repositório lista cinco famílias: GLM-5.2, com 744B; Inkling, com 975B; Kimi K3, com 2.8T; DeepSeek V4 Flash, com 284B; e OLMoE, com 7B. Cada modelo usa um arquivo C, mas todos compartilham as interfaces coli chat, coli serve e coli web.

O exemplo exibido pelo projeto usa ./coli chat com o GLM-5.2 em int4 e modo streaming CPU. O programa informa inicialização em 32s e 9.9 GB de memória residente. É uma demonstração de uso, não uma comparação controlada com outros motores.

O debate não tem comentários para dividir os lados

O ponto técnico em disputa seria claro: vale trocar velocidade e simplicidade por uma arquitetura que usa disco para executar modelos enormes? Quem prioriza acesso pode aceitar a lentidão; quem precisa de latência previsível pode rejeitar a troca. Mas os dados disponíveis não registram nenhum comentário, autor ou argumento contrário.

Por isso, não há como apresentar dois lados com citações diretas dos comentaristas. O assunto no Hacker News tem 0 pontos e 0 comentários, e o link associado leva ao próprio repositório no GitHub. Qualquer frase atribuída a uma pessoa sobre desempenho, custo ou arquitetura ultrapassaria o que a fonte informa.

Ainda assim, o próprio JustVugg expõe a posição técnica do projeto: “o Colibrì é um motor de inferência que você pode executar hoje e uma plataforma aberta de pesquisa”. A página também declara que o objetivo é medir desempenho “em toda a fronteira entre software e hardware”, incluindo formato de modelo, hierarquia de memória, entrada e saída de armazenamento, alocação, escalonamento, kernels, especulação e sobreposição entre CPU e GPU.

Essa ambição impõe uma ressalva importante. O projeto afirma que não oferece garantia de velocidade, mas mantém uma “garantia rígida sobre a semântica”: a política padrão nunca altera silenciosamente a precisão do modelo nem a semântica do roteador. Em termos práticos, a falta de memória rápida deve deixar a execução mais lenta, não mudar escondido o comportamento do modelo.

A página mostra um painel web com 4 tok/s, TTFT de 1.6 s e disco em 0, usando 6× RTX 5090 para manter os especialistas residentes. Esses números descrevem uma configuração específica e não revelam consumo, comparação ou estabilidade em outras máquinas. Para uma decisão técnica, ainda faltam medições reproduzíveis sobre diferentes discos, CPUs, GPUs e modelos. O projeto oferece uma hipótese de engenharia; o debate público, por enquanto, não oferece evidência independente para confirmá-la ou contestá-la.

Fontes

Modelos e LLMsHacker News
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.