Meta lança modelo aberto de 30B que cabe em uma única GPU e atinge 20 mil tokens por segundo
Com janela de 120 mil tokens, o Muse Glimmer dispensa nuvem e roda agentes locais em placas da Nvidia.
Edição: Anderson Gomes
· 3 min de leitura

A Meta lançou em 10 de agosto de 2026 o Muse Glimmer, um modelo aberto de 30 bilhões de parâmetros voltado para agentes autônomos locais. O sistema tem janela de contexto de mais de 120 mil tokens e roda inteiro na memória de uma única placa de vídeo da Nvidia, alcançando 20 mil tokens por segundo. Isso muda a rotina de desenvolvedores e empresas que operam sob regras rígidas de privacidade e não podem enviar código, credenciais ou documentos para servidores externos. É a volta prática da Meta ao ecossistema aberto com foco em agentes.
Ao contrário de modelos pensados apenas para chat, que priorizam respostas rápidas em conversas curtas, o modelo adota arquitetura densa. Isso significa que ele ativa todos os parâmetros a cada token processado, sem divisão por especialistas nem rotas variáveis. Modelos do tipo Mixture of Experts (MoE) sofrem com sobrecarga de roteamento em execuções longas. O formato denso garante previsibilidade de latência e coerência em tarefas com chamadas sequenciais de ferramentas. O sistema não se perde ao longo de sessões longas.
Arquitetura densa elimina custos de nuvem e reduz falhas
Rajath Narasimha e Sachin Beldona, engenheiros da Nvidia que assinam o texto técnico, afirmam que o modelo dispensa particionamento e descarregamento de dados para a CPU. Na GeForce RTX 5090, que conta com 32 GB de memória de vídeo e Tensor Cores de quinta geração, o desenvolvedor executa fluxos inteiros na própria estação de trabalho. Isso elimina custos por token cobrados em endpoints de nuvem. Processar tudo no chip corta despesas recorrentes.
Em hardware mais potente, como o DGX Station equipado com chips Blackwell Ultra, o modelo sustenta mais de 20 mil tokens por segundo sob precisão BF16 e NVF4. A Nvidia sustenta que a memória suporta o modelo inteiro e mantém espaço livre para grandes buffers de cache de chaves e valores. O sistema também opera no DGX Spark com conexões NVLink e na linha Jetson para robótica industrial. Quem atua em fábricas isoladas ganha capacidade de inferência no próprio equipamento.
Nvidia empurra seu ecossistema, mas código tem opções abertas
A empresa aproveita o lançamento para promover suas ferramentas proprietárias, citando contêineres NIM e o NeMo AutoModel para ajuste fino via LoRA e SFT completo. Contudo, quem não quiser usar o software fechado da fornecedora pode baixar os pesos diretamente pelo HuggingFace e executar o modelo com os motores abertos SGLang ou vLLM. Há ainda um endpoint hospedado no site build.nvidia.com para testes rápidos. O acesso não depende de uma única ferramenta.
Nem tudo no material técnico veio acompanhado de verificação independente. O texto da Nvidia é promocional e compara o modelo a arquiteturas MoE sem detalhar a metodologia dos testes de concorrência nem publicar scripts de replicação. A própria nota oficial traz um aviso explícito de que resumos gerados por inteligência artificial podem omitir dados importantes e exigem checagem. Quem pretende adotar o modelo em produção deve medir o consumo real de memória antes de confiar apenas nos números do fabricante.
- NVIDIA
- Agentes de IA
Vincentwei cria ferramenta que gera vídeos explicativos via código
O anything2explainer une Remotion e agentes de IA para criar animações com narração sincronizada a partir de temas ou artigos.
· 3 min de leitura
Laboratório usa Codex e ChatGPT para buscar novos antibióticos
Equipe de César de la Fuente vasculha genomas vivos e extintos e reduz triagem inicial de moléculas de anos para horas.
· 3 min de leitura
Oracle coloca ChatGPT e Codex na rotina de 100 mil funcionários
Mais de 100 mil funcionários da empresa usam os modelos da OpenAI para acelerar tarefas em recrutamento, engenharia e TI.
· 3 min de leitura

GitHub libera telas sob medida geradas por texto no app do Copilot
· 3 min de leitura