Modelos e LLMs

Meta lança modelo multimodal de 30 bilhões para agentes locais

Muse Glimmer combina texto, imagens, ferramentas e recuperação de falhas em um modelo distribuído sob licença Apache 2.0.

A Meta Superintelligence Lab lançou em 2026-08-09 o Muse Glimmer, modelo multimodal de 30 bilhões de parâmetros para agentes de inteligência artificial. Ele recebe texto e imagens, responde com texto e roda localmente, sem exigir nuvem ou acesso à rede. O modelo serve a quem desenvolve agentes capazes de usar ferramentas, interpretar documentos e concluir tarefas longas em hardware de consumo.

O Glimmer junta visão e uso de ferramentas

O Muse Glimmer foi destilado do Muse Spark, mas ganhou um codificador dedicado de percepção e foco em tarefas agentic. A arquitetura combina um Dense Causal Transformer com um encoder visual ViT-G/14 de aproximadamente 1.8B parâmetros. O conjunto soma aproximadamente 29.6B parâmetros.

A entrada aceita texto e imagem intercalados. O modelo interpreta screenshots, gráficos e documentos durante uma conversa, com até 4,096 tokens visuais por imagem e contexto de 131,072+. A tarefa registrada na página é image-text-to-text.

A Meta Superintelligence Lab também treinou o Glimmer para encadear raciocínios, chamar ferramentas com esquemas precisos e recuperar-se de erros. Quando uma chamada retorna um resultado inesperado, o modelo diagnostica o problema e tenta novamente. Ele funciona com OpenClaw, Hermes Agent e outros padrões de orquestração.

A ficha técnica lista 52 camadas, dimensão oculta de 6656, atenção GQA com 32 cabeças de consulta e 2 de chave/valor, além de FFN SwiGLU. O vocabulário tem 202,048 tokens. O treinamento usou conteúdo multimodal público, dados de terceiros e informações de produtos e serviços da Meta.

O peso cabe em hardware de consumo, segundo a Meta

O repositório oferece os pesos em formato safetensors, distribuídos em 2 arquivos. A página também informa que técnicas de quantização comprimem o modelo para aproximadamente 4 bits e reduzem o modelo de linguagem para menos de 20 GB.

A Meta aponta um envelope de 24 GB ou 32 GB para executar o modelo quantizado, incluindo cache KV, encoder visual e o modelo auxiliar de decodificação especulativa. A configuração K-Quant-Dynamic mira 32GB VRAM e registra degradação de 0.2%; a K-Quant-17GB mira 24GB VRAM e registra 1.0%. A versão em precisão total tem como alvo 64GB VRAM.

Isso coloca o Glimmer no alcance de uma máquina de desenvolvedor equipada com GPU compatível, pelo que informa o card. O material não informa requisito para CPU, GPU específica ou memória RAM do sistema. Não dá para concluir que ele rode bem sem GPU.

A biblioteca indicada é transformers, e a licença é Apache 2.0. Ela permite usar, modificar e redistribuir o modelo, inclusive em produtos comerciais, desde que o responsável preserve os avisos e os termos exigidos pela licença. A licença não transforma o conjunto de dados de treinamento em conteúdo livre: o card cita fontes públicas, terceiros e produtos da Meta, mas não detalha direitos de redistribuição desses dados.

O lançamento reforça a oferta de pesos abertos para agentes multimodais que antes dependiam mais de serviços remotos. O Glimmer não abre todos os dados e processos do treinamento, mas entrega pesos, arquitetura e formatos para execução local. Para quem desenvolve no Brasil, isso reduz a dependência de chamadas de API e permite testar agentes com imagens e ferramentas dentro da própria infraestrutura, desde que exista uma GPU dentro das faixas informadas.

Fontes

apache-2.0image-text-to-textmeta-modelstransformersModelos e LLMsHuggingFace Models
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.