Modelos e LLMs

microsoft lança modelo multimodal de 4B focado em vídeo

Mage-VL reduz tokens visuais em mais de 75% e busca acelerar a compreensão de transmissões em tempo real.

A microsoft lançou em 2026-07-25 o Mage-VL, modelo multimodal de 4B que entende imagens, vídeos e transmissões em tempo real. O sistema reduz em mais de 75% os tokens visuais e alcança até 3.5× de aceleração na inferência contra a amostragem uniforme de frames. Isso interessa a quem desenvolve aplicações de vídeo sem querer processar cada frame com a mesma intensidade.

O modelo descarta informação repetida do vídeo

Modelos anteriores dessa família usam frames amostrados de maneira uniforme e empurram uma grade densa de patches para um ViT pré-treinado. O Mage-VL segue a lógica de codecs de vídeo: mantém todos os patches dos frames-âncora e seleciona, nos frames preditivos, as regiões onde o codec identifica movimento ou detalhe novo. O ganho é prático.

Essa estratégia deixa o modelo trabalhar com cerca de um oitavo ou menos dos tokens de uma amostragem densa. A microsoft afirma que o sistema preserva o contexto espacial e temporal, treina com vídeos até 8 vezes mais longos sob o mesmo orçamento e alcança aceleração de até 3.5× contra a amostragem uniforme, com a mesma precisão. Os testes de velocidade usaram um único nó com 8×B200.

O visualizador Mage-ViT foi treinado inteiramente do zero, em vez de partir de uma inicialização de ViT com dados de imagem e texto. Ele usa uma grade compartilhada de patches 16×16 e codificação posicional rotativa 3D. O componente aceita H.264/AVC, HEVC/H.265 e o codec neural DCVC-RT sem trocar a arquitetura ou refazer o treinamento.

O pacote reúne entendimento e resposta proativa

A ficha classifica o Mage-VL como image-text-to-text, dentro da biblioteca transformers, com pesos apenas no formato safetensors distribuídos em 3 arquivos. O único componente pré-treinado é o decodificador Qwen3-4B-Instruct-2507, que recebe os tokens variáveis do Mage-ViT por meio de um projetor MLP de duas camadas. A licença informada é Apache-2.0.

O modelo também inclui um mecanismo de dois processos. Um portão cognitivo leve acompanha cada janela do codec e permanece silencioso em conteúdo rotineiro; quando termina um evento relevante, ele aciona o VLM completo. A microsoft reúne compreensão de imagem e vídeo, vídeos com H.264 e HEVC, vídeos com DCVC-RT e comentários disparados por eventos em um único checkpoint, sem exigir pesos separados para cada função.

Os resultados informados colocam o Mage-VL no mesmo nível do Qwen3-VL-4B em imagens estáticas e à frente em vídeo e inteligência espacial. Com o Qwen3-4B mantido fixo, a troca do visualizador melhorou todos os benchmarks de vídeo e localização temporal reportados, incluindo ganhos de 22.5 no QVHighlight, 17.1 no ActivityNet e 11.0 no VSI-Bench. O repositório registrava 435.784 downloads no mês e 257 curtidas.

A ficha não informa o tamanho total dos 3 arquivos nem o consumo de memória. Por isso, o número 4B e o uso de safetensors não bastam para dizer se o modelo roda em uma máquina de desenvolvedor; também não há requisito declarado que obrigue seu uso em datacenter. O teste com B200 mostra o ambiente usado para medir desempenho, não uma exigência de execução.

A Apache-2.0 permite uso comercial, alteração e redistribuição do código e dos pesos, desde que o usuário cumpra as condições da licença. Ela não elimina obrigações como preservar avisos de copyright e o texto da licença, nem oferece garantia sobre o software. Para desenvolvedores no Brasil, o ponto principal é acessar um modelo multimodal aberto para produtos de vídeo, mas a infraestrutura necessária ainda depende do tamanho real dos arquivos e da memória disponível.

Fontes

apache-2.0image-text-to-textmicrosofttransformersModelos e LLMsHuggingFace Models
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.