Pular para o conteúdo
NovidadesIA

Infraestrutura e MLOps

Nvidia atualiza blueprint de vídeo para cortar tokens de IA em 80%

Novo pacote une modelos Cosmos e Nemotron para criar agentes visuais em menos de meia hora.

Edição: Anderson Gomes
· 3 min de leitura

Nvidia atualiza blueprint de vídeo para cortar tokens de IA em 80%
Imagem: Reprodução · NVIDIA · reprodução · licença não declarada

A Nvidia lançou em 1 de outubro de 2026 o Metropolis Blueprint for Video Search and Summarization 3.3, uma arquitetura que transforma vídeo gravado ou transmissões ao vivo em busca textual e alertas automáticos. O pacote técnico combina modelos de visão como o Nvidia Cosmos com modelos de linguagem Nvidia Nemotron para cortar o consumo de tokens de entrada em 80% no resumo de gravações longas. Desenvolvedores que criam sistemas corporativos de monitoramento para cidades inteligentes ou fábricas agora conseguem montar fluxos com menos chamadas manuais de infraestrutura. A ferramenta mira equipes de engenharia que precisam analisar vídeo sem estourar o orçamento de processamento gráfico.

Corte de tokens alivia carga sobre a GPU

O principal gargalo técnico na análise contínua de imagens sempre foi o custo computacional de processar cada quadro. Para atacar esse problema na execução dos modelos, a Nvidia incluiu o Adaptive Efficient Video Sampling, batizado de Adaptive EVS. Essa técnica identifica áreas estáticas da cena e descarta blocos visuais inalterados quadro a quadro, concentrando o trabalho do modelo de visão apenas nos momentos em que algo de fato se move. A empresa afirma que a abordagem encurtou a latência de contextualização de alertas em 17% e elevou em 46% o volume de fluxos simultâneos de vídeo em tempo real. O teste usou o modelo Cosmos 3 Super em formato FP8 dentro de uma placa RTX PRO 6000 Blackwell.

Em outra avaliação prática descrita pelos engenheiros Hassan Moustafa, Debraj Sinha e Ashwani Agarwal, o Adaptive EVS resumiu um vídeo de 60 minutos na metade do tempo normal. A economia de 80% nos tokens de entrada varia conforme a movimentação da cena, o comprimento dos blocos de vídeo e o limiar de similaridade adotado. A própria Nvidia ressalta essas condições: cenas muito dinâmicas exigem mais do processador. O sistema utiliza técnicas de recuperação aumentada de informação e ferramentas compatíveis com o Model Context Protocol para alimentar as consultas dos operadores.

Agentes de código montam ambiente em meia hora

Do lado do desenvolvimento, o pacote traz a habilidade vss-build-vision-ai, que aceita comandos em linguagem natural para configurar microsserviços. A automação parte de quatro perfis pré-validados e unifica serviços compartilhados como Kafka, Redis e Elasticsearch em instâncias únicas, sem duplicar bancos de dados. Em uma demonstração feita em linha de envase de suco de laranja com derramamento sintético, a ferramenta gerou um ambiente funcional em menos de 30 minutos. O sistema rodou em uma máquina com duas GPUs RTX PRO 6000 Blackwell, reaproveitando a GPU do detector para executar o Cosmos 3 Nano em FP8. O custo do agente de programação ficou na faixa de poucos dólares.

Apesar dos ganhos operacionais exibidos nos testes de laboratório, a tecnologia depende de requisitos específicos de hardware e de modelos compactados para atingir essas marcas. Os desenvolvedores precisam clonar o repositório oficial do VSS Blueprint para acessar o código de implantação da versão 3.3 e instalar as habilidades na pasta padrão de ferramentas como Claude Code, Codex ou qualquer assistente compatível com o padrão agentskills.io. A demonstração completa dos agentes programados via prompt único aconteceu em transmissão ao vivo às 9h do horário do Pacífico em 1 de outubro. A integração mostra como o mercado tenta viabilizar agentes visuais complexos reduzindo tanto o tempo de montagem de software quanto a sobrecarga direta sobre placas de vídeo corporativas.

  • NVIDIA
  • Infraestrutura e MLOps

Fonte: Comunicado oficial · Como produzimos as matérias