Nvidia separa até oito falantes em áudio com atraso de 0,32 segundo
Com pesos abertos em GGUF e Safetensors, o Nemotron 3 Diarization roda tanto em C++ local quanto em pipelines de transmissão ao vivo.
Edição: Anderson Gomes
· 3 min de leitura

A Nvidia publicou em 23 de setembro de 2026 o Nemotron 3 Diarization, modelo de pesos abertos que identifica quem falou o quê em áudios com até oito pessoas. O sistema processa transmissões ao vivo com atraso configurável a partir de 0,32 segundo e também analisa arquivos longos gravados. A ferramenta atende engenheiros de software que criam sistemas de transcrição e agentes de voz sem depender de APIs proprietárias na nuvem. O projeto soma 69.284 downloads no mês.
C++ nativo e controle fino de latência
Para organizar as vozes, a arquitetura ordena os canais de saída pelo primeiro instante em que cada pessoa fala no áudio, seguindo o método Sortformer. Na inferência contínua, o modelo combina a estrutura Arrival-Order Speaker Cache para reter a identidade dos falantes com uma fila FIFO que preserva o contexto dos quadros anteriores. Esse processamento em pedaços elimina qualquer teto para a duração total da gravação. A taxa aceita múltiplos de 10 milissegundos.
A Nvidia disponibilizou os pesos em dois arquivos nos formatos gguf e safetensors. Essa oferta em gguf viabiliza a execução local direta em computadores de desenvolvimento através do runtime leve NeMo-Speech.cpp. O runtime roda em C++ nativo. Como o card técnico não lista a quantidade de memória RAM ou placa de vídeo necessárias, não há dados para fixar um requisito mínimo de hardware.
Modos de atraso e licença comercial
O usuário calibra o fluxo contínuo por meio de variáveis medidas em quadros de 80 milissegundos, como SPKCACHE_LEN, FIFO_LEN, CHUNK_LEN, RIGHT_CONTEXT e UPDATE_PERIOD. A configuração recomendada de latência ultrabaixa opera com 0,32 segundo de buffer de entrada, embora o ponto de checagem aceite atrasos de até 80 milissegundos em sistemas críticos. Os modos de latência muito baixa e baixa trabalham em 0,64 segundo e 1,04 segundo. A análise offline consome 30,4 segundos.
Para quem prefere treinar ou fazer inferência pelo pacote Python NVIDIA NeMo Speech, a instalação exige Python 3.12 ou superior, Cython e PyTorch recente. O modelo recebe arquivos WAV, listas de áudios, manifests JSON e matrizes numpy com taxa de amostragem padrão de 16.000 Hz. O sistema também adiciona marcadores de locutor diretamente no nível das palavras durante a transcrição. A biblioteca nemo gerencia o ciclo.
A Nvidia publicou o projeto sob a licença openmdw-1.1, que autoriza expressamente o uso comercial e projetos privados sem cobrança por minuto de áudio. Essa liberação jurídica reduz custos operacionais de empresas que antes dependiam de serviços fechados para rotular falantes. A entrega de pesos abertos em formatos populares devolve o controle da tecnologia para equipes técnicas que precisam manter dados dentro da própria infraestrutura. A ferramenta dispensa intermediários em nuvem.
- openmdw-1.1
- voice-activity-detection
- nvidia
- nemo
- Modelos e LLMs
- HuggingFace Models
Fonte: Página do modelo no Hugging Face · Como produzimos as matérias

Anthropic lança Claude Fable 5.1 com corte de até 45% em custo de cache
· 4 min de leitura

Oriveo reúne 15 provedores de IA em app aberto com chave própria
· 3 min de leitura

Jake Schincariol cria pacote com 11 rotinas para Claude gerenciar LinkedIn
· 3 min de leitura
OpenAI testa GPT-5.6 Sol e Codex para calibrar chip quântico no MIT
Pesquisa automatiza medições preliminares em processador de seis qubits, mas ainda depende de intervenção humana quando sinais físicos falham.
· 3 min de leitura