Pular para o conteúdo
NovidadesIA

Modelos e LLMs

Nvidia separa até oito falantes em áudio com atraso de 0,32 segundo

Com pesos abertos em GGUF e Safetensors, o Nemotron 3 Diarization roda tanto em C++ local quanto em pipelines de transmissão ao vivo.

Edição: Anderson Gomes
· 3 min de leitura

Nvidia separa até oito falantes em áudio com atraso de 0,32 segundo
Imagem: Cartão · nvidia/Nemotron-3-Diarization no Hugging Face · cartão da plataforma · licença openmdw-1.1

A Nvidia publicou em 23 de setembro de 2026 o Nemotron 3 Diarization, modelo de pesos abertos que identifica quem falou o quê em áudios com até oito pessoas. O sistema processa transmissões ao vivo com atraso configurável a partir de 0,32 segundo e também analisa arquivos longos gravados. A ferramenta atende engenheiros de software que criam sistemas de transcrição e agentes de voz sem depender de APIs proprietárias na nuvem. O projeto soma 69.284 downloads no mês.

C++ nativo e controle fino de latência

Para organizar as vozes, a arquitetura ordena os canais de saída pelo primeiro instante em que cada pessoa fala no áudio, seguindo o método Sortformer. Na inferência contínua, o modelo combina a estrutura Arrival-Order Speaker Cache para reter a identidade dos falantes com uma fila FIFO que preserva o contexto dos quadros anteriores. Esse processamento em pedaços elimina qualquer teto para a duração total da gravação. A taxa aceita múltiplos de 10 milissegundos.

A Nvidia disponibilizou os pesos em dois arquivos nos formatos gguf e safetensors. Essa oferta em gguf viabiliza a execução local direta em computadores de desenvolvimento através do runtime leve NeMo-Speech.cpp. O runtime roda em C++ nativo. Como o card técnico não lista a quantidade de memória RAM ou placa de vídeo necessárias, não há dados para fixar um requisito mínimo de hardware.

Modos de atraso e licença comercial

O usuário calibra o fluxo contínuo por meio de variáveis medidas em quadros de 80 milissegundos, como SPKCACHE_LEN, FIFO_LEN, CHUNK_LEN, RIGHT_CONTEXT e UPDATE_PERIOD. A configuração recomendada de latência ultrabaixa opera com 0,32 segundo de buffer de entrada, embora o ponto de checagem aceite atrasos de até 80 milissegundos em sistemas críticos. Os modos de latência muito baixa e baixa trabalham em 0,64 segundo e 1,04 segundo. A análise offline consome 30,4 segundos.

Para quem prefere treinar ou fazer inferência pelo pacote Python NVIDIA NeMo Speech, a instalação exige Python 3.12 ou superior, Cython e PyTorch recente. O modelo recebe arquivos WAV, listas de áudios, manifests JSON e matrizes numpy com taxa de amostragem padrão de 16.000 Hz. O sistema também adiciona marcadores de locutor diretamente no nível das palavras durante a transcrição. A biblioteca nemo gerencia o ciclo.

A Nvidia publicou o projeto sob a licença openmdw-1.1, que autoriza expressamente o uso comercial e projetos privados sem cobrança por minuto de áudio. Essa liberação jurídica reduz custos operacionais de empresas que antes dependiam de serviços fechados para rotular falantes. A entrega de pesos abertos em formatos populares devolve o controle da tecnologia para equipes técnicas que precisam manter dados dentro da própria infraestrutura. A ferramenta dispensa intermediários em nuvem.

  • openmdw-1.1
  • voice-activity-detection
  • nvidia
  • nemo
  • Modelos e LLMs
  • HuggingFace Models

Fonte: Página do modelo no Hugging Face · Como produzimos as matérias