Nvidia acelera treino de modelos MoE em 10,4 vezes com JAX e Transformer Engine
Ajustes em comunicação e matrizes irregulares elevam o DeepSeek-V3 para 1.068 TFLOPS por GPU.
Edição: Anderson Gomes
· 3 min de leitura

A Nvidia anunciou em 14 de setembro de 2026 um conjunto de otimizações na biblioteca Transformer Engine com JAX que multiplica por 10,4 a velocidade de treinamento de modelos de inteligência artificial com arquitetura Mixture of Experts (MoE). O salto eleva o rendimento do DeepSeek-V3 de 103 para 1.068 TFLOPS por chip nos sistemas com hardware GB200 e GB300. Os engenheiros Seonghee Lee, Jeremy Berchtold, Phuong Nguyen, Teddy Do e Tejash Shah assinam o trabalho. A técnica atende equipes que treinam modelos gigantescos sem descartar dados durante o processamento. O ganho de velocidade reduz o tempo de máquina em clusters massivos.
A arquitetura MoE divide a rede neural em especialistas menores ativados sob demanda por um roteador que escolhe os melhores caminhos para cada conjunto de tokens. Modelos como DeepSeek, Qwen e Mixtral adotam essa divisão para igualar ou superar redes densas gastando uma fração do poder computacional. O problema surge quando o roteador aprende a concentrar trabalho em determinados especialistas. Essa preferência desequilibra o volume de dados entre as GPUs. O tráfego gera tensores irregulares que travam bibliotecas comuns, preparadas apenas para matrizes retangulares e uniformes.
Comunicação consumia 84% do tempo dos chips
No teste inicial da Nvidia com o DeepSeek-V3 no hardware GB300, a linha de base sem otimização alcançou apenas 103 TFLOPS por GPU. A comunicação entre os chips consumiu 84% de todo o tempo acumulado de processamento dos kernels. As placas ficavam paradas esperando a troca de mensagens na rede. Para eliminar esse gargalo, a equipe aplicou a abordagem sem descarte chamada dropless MoE. Esse método processa cada token no especialista escolhido sem descartar nada nem preencher matrizes com zeros para forçar formatos retangulares. A qualidade do modelo fica intacta.
A base teórica veio do projeto MegaBlocks, que reformulou o cálculo dos especialistas como multiplicação de matrizes com esparsidade em blocos. A biblioteca Transformer Engine colocou essa lógica em prática com kernels agrupados de GEMM que resolvem contagens variáveis de tokens em uma única chamada. Na camada de rede, a extensão NCCL EP acelerou o paralelismo de especialistas. O mecanismo funde as etapas de envio e recombinação de tensores e elimina tokens duplicados para aliviar o tráfego de dados. A rede trabalha menos.
Escala sustenta 97% de eficiência em 1.024 placas
O sistema combinou técnicas no nível do framework JAX para evitar que a memória esgotasse durante as execuções mais pesadas. A equipe utilizou host offloading no JAX para transferir dados da memória de vídeo e ativou fluxos múltiplos de comunicação coletiva via XLA. O compilador sobrepôs a transmissão física pelas conexões de rede NVLink e InfiniBand ao cálculo matemático das placas. Nos números divulgados pela Nvidia, o conjunto sustentou 97% de eficiência de escalabilidade em 1.024 GPUs no hardware GB300 NVL72 ao treinar a versão de 671 bilhões de parâmetros do DeepSeek-V3 671B. O resultado impressiona no papel.
Os números precisam de leitura cautelosa porque saíram dos próprios laboratórios da fabricante, com hardware de ponta e infraestrutura controlada. A Nvidia não detalhou na publicação o comportamento do sistema fora da topologia NVL72 ou em placas de gerações anteriores. Quem quiser reproduzir os testes precisa acessar o contêiner MaxText com a biblioteca Transformer Engine habilitada no catálogo NGC da empresa. A Nvidia também disponibilizou um guia de configuração do MaxText MoE e a documentação oficial da Transformer Engine para instruir a montagem do ambiente.
- NVIDIA
- Modelos e LLMs

xAI lança modelo de voz 2.0 com foco em áudio ruidoso e telefonia
· 3 min de leitura

xAI lança Grok 4.7 com foco em código e corte agressivo de preço
· 3 min de leitura

Executivos da OpenAI sabiam que pirataria em massa para IA era ilegal
· 3 min de leitura

Mistral abre centro em Munique e mira indústria pesada com IA física
· 3 min de leitura