Pular para o conteúdo
NovidadesIA

Repositórios em Alta

Aceleração de modelos de linguagem ganha biblioteca aberta de kernels para GPUs modernas

A biblioteca da DeepSeek simplifica operações matriciais em arquiteturas avançadas da Nvidia compilando núcleos durante a execução.

Edição: Anderson Gomes · texto gerado por IA
· 5 min de leitura

Em alta

Texto gerado por IA, com revisão automática. Esta matéria foi escrita por um modelo de linguagem a partir da fonte indicada e passou por verificações automáticas de formato, de voz e de título; não houve leitura humana antes da publicação. Como funciona o método · Fonte original: Repositório no GitHub

A organização deepseek-ai disponibilizou a biblioteca DeepGEMM, um conjunto unificado de núcleos de computação em Cuda voltado para as operações matemáticas centrais de grandes modelos de linguagem. O projeto entrou em evidência nas plataformas de rastreamento de código aberto após atingir a oitava posição diária e a décima quinta posição semanal no Trendshift, com ganho recente de 195 estrelas. A ferramenta busca resolver o gargalo de desempenho e a complexidade de manutenção em cálculos de multiplicação de matrizes densas e esparsas, reunindo rotinas especializadas em um código direto que dispensa compilações prévias longas.

Dados rápidos

  • Repositório: deepseek-ai/DeepGEMM
  • Licença: MIT
  • Linguagem: Cuda
  • Métricas: 8.308 estrelas e 1.329 forks
  • Posição no ranking: Trendshift (diário: 8º lugar; semanal: 15º lugar)
  • Data da consulta: 2026-10-05

Redução de gargalos nas matrizes de redes neurais

O treinamento e a inferência de modelos modernos dependem intensamente de operações conhecidas como GEMM, sigla em inglês para multiplicações de matrizes gerais. Essas rotinas sustentam desde as camadas lineares convencionais até estruturas como a mistura de especialistas, chamada de MoE, na qual diferentes partes da rede atendem a entradas específicas. Executar esses cálculos com precisão reduzida exige programação em baixo nível para extrair a vazão máxima das unidades aceleradoras.

Em muitos fluxos de trabalho, engenheiros enfrentam a sobrecarga de gerenciar bibliotecas que exigem compilações demoradas durante a instalação ou que dependem de abstrações em C++ difíceis de auditar. Esse obstáculo retarda o ciclo de experimentação e introduz dificuldades na depuração de rotinas que manipulam formatos numéricos como FP8, FP4 e BF16.

Outro ponto crítico reside na comunicação entre nós e na coordenação de tensores com comprimentos variáveis. A ausência de núcleos especializados para modelos com mistura de especialistas provoca esperas ociosas na placa gráfica, reduzindo a eficiência global do agrupamento de servidores.

Estrutura do núcleo e compilação dinâmica

O DeepGEMM organiza funções essenciais em uma base de código unificada em Cuda, delegando a geração de binários para um módulo interno chamado DeepJIT. O sistema realiza a compilação dos núcleos durante a execução do programa em Python, eliminando a etapa de construção de código Cuda no momento da instalação.

O projeto adota conceitos de bibliotecas como CUTLASS e CuTe, mas evita o uso excessivo de modelos de programação genérica e álgebra de tensores complexa. A convenção de chamada principal segue a fórmula matemática D = C + A @ B, com o formato não transposto para a matriz de entrada e transposto para a matriz de pesos na arquitetura SM90. As etapas de desenvolvimento e instalação registradas no repositório ocorrem por meio de scripts em shell:

cat install.sh
./install.sh

Após executar o script de instalação, o usuário acessa as rotinas diretamente importando deep_gemm em seus módulos Python.

Cenários de aplicação prática

  • Inferência com precisão reduzida: execução de multiplicações de matrizes densas nos formatos FP8 e FP4 para acelerar o processamento de lotes em ambientes de produção.
  • Treinamento e decodificação em mistura de especialistas: uso de matrizes agrupadas com disposição contígua para pré-preenchimento e disposição mascarada para a fase de geração de texto com grafos Cuda ativados.
  • Pontuação para mecanismos de indexação: cálculo de termos de atenção com precisão MQA ponderada por ReLU para mecanismos de busca rápida como o lightning indexer.
  • Retropropagação de gradientes: cômputo das derivadas de pesos em camadas densas e em camadas MoE agrupadas ao longo do eixo K durante o treinamento reverso.

Abordagem técnica frente a alternativas

Diferente de bibliotecas como a CUTLASS tradicional, que empregam agrupamentos genéricos, o DeepGEMM adota agrupamento fixo no eixo M para cenários de MoE cujos especialistas compartilham as mesmas dimensões. Essa escolha reduz o custo de processamento quando os especialistas recebem quantidades variáveis de tokens.

O código também se distancia do ecossistema convencional ao limitar a quantidade de funções essenciais expostas, servindo como uma implementação de referência legível para técnicas de otimização em GPUs Nvidia. O repositório documenta suporte tanto para placas SM90 quanto para SM100, incluindo formatos de escalonamento FP32 na geração anterior e o formato compactado UE8M0 nas placas mais novas.

Limitações técnicas e aspectos de maturidade

A biblioteca impõe restrições de hardware e software que restringem o ambiente operacional. O uso exige GPUs com arquiteturas SM90 ou SM100 da Nvidia, Python 3.8 ou superior, compiladores C++20 com suporte ao cabeçalho format, CUDA Toolkit a partir da versão 12.9, PyTorch a partir da versão 2.3 e CUTLASS 4.0 ou superior via submódulo.

O projeto possui 149 issues abertas e a última liberação de versão registrada ocorreu em 2025-10-15 com a versão v2.1.1.post3, embora novos envios de código tenham ocorrido até 2026-09-30. Tópicos de categorização oficial e documentação em página web externa constam como não informado no repositório. Operações acessórias, como transposição de entrada e conversão de ponto flutuante para FP8, não são integradas de forma automática aos núcleos principais e devem ser tratadas pelo desenvolvedor.

Resumo rápido

  • Projeto: deepseek-ai/DeepGEMM
  • Licença: MIT
  • Linguagem: Cuda
  • Estrelas: 8.308
  • Ranking: Trendshift (diário: 8º lugar; semanal: 15º lugar)
  • Risco principal: dependência de arquiteturas de hardware restritas a GPUs Nvidia SM90 e SM100

Fontes

  • Repositório: https://github.com/deepseek-ai/DeepGEMM
  • Última release: https://github.com/deepseek-ai/DeepGEMM (versão v2.1.1.post3)
  • Ranking: Trendshift (diário: 8º; semanal: 15º)
  • Cuda
  • MIT
  • Repositórios em Alta
  • Trendshift