Aceleração de modelos de linguagem ganha biblioteca aberta de kernels para GPUs modernas
A biblioteca da DeepSeek simplifica operações matriciais em arquiteturas avançadas da Nvidia compilando núcleos durante a execução.
Edição: Anderson Gomes · texto gerado por IA
· 5 min de leitura
Texto gerado por IA, com revisão automática. Esta matéria foi escrita por um modelo de linguagem a partir da fonte indicada e passou por verificações automáticas de formato, de voz e de título; não houve leitura humana antes da publicação. Como funciona o método · Fonte original: Repositório no GitHub
A organização deepseek-ai disponibilizou a biblioteca DeepGEMM, um conjunto unificado de núcleos de computação em Cuda voltado para as operações matemáticas centrais de grandes modelos de linguagem. O projeto entrou em evidência nas plataformas de rastreamento de código aberto após atingir a oitava posição diária e a décima quinta posição semanal no Trendshift, com ganho recente de 195 estrelas. A ferramenta busca resolver o gargalo de desempenho e a complexidade de manutenção em cálculos de multiplicação de matrizes densas e esparsas, reunindo rotinas especializadas em um código direto que dispensa compilações prévias longas.
Dados rápidos
- Repositório: deepseek-ai/DeepGEMM
- Licença: MIT
- Linguagem: Cuda
- Métricas: 8.308 estrelas e 1.329 forks
- Posição no ranking: Trendshift (diário: 8º lugar; semanal: 15º lugar)
- Data da consulta: 2026-10-05
Redução de gargalos nas matrizes de redes neurais
O treinamento e a inferência de modelos modernos dependem intensamente de operações conhecidas como GEMM, sigla em inglês para multiplicações de matrizes gerais. Essas rotinas sustentam desde as camadas lineares convencionais até estruturas como a mistura de especialistas, chamada de MoE, na qual diferentes partes da rede atendem a entradas específicas. Executar esses cálculos com precisão reduzida exige programação em baixo nível para extrair a vazão máxima das unidades aceleradoras.
Em muitos fluxos de trabalho, engenheiros enfrentam a sobrecarga de gerenciar bibliotecas que exigem compilações demoradas durante a instalação ou que dependem de abstrações em C++ difíceis de auditar. Esse obstáculo retarda o ciclo de experimentação e introduz dificuldades na depuração de rotinas que manipulam formatos numéricos como FP8, FP4 e BF16.
Outro ponto crítico reside na comunicação entre nós e na coordenação de tensores com comprimentos variáveis. A ausência de núcleos especializados para modelos com mistura de especialistas provoca esperas ociosas na placa gráfica, reduzindo a eficiência global do agrupamento de servidores.
Estrutura do núcleo e compilação dinâmica
O DeepGEMM organiza funções essenciais em uma base de código unificada em Cuda, delegando a geração de binários para um módulo interno chamado DeepJIT. O sistema realiza a compilação dos núcleos durante a execução do programa em Python, eliminando a etapa de construção de código Cuda no momento da instalação.
O projeto adota conceitos de bibliotecas como CUTLASS e CuTe, mas evita o uso excessivo de modelos de programação genérica e álgebra de tensores complexa. A convenção de chamada principal segue a fórmula matemática D = C + A @ B, com o formato não transposto para a matriz de entrada e transposto para a matriz de pesos na arquitetura SM90. As etapas de desenvolvimento e instalação registradas no repositório ocorrem por meio de scripts em shell:
cat install.sh
./install.sh
Após executar o script de instalação, o usuário acessa as rotinas diretamente importando deep_gemm em seus módulos Python.
Cenários de aplicação prática
- Inferência com precisão reduzida: execução de multiplicações de matrizes densas nos formatos FP8 e FP4 para acelerar o processamento de lotes em ambientes de produção.
- Treinamento e decodificação em mistura de especialistas: uso de matrizes agrupadas com disposição contígua para pré-preenchimento e disposição mascarada para a fase de geração de texto com grafos Cuda ativados.
- Pontuação para mecanismos de indexação: cálculo de termos de atenção com precisão MQA ponderada por ReLU para mecanismos de busca rápida como o lightning indexer.
- Retropropagação de gradientes: cômputo das derivadas de pesos em camadas densas e em camadas MoE agrupadas ao longo do eixo K durante o treinamento reverso.
Abordagem técnica frente a alternativas
Diferente de bibliotecas como a CUTLASS tradicional, que empregam agrupamentos genéricos, o DeepGEMM adota agrupamento fixo no eixo M para cenários de MoE cujos especialistas compartilham as mesmas dimensões. Essa escolha reduz o custo de processamento quando os especialistas recebem quantidades variáveis de tokens.
O código também se distancia do ecossistema convencional ao limitar a quantidade de funções essenciais expostas, servindo como uma implementação de referência legível para técnicas de otimização em GPUs Nvidia. O repositório documenta suporte tanto para placas SM90 quanto para SM100, incluindo formatos de escalonamento FP32 na geração anterior e o formato compactado UE8M0 nas placas mais novas.
Limitações técnicas e aspectos de maturidade
A biblioteca impõe restrições de hardware e software que restringem o ambiente operacional. O uso exige GPUs com arquiteturas SM90 ou SM100 da Nvidia, Python 3.8 ou superior, compiladores C++20 com suporte ao cabeçalho format, CUDA Toolkit a partir da versão 12.9, PyTorch a partir da versão 2.3 e CUTLASS 4.0 ou superior via submódulo.
O projeto possui 149 issues abertas e a última liberação de versão registrada ocorreu em 2025-10-15 com a versão v2.1.1.post3, embora novos envios de código tenham ocorrido até 2026-09-30. Tópicos de categorização oficial e documentação em página web externa constam como não informado no repositório. Operações acessórias, como transposição de entrada e conversão de ponto flutuante para FP8, não são integradas de forma automática aos núcleos principais e devem ser tratadas pelo desenvolvedor.
Resumo rápido
- Projeto: deepseek-ai/DeepGEMM
- Licença: MIT
- Linguagem: Cuda
- Estrelas: 8.308
- Ranking: Trendshift (diário: 8º lugar; semanal: 15º lugar)
- Risco principal: dependência de arquiteturas de hardware restritas a GPUs Nvidia SM90 e SM100
Fontes
- Repositório: https://github.com/deepseek-ai/DeepGEMM
- Última release: https://github.com/deepseek-ai/DeepGEMM (versão v2.1.1.post3)
- Ranking: Trendshift (diário: 8º; semanal: 15º)
- Cuda
- MIT
- Repositórios em Alta
- Trendshift
Agentes de inteligência artificial agora analisam aplicativos até o nível binário
A ferramenta em código aberto conecta modelos autônomos a desmontadores locais para inspecionar sistemas e reconstruir recursos sem o código-fonte.
· 4 min de leitura
Cliente aberto em Rust renova acesso ao GeForce NOW com foco em desempenho nativo
A iniciativa OpenNOW substitui aplicações pesadas por uma base nativa em Rust e interface Qt para transmissão de jogos na nuvem.
· 5 min de leitura

Ferramenta de IA simula equipe inteira de engenharia para acelerar entregas de software
O gstack organiza o Claude Code em 23 papéis especializados para cobrir da concepção ao lançamento de sistemas.
· 5 min de leitura