DeepSeek lança modelo multimodal de 552 bilhões de parâmetros com licença MIT
Arquitetura comprime cache de memória em quatro vezes e ativa só 8 bilhões de parâmetros na leitura para cortar custo de infraestrutura.
Edição: Anderson Gomes
· 3 min de leitura
A DeepSeek lançou em 10 de setembro de 2026 o DeepSeek-V4.1-Flash, modelo multimodal de 552 bilhões de parâmetros que processa texto e imagem com contexto de até um milhão de tokens. O sistema ativa apenas 8 bilhões de parâmetros por token na leitura da entrada e 16 bilhões na geração da resposta. Isso reduz o custo de inferência para equipes que constroem agentes de software com prompts longos. A novidade já acumulou 1.255.513 downloads no primeiro mês.
Diferente do DeepSeek-V4-Flash anterior, que tinha 284 bilhões de parâmetros e ativava 13 bilhões, a versão 4.1 reorganizou a passagem de dados na memória. O modelo adota uma arquitetura chamada Causal Encoder-Decoder com 40 camadas Transformer, divididas igualmente entre 20 camadas de codificador causal e 20 de decodificador. O decodificador projeta seu cache global diretamente do estado final do codificador. Essa divisão poupa trabalho de cálculo. O mecanismo comprime o espaço de memória para 890 bytes por token, cerca de um quarto do que o modelo anterior ocupava.
Compressão extrema reduz pegada de memória do cache
A economia de memória vem de duas frentes técnicas desenhadas para sequências extensas. O método Compressed Sparse Attention 2 alterna as camadas de atenção entre os modos Full, Reindex e Reuse para compartilhar matrizes de chaves e valores. Em paralelo, a técnica SWA Bounded Replay reconstrói estados recentes sem salvar dados intermediários em disco de estado sólido, cortando o rastro persistente a um oitavo da versão anterior. A quantização de cache usa formato FP4 no padrão E2M1, com escala E4M3 a cada 16 canais.
No processamento visual, o codificador DeepSeek-ViT opera com 2D-RoPE e redução espacial de pixels antes de alimentar um projetor de duas camadas. O treinamento consumiu 45 trilhões de tokens desde o início, expandindo a janela para um milhão de tokens após 34 trilhões. O sistema possui 196 bilhões de parâmetros na memória condicional Engram e combina um especialista compartilhado com 384 especialistas roteados, ativando seis por token. Na inferência, quem programa pode ajustar o esforço de raciocínio em uma escala inteira de 1 a 100. A ferramenta entrega controle direto.
Tamanho dos arquivos exige infraestrutura de centro de dados
O modelo está disponível na biblioteca transformers em 48 arquivos no formato safetensors, com tags para 8-bit e fp8. Distribuir 552 bilhões de parâmetros em dezenas de arquivos pesados impede a execução direta em notebooks comuns ou computadores de mesa. O volume de pesos e a complexidade dos especialistas MoE exigem servidores de datacenter com múltiplos aceleradores para carregar a rede na memória. Quem desenvolve em empresas locais não vai rodar o sistema localmente em estações simples de trabalho sem recorrer a instâncias dedicadas na nuvem.
A DeepSeek publicou os arquivos sob licença MIT, o que autoriza uso comercial irrestrito, modificação e redistribuição sem cobrança de royalties. Em testes acadêmicos, a base marcou 74,1 pontos no MMLU-Pro e 92,1 no C-Eval, superando os 68,3 pontos da geração anterior no primeiro benchmark. O lançamento reforça a disputa no campo de pesos abertos com tecnologia utilizável em sistemas corporativos. A licença permissiva destrava o produto para o mercado.
- mit
- image-text-to-text
- deepseek-ai
- transformers
- Modelos e LLMs
- HuggingFace Models
Fonte: Página do modelo no Hugging Face · Como produzimos as matérias
Qwen3.8 converge 18 pontos com GPT-5.5 Pro após injeção de raciocínio
Experimento do pesquisador wsxiaoys insere tokens de pensamento da OpenAI em modelos abertos e expõe pistas de destilação.
· 3 min de leitura

Desvio no chip Apple M3 eleva taxa do Llama de 10 para 24 tokens/s
· 3 min de leitura

OpenAI lança ChatGPT para bancos com GPT-6 Astra e dados de mercado
· 3 min de leitura

ClearAI valida teses de agentes e atinge 1.308 estrelas em 24 dias
· 3 min de leitura