DeepSeek lança modelo Flash com 433 mil downloads no mês
Versão melhora o desempenho em tarefas de agentes e supera o modelo Pro Preview em nove testes.
Versão melhora o desempenho em tarefas de agentes e supera o modelo Pro Preview em nove testes.
A deepseek-ai publicou o DeepSeek-V4-Flash-0731 em 2026-07-31, um modelo de geração de texto voltado a agentes e programação. A versão acumulou 433.284 downloads no mês e 2.320 curtidas no Hugging Face. Ela substitui a prévia da mesma família, amplia as capacidades de agentes e supera o DeepSeek-V4-Pro (Preview) em nove benchmarks listados. O lançamento atende quem cria agentes de código, automação e uso de ferramentas.
O modelo usa a mesma estrutura do DeepSeek-V4-Flash-DSpark. A arquitetura inclui um módulo de decodificação especulativa, que também aparece no DSpark. A empresa afirma que o Flash-0731 supera o DeepSeek-V4-Pro (Preview) mesmo com uma quantidade ativada de parâmetros muito menor.
Nos testes, o modelo marcou 82.7 no Terminal Bench 2.1, contra 61.8 da versão Preview e 72.1 do Pro Preview. No NL2Repo, alcançou 54.2, enquanto os dois modelos anteriores ficaram em 39.4 e 38.5. No DeepSWE, a diferença foi maior: 54.4 para o Flash-0731, contra 7.3 do Preview e 12.8 do Pro.
O modelo também marcou 76.7 no Cybergym, 70.3 no Toolathlon-Verified e 68.7 no DSBench-FullStack. No DSBench-Hard, chegou a 59.6. Os resultados internos de desenvolvimento full-stack aparecem ao lado de testes públicos, por isso o card separa o DSBench-FullStack e o DSBench-Hard dos demais benchmarks.
A comparação inclui GLM-5.2 e Opus-4.8. O Flash-0731 supera o GLM-5.2 em Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon-Verified, DSBench-FullStack e DSBench-Hard. O Opus-4.8 ainda lidera todos os testes apresentados, com 85.0 no Terminal Bench 2.1 e 76.2 no Toolathlon-Verified.
A deepseek-ai distribui o modelo para a tarefa text-generation pela biblioteca transformers. O repositório tem 48 arquivos de peso, todos no formato safetensors. O card não informa o tamanho total dos arquivos nem o número total de parâmetros.
Esse limite impede concluir se uma máquina comum de desenvolvedor consegue executar o modelo. O material documenta uma execução com vLLM em um único nó com 4×GB300, mas não transforma essa configuração em requisito mínimo. Também não informa memória necessária para rodar localmente. A única conclusão segura é que o fabricante oferece instruções de conversão dos pesos e demos de chat para execução local.
O lançamento não inclui um chat template no formato Jinja. Em vez disso, a deepseek-ai fornece uma pasta encoding com scripts Python e casos de teste para converter mensagens em formato compatível com a API da OpenAI e interpretar as respostas. O parâmetro reasoning_effort aceita os níveis low, high e max, que controlam o tempo de deliberação antes da resposta.
No vLLM, o usuário ativa o DSpark com a opção speculative-config. No SGLang, usa --speculative-algorithm DSPARK sem indicar um modelo separado para os rascunhos. Para cenários com agentes, a recomendação local usa temperature = 1.0 e top_p = 0.95; para outros casos, top_p = 1.0. Nos níveis high e max, o card recomenda saída máxima de 384K tokens.
A licença MIT permite usar, modificar e distribuir o modelo, inclusive em produtos comerciais, desde que o distribuidor preserve os avisos de copyright e a licença. Ela não oferece garantia sobre o funcionamento do software ou dos pesos. Para quem desenvolve no Brasil, o ponto prático é claro: a licença reduz a barreira jurídica, enquanto o tamanho real dos pesos ainda define se o uso ficará no computador do desenvolvedor ou em infraestrutura de datacenter.