Alibaba lança prévia do Qwen4 com modelo de 125 bilhões de parâmetros
O Qwen3.8-Flash-Next comprime contexto longo para acelerar tarefas de programação autônoma em chips da Nvidia.
Edição: Anderson Gomes
· 3 min de leitura

A Alibaba liberou em 26 de agosto de 2026 os pesos do Qwen3.8-Flash-Next, modelo multimodal de inteligência artificial com 125 bilhões de parâmetros que antecipa a arquitetura do futuro Qwen4. O sistema adota mistura de especialistas, ativa apenas 6 bilhões de parâmetros por token e alcança janela nativa de 262.144 tokens, extensível para 1 milhão com YaRN. A ferramenta atende programadores e equipes técnicas que desenvolvem aplicações intensivas de código autônomo, processamento de documentos e rotinas orientadas a ferramentas externas. O modelo roda na nuvem ou localmente.
Camadas alternadas eliminam gargalo de memória
Em sequências longas, o cálculo tradicional de atenção e o consumo de memória do cache KV costumam travar a operação dos servidores. Para contornar esse teto operacional, a nova arquitetura alterna duas estruturas complementares: três de cada quatro camadas usam Gated DeltaNet e a camada restante aplica o mecanismo Qwen Sparse Attention. A tecnologia Gated DeltaNet comprime o contexto passado em um estado recorrente de tamanho fixo, o que impede a expansão do cache à medida que o texto cresce. A estratégia poupa capacidade de processamento.
Diferente de métodos esparsos anteriores que dependiam de indexadores por token e encareciam a conta computacional em contextos longos, o Qwen Sparse Attention agrupa a sequência em microblocos. O algoritmo estima a importância dos blocos em conjunto e seleciona somente os trechos diretamente relevantes para a resposta. Essa filtragem reduz a sobrecarga de indexação e viabiliza a alternância contínua entre as camadas recorrentes e as de atenção. O desenho busca manter a precisão.
Em publicação assinada por Rajath Narasimha no blog técnico da Nvidia, a fabricante reproduziu medições de desempenho fornecidas pela própria Alibaba para justificar o ganho de eficiência. Nos dados divulgados pela desenvolvedora chinesa, o núcleo de atenção entregou acelerações de até 7,6 vezes no pré-preenchimento e de 4,9 vezes na decodificação em cargas de 1 milhão de tokens. Em testes de atendimento online com 90% de acerto em cache de prefixo, o modelo alcançou 8,6 vezes a vazão de pré-preenchimento do Qwen3.7-Plus. Os dados dependem de validação externa.
Rack com 72 chips acelera rotinas de código
Para sustentar fluxos de agentes que diagnosticam e corrigem falhas de código em tempo real, a Nvidia validou a execução do modelo em sua plataforma de rack GB300 NVL72. A estrutura integra 72 unidades de processamento gráfico Blackwell Ultra em um único domínio de barramento NVLink com velocidade de transferência de 130 terabytes por segundo. Essa conexão direta elimina o tráfego pesado que costuma congestionar redes convencionais quando a mistura de especialistas distribui tarefas entre chips diferentes. O arranjo sustenta alto volume simultâneo.
Nos testes em rack, o modelo sustentou picos acima de 16 mil tokens por segundo por placa gráfica e mais de 200 tokens por segundo por usuário. O sistema também roda em placas locais. A Nvidia garantiu suporte no primeiro dia em motores de inferência como SGLang, vLLM, TokenSpeed e TensorRT LLM, além de receitas de treino no NeMo AutoModel e NeMo RL. Os pesos com 125 bilhões de parâmetros e 51 bilhões em incorporações de n-gramas já estão disponíveis no Hugging Face e no serviço QwenCloud.
- NVIDIA
- Modelos e LLMs
Nvidia separa até oito falantes em áudio com atraso de 0,32 segundo
Com pesos abertos em GGUF e Safetensors, o Nemotron 3 Diarization roda tanto em C++ local quanto em pipelines de transmissão ao vivo.
· 3 min de leitura

Anthropic lança Claude Fable 5.1 com corte de até 45% em custo de cache
· 4 min de leitura

Oriveo reúne 15 provedores de IA em app aberto com chave própria
· 3 min de leitura

Jake Schincariol cria pacote com 11 rotinas para Claude gerenciar LinkedIn
· 3 min de leitura