Pular para o conteúdo
NovidadesIA

Modelos e LLMs

Alibaba lança prévia do Qwen4 com modelo de 125 bilhões de parâmetros

O Qwen3.8-Flash-Next comprime contexto longo para acelerar tarefas de programação autônoma em chips da Nvidia.

Edição: Anderson Gomes
· 3 min de leitura

Alibaba lança prévia do Qwen4 com modelo de 125 bilhões de parâmetros
Imagem: Reprodução · NVIDIA · reprodução · licença não declarada

A Alibaba liberou em 26 de agosto de 2026 os pesos do Qwen3.8-Flash-Next, modelo multimodal de inteligência artificial com 125 bilhões de parâmetros que antecipa a arquitetura do futuro Qwen4. O sistema adota mistura de especialistas, ativa apenas 6 bilhões de parâmetros por token e alcança janela nativa de 262.144 tokens, extensível para 1 milhão com YaRN. A ferramenta atende programadores e equipes técnicas que desenvolvem aplicações intensivas de código autônomo, processamento de documentos e rotinas orientadas a ferramentas externas. O modelo roda na nuvem ou localmente.

Camadas alternadas eliminam gargalo de memória

Em sequências longas, o cálculo tradicional de atenção e o consumo de memória do cache KV costumam travar a operação dos servidores. Para contornar esse teto operacional, a nova arquitetura alterna duas estruturas complementares: três de cada quatro camadas usam Gated DeltaNet e a camada restante aplica o mecanismo Qwen Sparse Attention. A tecnologia Gated DeltaNet comprime o contexto passado em um estado recorrente de tamanho fixo, o que impede a expansão do cache à medida que o texto cresce. A estratégia poupa capacidade de processamento.

Diferente de métodos esparsos anteriores que dependiam de indexadores por token e encareciam a conta computacional em contextos longos, o Qwen Sparse Attention agrupa a sequência em microblocos. O algoritmo estima a importância dos blocos em conjunto e seleciona somente os trechos diretamente relevantes para a resposta. Essa filtragem reduz a sobrecarga de indexação e viabiliza a alternância contínua entre as camadas recorrentes e as de atenção. O desenho busca manter a precisão.

Em publicação assinada por Rajath Narasimha no blog técnico da Nvidia, a fabricante reproduziu medições de desempenho fornecidas pela própria Alibaba para justificar o ganho de eficiência. Nos dados divulgados pela desenvolvedora chinesa, o núcleo de atenção entregou acelerações de até 7,6 vezes no pré-preenchimento e de 4,9 vezes na decodificação em cargas de 1 milhão de tokens. Em testes de atendimento online com 90% de acerto em cache de prefixo, o modelo alcançou 8,6 vezes a vazão de pré-preenchimento do Qwen3.7-Plus. Os dados dependem de validação externa.

Rack com 72 chips acelera rotinas de código

Para sustentar fluxos de agentes que diagnosticam e corrigem falhas de código em tempo real, a Nvidia validou a execução do modelo em sua plataforma de rack GB300 NVL72. A estrutura integra 72 unidades de processamento gráfico Blackwell Ultra em um único domínio de barramento NVLink com velocidade de transferência de 130 terabytes por segundo. Essa conexão direta elimina o tráfego pesado que costuma congestionar redes convencionais quando a mistura de especialistas distribui tarefas entre chips diferentes. O arranjo sustenta alto volume simultâneo.

Nos testes em rack, o modelo sustentou picos acima de 16 mil tokens por segundo por placa gráfica e mais de 200 tokens por segundo por usuário. O sistema também roda em placas locais. A Nvidia garantiu suporte no primeiro dia em motores de inferência como SGLang, vLLM, TokenSpeed e TensorRT LLM, além de receitas de treino no NeMo AutoModel e NeMo RL. Os pesos com 125 bilhões de parâmetros e 51 bilhões em incorporações de n-gramas já estão disponíveis no Hugging Face e no serviço QwenCloud.

  • NVIDIA
  • Modelos e LLMs

Fonte: Comunicado oficial · Como produzimos as matérias