Modelos e LLMs

Alibaba lança Qwen3.8-Max com 2.4 trilhões de parâmetros

DeepSeek reduz o preço por token, enquanto Alibaba aposta em um modelo esparso para baixar o custo de uso.

Reprodução · AI News

A Alibaba lançou o Qwen3.8-Max em 2026-08-05. O modelo tem 2.4 trilhões de parâmetros e ativa cerca de 95 bilhões em cada pedido. Essa arquitetura pode reduzir o custo e o atraso das respostas para empresas que usam texto, imagens e vídeo em grande escala.

Alibaba ativa só parte do modelo a cada pedido

O Qwen3.8-Max usa uma arquitetura de mistura de especialistas. Ela não executa todos os parâmetros durante a inferência. A Alibaba afirma que esse desenho reduz o custo e o tempo de resposta em comparação com a execução do modelo inteiro.

O sistema aceita texto, imagens e vídeo. Também trabalha com até um milhão de tokens de contexto. Isso permite enviar entradas longas, mas o anúncio não informa quais requisitos de hardware ou limites de uso se aplicam fora do acesso hospedado.

A empresa também afirmou que o Qwen3.8-Max concluiu um projeto de engenharia de software ao longo de 16 dias. Esse resultado aparece como uma alegação da Alibaba, não como uma demonstração reproduzida no anúncio.

O preço anunciado ficou abaixo do Kimi K3, da Moonshot AI. O Qwen3.8-Max custa $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída. O Kimi K3 custa $3 e $15, respectivamente.

A comparação não depende apenas do tamanho do modelo. A arquitetura, a quantidade de parâmetros ativos, o volume de tokens e o número de chamadas também mudam o custo final de uma tarefa.

DeepSeek corta o preço por token, mas tarefa custa mais

A DeepSeek seguiu outro caminho com o V4-Flash. O modelo tem 284 bilhões de parâmetros no total e ativa 13 bilhões durante a inferência, segundo a Artificial Analysis. A janela de contexto também chega a um milhão de tokens.

O V4-Flash custa $0.14 por milhão de tokens de entrada e $0.28 por milhão de tokens de saída. Na versão Max Effort, o preço de entrada com cache cai para $0.003 por milhão de tokens, uma redução de 98% em relação à tarifa padrão.

O cache reaproveita contexto processado em pedidos anteriores. Isso favorece fluxos que repetem instruções ou documentos. Não reduz automaticamente o custo de uma tarefa inteira.

A Artificial Analysis estimou custo médio de três centavos por teste para o V4-Flash. O Kimi K3 ficou em 86 centavos, o GPT-5.6 Sol, da OpenAI, em $1.86, e o Claude Fable 5, da Anthropic, em $3.15.

O cálculo considera quantos tokens cada modelo usa e quantas respostas gera. Um preço menor por token pode perder vantagem quando o sistema produz mais texto ou exige interações adicionais.

No teste, a versão de raciocínio Max Effort recebeu 40 pontos no Intelligence Index da Artificial Analysis. A empresa também registrou velocidade de cerca de 118 tokens por segundo.

O Kimi K3 mostra o outro lado dessa conta. A Artificial Analysis registrou média de $10.57 por tarefa no AA-Briefcase, com cerca de 120,000 tokens de saída e 83 turnos por tarefa. O modelo marcou 57 no Intelligence Index.

A Alibaba, a DeepSeek e a Moonshot AI mantêm lançamentos com pesos abertos ao lado do acesso por API hospedada. O anúncio não detalha requisitos para baixar ou executar esses pesos. Na Arena.AI, o Qwen3.8-Max liderou entre modelos chineses de texto, mas ficou atrás de modelos da Anthropic no ranking geral. Em análise visual, terminou em segundo, atrás de uma variante do Anthropic Claude Fable 5.

Fontes

AI NewsModelos e LLMs
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.