Alibaba lança modelo de 2,4 trilhões de parâmetros com foco em custo
Qwen3.8-Max ativa 95 bilhões de parâmetros por consulta, enquanto DeepSeek reduz o preço de entrada e saída do V4-Flash.
Qwen3.8-Max ativa 95 bilhões de parâmetros por consulta, enquanto DeepSeek reduz o preço de entrada e saída do V4-Flash.
A Alibaba lançou o Qwen3.8-Max em 2026-08-05, seu maior modelo de inteligência artificial até agora. O sistema tem 2,4 trilhões de parâmetros, processa texto, imagens e vídeo e aceita contexto de até um milhão de tokens. A arquitetura ativa cerca de 95 bilhões de parâmetros por solicitação, segundo a empresa, para reduzir custo e atraso nas respostas.
O Qwen3.8-Max usa uma arquitetura de mistura de especialistas. Em vez de processar os 2,4 trilhões de parâmetros a cada chamada, o modelo seleciona apenas parte deles.
A Alibaba afirma que essa escolha reduz o custo e o tempo de resposta em comparação com a ativação do modelo completo. O comunicado, porém, não apresenta um benchmark próprio de latência ou de custo para sustentar a comparação.
A empresa também disse que o Qwen3.8-Max completou um projeto de engenharia de software ao longo de 16 dias. O anúncio não informa qual projeto o modelo executou, nem os critérios usados para avaliar o resultado. O dado registra uma demonstração, não uma medida ampla de desempenho.
A DeepSeek usa arquitetura esparsa semelhante, mas em escala menor. A Artificial Analysis lista o V4-Flash com 284 bilhões de parâmetros totais e 13 bilhões ativos durante a inferência. O Kimi K3, da Moonshot AI, tem 2,8 trilhões de parâmetros totais e cerca de 104 bilhões ativos.
O Qwen3.8-Max ficou próximo do Kimi K3 em tamanho. A Moonshot AI lançou o modelo em julho.
Na Arena.AI, plataforma de comparação colaborativa, o Qwen3.8-Max assumiu a liderança entre modelos chineses de texto após o lançamento. Ainda ficou atrás de vários modelos da Anthropic no ranking geral. Na categoria de análise de imagens e outros materiais visuais, ocupou o segundo lugar, atrás de uma variante do Anthropic Claude Fable 5.
O resultado vem de uma plataforma colaborativa. Ele não equivale a um teste independente de custo por tarefa.
A Alibaba cobra $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída no Qwen3.8-Max. O Kimi K3 custa $3 e $15, respectivamente, segundo os valores citados no anúncio. A diferença favorece o modelo da Alibaba em ambos os tipos de token.
A DeepSeek colocou o V4-Flash ainda abaixo desses preços. A Artificial Analysis lista tarifa de $0.14 por milhão de tokens de entrada e $0.28 por milhão de tokens de saída. A versão Max Effort cobra $0.003 por milhão de tokens quando reaproveita conteúdo já processado, valor 98% menor que a tarifa padrão de entrada.
A comparação muda quando mede a tarefa inteira. A Artificial Analysis estimou custo médio de três centavos por teste para o V4-Flash, contra 86 centavos para o Kimi K3, $1.86 para o OpenAI’s GPT-5.6 Sol e $3.15 para o Anthropic’s Claude Fable 5. O cálculo considera quanto cada modelo gera e lê para concluir o benchmark.
No AA-Briefcase, o Kimi K3 custou em média $10.57 por tarefa. O modelo gerou cerca de 120.000 tokens de saída e usou 83 turnos por tarefa. Chamadas repetidas e respostas longas podem elevar o gasto total mesmo quando a tarifa por token parece baixa.
A Artificial Analysis deu 40 pontos ao V4-Flash Max Effort no Intelligence Index e registrou cerca de 118 tokens por segundo nos testes. O Kimi K3 marcou 57 no mesmo índice e ficou em segundo lugar no AA-Briefcase, atrás do Claude Fable 5.
Alibaba, DeepSeek e Moonshot AI também mantêm lançamentos com pesos abertos ao lado do acesso por API hospedada. O anúncio não informa requisitos de hardware, condições de download ou quais pesos do Qwen3.8-Max estão liberados. Também não detalha limites de uso da API.