Modelos e LLMs

Alibaba lança modelo de 2,4 trilhões com 95 bilhões ativos

Qwen3.8-Max processa texto, imagens e vídeo, com contexto de até um milhão de tokens

Reprodução · AI News

A Alibaba lançou o Qwen3.8-Max em 2026-08-05. O maior modelo da empresa tem 2,4 trilhões de parâmetros, mas ativa cerca de 95 bilhões em cada pedido. Ele processa texto, imagens e vídeo, com contexto de até um milhão de tokens. A arquitetura reduz o trabalho executado por solicitação para quem usa modelos grandes por API.

O Qwen3.8-Max usa uma arquitetura de mistura de especialistas. Ela ativa apenas parte da rede em cada chamada, em vez de executar os 2,4 trilhões de parâmetros completos. A Alibaba afirma que essa escolha reduz custos e atrasos nas respostas. A empresa também disse que o modelo concluiu um projeto de engenharia de software ao longo de 16 dias.

DeepSeek disputa preço com modelo menor

A DeepSeek adotou uma estratégia diferente com o V4-Flash. O modelo soma 284 bilhões de parâmetros e ativa 13 bilhões durante a inferência. A Artificial Analysis lista uma janela de contexto de um milhão de tokens, com preço de $0.14 por milhão de tokens de entrada e $0.28 por milhão de tokens de saída.

A versão Max Effort cobra $0.003 por milhão de tokens quando o conteúdo reutilizado vem do cache. Essa tarifa fica 98% abaixo do preço padrão de entrada. O cache permite reaproveitar contexto processado em chamadas anteriores. A Artificial Analysis também registrou velocidade de saída de cerca de 118 tokens por segundo nos testes.

Os preços menores apareceram no custo por teste. Segundo dados da Artificial Analysis reportados pela Reuters, o V4-Flash custou em média três centavos por teste. O Kimi K3 ficou em 86 centavos, o OpenAI’s GPT-5.6 Sol em $1.86 e o Anthropic’s Claude Fable 5 em $3.15. O cálculo considerou os tokens de entrada e saída usados por cada modelo.

A comparação não transforma a tarifa por token em custo final. Modelos que geram mais texto ou fazem mais chamadas podem gastar mais para completar a mesma tarefa. O Kimi K3, da Moonshot AI, custou em média $10.57 por tarefa no AA-Briefcase, gerou cerca de 120.000 tokens de saída e fez 83 interações. O modelo tem 2,8 trilhões de parâmetros, cerca de 104 bilhões ativos e cobra $3 por milhão de tokens de entrada e $15 por milhão de saída.

O Qwen3.8-Max assumiu o primeiro lugar entre modelos chineses de texto na Arena.AI após o lançamento. Ainda ficou atrás de vários modelos da Anthropic no ranking geral. Na análise de imagens e outros materiais visuais, ocupou o segundo lugar, atrás de uma variante do Anthropic Claude Fable 5. A Alibaba informou esses resultados, mas o anúncio não apresenta detalhes do teste que produziu o projeto de software de 16 dias.

A Alibaba, a DeepSeek e a Moonshot AI mantêm pesos abertos ao lado do acesso por API hospedada. O material não informa requisitos de hardware, regras específicas de acesso ou quais pesos do Qwen3.8-Max já foram liberados. Também não apresenta custo por tarefa para o modelo da Alibaba. Os valores divulgados cobrem tokens, enquanto o gasto total depende do volume de saída e do número de interações.

Fontes

AI NewsModelos e LLMs
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.