Modelos e LLMs

QwenAudio lança agente de voz que chega a 1.992 estrelas em 12 dias

Runtime mantém a conversa ativa enquanto agentes pesquisam, usam ferramentas e executam tarefas.

Quem fala com um agente de voz não precisa esperar em silêncio enquanto ele trabalha. O QwenAudio/qwen-audio-agent é um runtime de voz em tempo real que mantém a conversa ativa e devolve resultados de tarefas em segundo plano. A QwenAudio criou o projeto em 2026-07-27, e o repositório chegou a 1.992 estrelas em 12 dias. Ele serve para quem quer controlar Agents de programação e outras tarefas por voz, pela web, pelo terminal ou pelo desktop.

O runtime responde imediatamente às perguntas diretas e envia tarefas demoradas para um Agent de backend. Enquanto esse Agent pesquisa, chama ferramentas ou processa uma tarefa, a conversa continua aberta. O usuário pode perguntar pelo andamento ou cancelar o trabalho, e o resultado retorna à conversa quando fica pronto.

A arquitetura também permite criar várias tarefas independentes, executadas de forma assíncrona pelo backend. O projeto unifica esses Agents sob a arquitetura ACP e permite escolher o Agent de programação usado pelo usuário. A integração reaproveita ferramentas, MCP e Skills já disponíveis no Agent selecionado.

A voz pode rodar localmente, mas o backend depende do Agent escolhido

A interface de áudio oferece interação full-duplex, interrupção natural e conversas com várias trocas. Na versão v1.3.0, o projeto integrou o speech-to-speech da Hugging Face com VAD, STT, LLM e TTS totalmente locais. Isso deixa o processamento de voz na máquina, mas o README não afirma que todo Agent de backend funcione localmente.

O projeto não descreve um serviço externo obrigatório para todas as instalações. A dependência muda conforme o Agent escolhido, as ferramentas conectadas e o uso de MCP. Quem quiser usar um backend específico precisa preparar esse Agent e seus acessos antes de executar tarefas.

A adoção começa pelo repositório JavaScript, que aponta para npm e Node.js. O usuário pode escolher entre WebUI, TUI de terminal e aplicativo desktop. O desktop roda em macOS, Windows e Linux, enquanto o Gateway integrado apareceu na primeira versão estável para macOS.

O aplicativo oferece instalação do Agent de backend em um clique. Na primeira execução, o usuário precisa selecionar o Agent e autorizar as ferramentas que ele poderá usar. O README disponível não informa um comando único de instalação nem detalha uma sequência completa de configuração.

O projeto cresce rápido, mas ainda tem 12 dias

Além da voz, o desktop mantém um orb flutuante, acorda por atalho e pode entrar em repouso automático. A v1.5.0 adicionou lembretes agendados, relatório de progresso e a palavra de ativação “你好千问”. A v1.6.0 acrescentou suporte oficial ao Windows e memória pessoal extraída automaticamente ao fim de cada sessão.

A versão mais recente é a v1.7.0, publicada em 2026-08-07, mesma data do último commit. Ela corrigiu o uso do cmd.exe como intermediário para comandos ACP .exe no Windows e permitiu importar skins personalizados para o orb.

Os números indicam adoção veloz, não maturidade comprovada. O repositório tem 142 forks e 12 issues abertas, além das 1.992 estrelas acumuladas em apenas 12 dias. O projeto usa a licença Apache-2.0, que permite usar, alterar e redistribuir o código sob seus termos.

A ferramenta não serve para quem busca apenas transcrição de áudio ou um chatbot sem tarefas de fundo. Ela exige um Agent de backend quando o usuário quer executar trabalhos, usar ferramentas ou acompanhar processos demorados.

Fontes

JavaScriptApache-2.0Modelos e LLMsTrendshift
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.