QwenAudio lança agente de voz que chega a 1.992 estrelas em 12 dias
Runtime mantém a conversa ativa enquanto agentes pesquisam, usam ferramentas e executam tarefas.
Runtime mantém a conversa ativa enquanto agentes pesquisam, usam ferramentas e executam tarefas.
Quem fala com um agente de voz não precisa esperar em silêncio enquanto ele trabalha. O QwenAudio/qwen-audio-agent é um runtime de voz em tempo real que mantém a conversa ativa e devolve resultados de tarefas em segundo plano. A QwenAudio criou o projeto em 2026-07-27, e o repositório chegou a 1.992 estrelas em 12 dias. Ele serve para quem quer controlar Agents de programação e outras tarefas por voz, pela web, pelo terminal ou pelo desktop.
O runtime responde imediatamente às perguntas diretas e envia tarefas demoradas para um Agent de backend. Enquanto esse Agent pesquisa, chama ferramentas ou processa uma tarefa, a conversa continua aberta. O usuário pode perguntar pelo andamento ou cancelar o trabalho, e o resultado retorna à conversa quando fica pronto.
A arquitetura também permite criar várias tarefas independentes, executadas de forma assíncrona pelo backend. O projeto unifica esses Agents sob a arquitetura ACP e permite escolher o Agent de programação usado pelo usuário. A integração reaproveita ferramentas, MCP e Skills já disponíveis no Agent selecionado.
A interface de áudio oferece interação full-duplex, interrupção natural e conversas com várias trocas. Na versão v1.3.0, o projeto integrou o speech-to-speech da Hugging Face com VAD, STT, LLM e TTS totalmente locais. Isso deixa o processamento de voz na máquina, mas o README não afirma que todo Agent de backend funcione localmente.
O projeto não descreve um serviço externo obrigatório para todas as instalações. A dependência muda conforme o Agent escolhido, as ferramentas conectadas e o uso de MCP. Quem quiser usar um backend específico precisa preparar esse Agent e seus acessos antes de executar tarefas.
A adoção começa pelo repositório JavaScript, que aponta para npm e Node.js. O usuário pode escolher entre WebUI, TUI de terminal e aplicativo desktop. O desktop roda em macOS, Windows e Linux, enquanto o Gateway integrado apareceu na primeira versão estável para macOS.
O aplicativo oferece instalação do Agent de backend em um clique. Na primeira execução, o usuário precisa selecionar o Agent e autorizar as ferramentas que ele poderá usar. O README disponível não informa um comando único de instalação nem detalha uma sequência completa de configuração.
Além da voz, o desktop mantém um orb flutuante, acorda por atalho e pode entrar em repouso automático. A v1.5.0 adicionou lembretes agendados, relatório de progresso e a palavra de ativação “你好千问”. A v1.6.0 acrescentou suporte oficial ao Windows e memória pessoal extraída automaticamente ao fim de cada sessão.
A versão mais recente é a v1.7.0, publicada em 2026-08-07, mesma data do último commit. Ela corrigiu o uso do cmd.exe como intermediário para comandos ACP .exe no Windows e permitiu importar skins personalizados para o orb.
Os números indicam adoção veloz, não maturidade comprovada. O repositório tem 142 forks e 12 issues abertas, além das 1.992 estrelas acumuladas em apenas 12 dias. O projeto usa a licença Apache-2.0, que permite usar, alterar e redistribuir o código sob seus termos.
A ferramenta não serve para quem busca apenas transcrição de áudio ou um chatbot sem tarefas de fundo. Ela exige um Agent de backend quando o usuário quer executar trabalhos, usar ferramentas ou acompanhar processos demorados.