xAI lança modelo de voz 2.0 com foco em áudio ruidoso e telefonia
Nova versão promete o dobro de precisão sem alterar tarifas de processamento por hora e assume como padrão da API nas próximas semanas.
Edição: Anderson Gomes
· 3 min de leitura

A xAI lançou em 18 de setembro de 2026 o Grok Voice Transcribe 2.0, seu novo modelo de conversão de fala em texto. A empresa afirma que a versão atinge o dobro da precisão do modelo anterior pelo mesmo custo de processamento. A tecnologia já opera em chamadas de suporte, legendagem de vídeos e no assistente de bordo dos carros da Tesla. A mudança atende desenvolvedores que integram transcrição automática em fluxos de trabalho e produtos físicos.
A arquitetura aproveita a base do Grok Voice treinada com dados de áudio ao vivo, multilíngue e captado em ambientes ruidosos. No benchmark público da Artificial Analysis, o modelo assumiu o primeiro lugar em precisão entre 32 sistemas de streaming avaliados. A companhia também mediu a taxa de erro em quatro bases internas de produção: chamadas telefônicas em 8 kHz, conversas diretas com o Grok, leitura de credenciais e comandos curtos em 19 idiomas. O sistema liderou todos os testes internos de telefonia contra concorrentes como ElevenLabs Scribe v2 e Deepgram Nova-3.
Erro cai para menos de um terço em comandos curtos
Em comandos rápidos de voz, a taxa de erro de palavras caiu de 20.6% na versão 1.0 para 6.8% no novo modelo. O ganho decorre da detecção automática de dezenas de línguas e da capacidade de acompanhar trocas de idioma no meio da gravação em uma única passagem. O motor inclui ainda marcação temporal por palavra com índice de confiança, transcrição independente de até oito canais e identificação de locutores sem custo adicional. Desenvolvedores também podem enviar até 100 termos específicos por requisição via viés de vocabulário para calibrar jargões médicos ou nomes de produtos.
A xAI adicionou remoção automática de pausas como "um" e "uh", formatação direta de números e moedas, além de detecção de fim de fala voltada a agentes conversacionais. A integração já abastece produtos corporativos de terceiros, como o Loom da Atlassian. A Atlassian adotou o modelo para capturar planos de ação gravados em vídeo e enviá-los ao Cursor para gerar código automaticamente. "Fechamos o ciclo do contexto ao código: você grava o que quer dizer e o trabalho acontece", declarou Sanchan Saxena, vice-presidente sênior da Atlassian.
Preço permanece congelado antes da descontinuação
A cobrança continua fixada em valores relativos idênticos aos da versão inicial: o processamento em lote custa metade do valor cobrado pela modalidade de streaming por hora de áudio gravado. Recursos como diarização de falantes e envio de termos personalizados já vêm embutidos nessas tarifas. As aplicações conectadas à Speech-to-Text API recebem a melhoria sem necessidade de alterar código. O novo modelo se tornará a opção padrão do serviço nos próximos dias.
A empresa vai descontinuar a versão 1.0 nas semanas seguintes ao lançamento. Quem precisar manter a versão antiga durante a transição terá de fixar explicitamente o identificador grok-voice-transcribe-1.0 na configuração da chamada. Embora a xAI exiba liderança em seus testes internos de produção, as avaliações de telefonia e credenciais dependem de métricas fechadas da própria desenvolvedora, sem auditoria externa independente além da tabela pública de streaming.
- xAI
- Modelos e LLMs

xAI lança Grok 4.7 com foco em código e corte agressivo de preço
· 3 min de leitura


Executivos da OpenAI sabiam que pirataria em massa para IA era ilegal
· 3 min de leitura

Mistral abre centro em Munique e mira indústria pesada com IA física
· 3 min de leitura