Google lança modelo de voz que clona fala com amostra de 30 segundos
Com os novos Gemini 3.8 Flash TTS e Flash-Lite TTS, empresa substitui catálogo antigo de 30 vozes por biblioteca com 2.000 opções e comandos de cena por texto.
Com os novos Gemini 3.8 Flash TTS e Flash-Lite TTS, empresa substitui catálogo antigo de 30 vozes por biblioteca com 2.000 opções e comandos de cena por texto.
O Google DeepMind lançou no dia 23 de setembro de 2026 dois modelos de inteligência artificial que convertem texto em fala sintética. As ferramentas Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS aposentam o limite antigo de 30 vozes da companhia e oferecem um acervo com mais de 2.000 opções gravadas em mais de 100 idiomas e dialetos. A tecnologia permite desenhar vozes inéditas por comandos escritos ou clonar timbres existentes com amostras curtas de áudio para jogos, audiolivros, podcasts e robôs de atendimento. O acesso aos sistemas já está aberto.
A desenvolvedora dividiu a tecnologia em duas frentes para separar o trabalho cênico refinado do trabalho pesado de dublar em massa. O Gemini 3.8 Flash TTS atende quem precisa de direção artística profunda, com controle fino sobre ritmo de fala, mudanças de dialeto e ruídos de resposta conversacional. Já o Gemini 3.8 Flash-Lite TTS opera com foco em eficiência de custo para dublagens volumosas e assistentes interativos em tempo real. Cada modelo cumpre uma função técnica diferente.
Com o Gemini 3.8 Flash TTS, o usuário cria vozes personalizadas do zero sem contratar estúdio, apenas digitando instruções descritivas sobre papel, cadência e sotaque regional. O material divulgado pela empresa mostra testes que vão desde um locutor animado de Melbourne e um robô monótono até um dragão que cospe fogo. O autor da cena insere rubricas diretamente no texto para mandar o sistema sussurrar em momentos de suspense ou adotar a calma de quem atende clientes. O roteiro dita a interpretação.
A cópia de timbres existentes exige apenas uma amostra de áudio de 30 segundos da pessoa que autorizou o uso da própria voz. Para barrar fraudes e resguardar profissionais da voz, a empresa vinculou a clonagem a checagens de consentimento, marca d'água invisível SynthID e credenciais C2PA. O sistema também salva o perfil sonoro criado para impedir que a voz mude de tom ao longo de produções longas. A estabilidade vocal sustenta o projeto.
Apesar da amplitude do anúncio, parte das funções prometidas ainda não chegou às mãos do público. O recurso de remixagem de voz, que promete alterar timbre, tom, velocidade e sotaque por comandos de texto, continua sem data e classificado como lançamento futuro. A própria publicação da empresa traz o aviso de que a tecnologia generativa ainda opera em caráter experimental. O comunicado pede cautela operacional.
Os modelos chegam integrados aos serviços Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook e Google Vids. O gerente de produto Leland Rechis e o diretor de pesquisa científica Alan Cowen assinam o anúncio em nome da equipe de áudio. O lançamento expande uma família que já conta com os modelos 3.5 Live Translate, 3.5 Transcribe, 3.8 Live e 3.8 Live Extended Thinking. A empresa acelera a entrega de áudio.