Modelos e LLMs

DeepMind lança Gemini 3.8 Live com avatares em 97 idiomas

A ferramenta integra vídeo ao vivo ao Gemini Enterprise e executa tarefas em segundo plano sem pausar o diálogo com o usuário.

Reprodução · Google DeepMind

O Google DeepMind lançou nesta quinta-feira, 24 de setembro de 2026, o Gemini 3.8 Live with Live Avatar para adicionar presença visual e fala contínua a assistentes virtuais de empresas. A tecnologia emparelha a geração de vídeo em baixa latência ao diálogo em tempo real, sincroniza lábios em 97 idiomas e faz chamadas de sistemas em segundo plano sem interromper a conversa. A estreia ocorreu diretamente no pacote Gemini Enterprise. O recurso atende companhias que buscam automatizar serviços de atendimento ao cliente ou conduzir visitas guiadas interativas com personagens digitais próprios.

Chamadas de ferramentas em segundo plano sustentam a conversa

O cientista Shuo-yiin Chang e o engenheiro de software CJ Zheng assinam a publicação oficial em nome da equipe de áudio do Gemini. Os pesquisadores acoplaram o modelo de conversação ao vivo a uma camada de streaming de vídeo para criar avatares que escutam, veem e respondem com expressões dinâmicas. O sistema processa áudio e imagens de modo simultâneo. Essa leitura multimodal calcula reações faciais imediatas e coordena a alternância de falas entre a pessoa e o atendente virtual sem pausas artificiais na tela.

O motor do Gemini 3.8 executa chamadas assíncronas a ferramentas externas enquanto mantém o fluxo verbal e visual ativo diante do usuário. Na prática, o sistema consulta bancos de dados e recupera informações de retaguarda sem silenciar a voz do avatar nem paralisar seus movimentos faciais. O DeepMind demonstrou essa capacidade ao colocar o modelo para registrar a entrada de um hóspede em hotel enquanto buscava reservas no sistema. A checagem ocorreu sem quebras no diálogo falado.

Sincronia atinge 97 idiomas mas personalização exige autorização

O módulo de sincronização direta entre fala e vídeo opera em 97 idiomas diferentes e adapta a boca do personagem sem provocar deformações visuais nos quadros. Os vídeos de teste mostram a figura virtual transitando de uma língua para outra no meio da conversa enquanto reconfigura a articulação labial de forma imediata. Essa entrega expande o lançamento da semana anterior, quando Tom Ouyang e Malini Jaganathan apresentaram o Gemini 3.8 Live e a variante 3.8 Live Extended Thinking. A biblioteca inicial oferece avatares com vozes pré-configuradas.

Empresas interessadas em criar figuras personalizadas podem fornecer uma imagem nítida de referência para que os desenvolvedores gerem um personagem sob medida. Esse processo reproduz os traços físicos e a identidade de marca da contratante, mas depende de aprovação prévia em uma lista de liberação corporativa mantida pelo Google. Clientes sem essa autorização usam apenas os modelos genéricos. Para coibir manipulações e manter o rastreio do material gerado, a engenharia do projeto incorporou a tecnologia SynthID de maneira invisível no áudio e no vídeo.

Essa marca d'água digital se entrelaça aos arquivos de saída e permite detectar criações de inteligência artificial, segundo os parâmetros publicados no cartão do modelo. O DeepMind detalhou as salvaguardas no documento técnico. A empresa liberou a API no mesmo ciclo em que apresentou a voz do Gemini 3.8 de Leland Rechis e Alan Cowen e a blindagem do 3.8 Flash Cyber de Tulsee Doshi e Raluca Ada Popa. A safra de agosto de 2026 reuniu a ciberdefesa de Four Flynn e o leitor de vídeo por agentes de Rohan Doshi e Mario Lučić.

Fontes

Google DeepMindModelos e LLMs
Como apuramos: as fontes consultadas estão indicadas nesta matéria para que você possa conferir as informações. Os números de estrelas e a posição no ranking refletem o momento da coleta. Conheça os critérios editoriais.