
Google presentou Gemini 3.8 Live con Live Avatar, unha nova capacidade que combina diálogo por voz en tempo real con vídeo xerado cunha latencia reducida para dotar os axentes de intelixencia artificial dunha presenza visual dinámica. A proposta está orientada principalmente a empresas e permite manter conversacións nas que o sistema escoita, ve e responde mediante voz e un avatar animado.
Live Avatar sincroniza os movementos dos beizos coa fala e incorpora expresións faciais e quendas de conversación máis naturais. O sistema pode empregar diferentes personaxes, cada un cunha aparencia, voz e presenza expresiva propias, para ofrecer atención ao cliente, percorridos interactivos ou outros servizos dixitais.
A capacidade integra ademais a execución asíncrona de ferramentas. Gemini pode realizar chamadas a servizos externos e consultar datos en segundo plano mentres mantén a conversación co usuario, de maneira que tarefas complexas non teñen por que interromper o diálogo. Google pon como exemplo o proceso de rexistro dun hóspede nun hotel mentres o avatar continúa interactuando con el.
O sistema foi deseñado para funcionar de maneira multimodal, procesando simultaneamente entradas visuais e de audio e xerando respostas mediante voz e vídeo. A sincronización de fala, movementos labiais e expresións pode manterse tamén en conversacións multilingües, con soporte para 97 linguas.
As organizacións poden escoller entre unha biblioteca de avatares predefinidos ou crear personaxes personalizados a partir dunha imaxe de referencia. Esta segunda opción permite conservar a aparencia, o estilo visual ou a identidade dun personaxe mentres se lle proporciona unha animación interactiva. A creación de avatares personalizados está actualmente restrinxida a clientes empresariais incluídos nun programa de acceso autorizado.
Gemini 3.8 Live con Live Avatar está dispoñible desde hoxe en Gemini Enterprise, xunto coa API para a súa integración en aplicacións e axentes empresariais.
Google tamén incorporou medidas específicas para facilitar a identificación do contido xerado. As saídas dos seus produtos de IA inclúen a marca de auga imperceptible SynthID, integrada tanto no audio como no vídeo para permitir detectar o seu carácter sintético e reducir os riscos de desinformación ou atribución incorrecta.

