
Google presentou Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, dous novos modelos de audio orientados ás interaccións por voz en tempo real, con melloras na capacidade de razoamento, comprensión visual e execución de tarefas mentres manteñen unha conversa fluída.
Gemini 3.8 Live está deseñado para ofrecer unha combinación de capacidade e eficiencia, mentres que a versión 3.8 Live Extended Thinking está enfocada a tarefas máis complexas que requiren razoamento en varios pasos. Esta última sitúase no primeiro posto do índice Speech to Speech de Artificial Analysis, cunha puntuación de 82,6, e alcanza un 68,6 % no benchmark τ-Voice de tarefas con axentes.
Unha das principais novidades é a capacidade para executar chamadas a ferramentas e API de maneira asíncrona. O modelo pode iniciar unha tarefa en segundo plano e continuar falando co usuario mentres agarda polo resultado, en vez de interromper a conversa. A modalidade Extended Thinking engade ademais razoamento configurable e pode narrar o progreso das operacións máis complexas.
A interacción tamén pode incorporar información visual en tempo real. Gemini 3.8 Live é capaz de procesar imaxes e vídeo mentres conversa, o que permite, por exemplo, analizar unha pantalla durante un proceso de configuración, ofrecer asistencia técnica a partir do que mostra a cámara ou mesmo interpretar unha partida de xadrez.
O sistema admite 97 idiomas e pode cambiar automaticamente de lingua durante unha conversa. Google destaca tamén a súa capacidade para interpretar con precisión códigos de confirmación, números de reclamación e outra información alfanumérica, un aspecto especialmente relevante para axentes de voz empregados en servizos de atención ao cliente.
Estas capacidades están pensadas tamén para aplicacións empresariais. Google sinala que os novos modelos poden executar fluxos de traballo complexos mantendo a interacción por voz, desde reservas e xestión de tarefas ata a creación de documentos e materiais comerciais a partir de instrucións faladas.
Gemini 3.8 Live e 3.8 Live Extended Thinking xa están dispoñibles para desenvolvedores a través da Gemini API e Google AI Studio. As empresas poden acceder a eles en vista previa privada en Gemini Enterprise, mentres que Gemini 3.8 Live tamén comeza a chegar a Search Live. A versión Extended Thinking está dispoñible en Gemini Live e chega aos subscritores de Google AI Pro e Ultra en determinadas funcións de Workspace.
A nova xeración de modelos de voz chega acompañada de Gemini 3.5 Transcribe, un modelo especializado en converter voz en texto que admite máis de 85 idiomas. Google sitúa a súa taxa de erro de palabras (WER) no 4 % en transcrición en streaming e no 2,6 % sen streaming. Inclúe cambio automático de idioma, vocabulario personalizado de ata 1.000 termos e un modo de transcrición capaz de eliminar palabras de recheo e organizar o resultado para facilitar a lectura.
Para os desenvolvedores, Gemini 3.8 Live e 3.8 Live Extended Thinking tamén se poden integrar mediante plataformas como LiveKit, LangChain, Vercel, Agora, Pipecat e Fishjam. O prezo anunciado para a API é de 0,005 dólares por minuto de audio de entrada e 0,018 dólares por minuto de audio xerado.
Google sinala finalmente que todo o audio xerado polos seus produtos de IA incorpora marcas de auga imperceptibles mediante SynthID, deseñadas para facilitar a identificación posterior de contido xerado artificialmente.

