
ElevenLabs presentou Eleven v4, a nova xeración do seu modelo de conversión de texto a voz, acompañado de Eleven v4 Turbo, unha variante deseñada para aplicacións que precisan baixa latencia. A nova arquitectura busca mellorar a expresividade, a naturalidade das conversas e a consistencia das voces en proxectos de longa duración.
Eleven v4 está deseñado para interpretar o ton, o ritmo, a emoción, o personaxe e o contexto dun texto antes de xerar a voz. Deste xeito, unha mesma frase pode adoptar unha interpretación diferente segundo a situación na que se empregue, desde unha intervención dramática ou cómica ata unha resposta conversacional ou unha narración máis pausada.
O modelo tamén permite indicar mediante instrucións en linguaxe natural como debe pronunciarse unha frase e empregar etiquetas inseridas no propio texto para definir emocións, efectos de son ou características da interpretación. Entre os exemplos ofrecidos aparecen indicacións como [laughs], [said angrily in French accent], [light rain] ou [phone buzzing]. ElevenLabs sinala que o novo modelo segue estas instrucións con maior precisión que as xeracións anteriores e tamén mellorou o soporte dos fonemas do Alfabeto Fonético Internacional (IPA).
A xeración de diálogos con varios interlocutores recibe igualmente unha revisión. Eleven v4 pretende manter as características propias de cada voz ao longo dunha conversa e utilizar o contexto global da escena para que as intervencións dos distintos personaxes resulten máis naturais, en lugar de xerar cada frase como unha peza independente. Esta mellora está orientada a aplicacións como audiolibros, anuncios, narracións e axentes conversacionais.
ElevenLabs sitúa Eleven v4 no primeiro posto do seu Voice Arena de Artificial Analysis en setembro de 2026 e afirma que o modelo foi preferido por aproximadamente o 75 % dos oíntes en probas cegas fronte a modelos de Cartesia, Inworld e Google. A metodoloxía empregada nas comparacións combinou valoracións sobre expresividade e naturalidade e considerou os empates como media preferencia.
Eleven v4 Turbo traslada estas capacidades a escenarios nos que a velocidade de resposta resulta especialmente importante. A empresa sitúa a súa latencia mediana de inferencia en aproximadamente 100 ms e o tempo mediano ata a primeira emisión de voz en 150 ms, segundo medicións realizadas en setembro de 2026. As probas comparativas citadas por ElevenLabs sitúan os demais modelos avaliados entre 262 e 814 ms no segundo indicador.
A variante Turbo foi desenvolvida especificamente para funcionar coa plataforma de axentes conversacionais ElevenAgents. A integración entre o modelo de voz e a plataforma permite optimizar conxuntamente a expresividade e a velocidade de resposta, con aplicacións que van desde atención ao cliente ata asistentes para videoxogos.
As capacidades multilingües tamén reciben unha ampliación. Eleven v4 e Eleven v4 Turbo admiten máis de 90 idiomas e permiten empregar unha mesma voz en distintas linguas mantendo a identidade do falante. O sistema busca ademais adaptar o acento ao idioma de destino e conservar mellor esa característica durante toda a xeración. Esta función está especialmente orientada á dobraxe, localización e creación de contidos multilingües.
A clonación de voces mellora tanto en fidelidade como en consistencia. ElevenLabs afirma que os Instant Voice Clones poden capturar unha voz con só 10 segundos de audio e manter con maior precisión a identidade do falante en xeracións posteriores, diálogos, narracións e liñas rexeneradas. Eleven v4 incorpora tamén compatibilidade con Professional Voice Clones para proxectos nos que se require unha maior fidelidade.
As melloras esténdense ao traballo con contidos de longa duración mediante o encadeamento de xeracións, unha técnica utilizada para construír pezas máis extensas a partir de varias xeracións. Segundo ElevenLabs, o proceso é agora máis fiable, o que beneficia ferramentas como ElevenLabs Studio e ElevenLabs Reader.
Eleven v4 e Eleven v4 Turbo xa están dispoñibles en ElevenAgents, ElevenCreative e a través de ElevenAPI, con aplicacións que inclúen audiolibros, interpretación de personaxes, locucións, dobraxe, localización e axentes conversacionais.

