ElevenLabs ha lanciato il 28 settembre due nuovi modelli di sintesi vocale, Eleven v4 e la variante a bassa latenza Eleven v4 Turbo. Puntano su un controllo più fine di tono ed emozioni, sulla clonazione di una voce a partire da soli 10 secondi di audio e sul supporto a oltre 90 lingue. Come riporta TechCrunch, la generazione precedente, la v3, arrivata nel 2025, parlava 70 lingue.
Cosa sono Eleven v4 e v4 Turbo
Secondo il post sul blog di ElevenLabs, Eleven v4 è costruito su un’architettura completamente nuova ed è il modello text-to-speech più emotivo dell’azienda. Deve interpretare tono, ritmo, emozione, carattere del testo e contesto, restituendo un parlato che può risultare drammatico, tenero, urgente, comico o colloquiale senza perdere l’identità del parlante.
Eleven v4 Turbo porta la stessa tecnologia sui casi d’uso in cui conta la velocità, come gli agenti vocali. Entrambi i modelli, dice l’azienda, offrono una fedeltà audio più alta rispetto al passato.
I risultati di qualità citati sono dichiarazioni di ElevenLabs: il modello sarebbe primo nella classifica di Artificial Analysis e preferito da circa il 75% degli ascoltatori nei test alla cieca contro modelli concorrenti.
Tag, istruzioni in linguaggio naturale e dialoghi tra più voci
Chi usa il modello può descrivere in linguaggio naturale come va detta una battuta. Può anche inserire tag inline per indicare emozioni, modi di pronuncia ed effetti sonori. L’azienda porta come esempi [laughs], [said angrily in French accent], [light rain] e [phone buzzing].
- I tag inline erano stati introdotti con la v3; TechCrunch spiega che nella v4 vengono ampliati e si possono impilare, con il modello che segue la sequenza indicata.
- Secondo ElevenLabs, la v4 rispetta tag e indicazioni con più precisione dei modelli precedenti.
- Il supporto ai fonemi dell’alfabeto fonetico internazionale (IPA) è stato migliorato, così le pronunce personalizzate sono più affidabili.
- La sintassi completa dei tag e l’uso via API sono nella documentazione per sviluppatori.
Cambia anche la resa dei dialoghi. Un nuovo metodo per catturare l’identità dei parlanti mantiene le caratteristiche di ogni voce in conversazioni tra agenti, audiolibri e spot. Poiché il modello legge l’intera scena, i personaggi rispondono a quanto appena detto invece di sembrare battute isolate messe in fila.
Eleven v4 Turbo e ElevenAgents
ElevenLabs sostiene che finora chi costruiva agenti vocali doveva scegliere tra velocità ed espressività, e che molti hanno ripiegato su voci competenti ma monotone. Turbo dovrebbe superare il compromesso: il blog indica una latenza mediana di inferenza di circa 100 ms e un tempo mediano al primo parlato di circa 150 ms.
Il modello è pensato per ElevenAgents, la piattaforma di agenti conversazionali dell’azienda. Secondo ElevenLabs, i suoi team hanno ottimizzato modello e piattaforma come un unico sistema, mentre altri costruttori di agenti assemblano componenti di fornitori diversi.
TechCrunch aggiunge che la v4 può iniziare a generare audio non appena il modello linguistico a monte comincia a produrre la risposta. Secondo la testata, il modello gestisce inoltre in modo diverso contestazioni, escalation e attese, per risolvere meglio i problemi dei clienti.
| Aspetto | Eleven v4 | Eleven v4 Turbo |
|---|---|---|
| Obiettivo | Sintesi vocale più emotiva | Stessa tecnologia per casi a bassa latenza, come gli agenti |
| Latenza (dati ElevenLabs) | Non indicata nelle fonti | Circa 100 ms di inferenza mediana; circa 150 ms al primo parlato |
| Lingue | Oltre 90 | Oltre 90 |
| Piattaforma dedicata | Non indicata nelle fonti | ElevenAgents |
Oltre 90 lingue e voce che mantiene l’identità
Il salto da 70 a oltre 90 lingue, riferisce TechCrunch, ha portato i miglioramenti di qualità più marcati in giapponese, portoghese brasiliano, mandarino e cantonese. Il blog dell’azienda precisa che una voce registrata in una lingua può parlarne qualsiasi altra adottando l’accento di un madrelingua e conservando l’identità originale. L’aderenza all’accento è più stabile e la voce non torna verso l’accento di partenza durante la generazione.
Per doppiaggio e localizzazione, dice ElevenLabs, la voce scelta da un marchio, che sia quella di un attore noto o un tono in linea con lo stile aziendale, resta riconoscibile in ogni lingua supportata. Le fonti non riportano l’elenco completo delle lingue.
Clonazione vocale da 10 secondi di audio
La clonazione risulta più fedele alla voce di partenza. Le Instant Voice Clone possono ora catturare una voce con alta fedeltà da appena 10 secondi di audio. TechCrunch collega questa novità alla nuova architettura, che secondo l’azienda consente anche una clonazione più rapida e una migliore tenuta dell’identità vocale su testi lunghi.
Il contesto: mercato affollato e crescita dell’azienda
Secondo TechCrunch, ElevenLabs aveva anticipato il modello a un evento a Varsavia all’inizio del 2026. La testata ricorda che la concorrenza nei modelli vocali si è intensificata: Cartesia, Deepgram, Fish Audio, Boson e WellSaid Labs hanno sviluppato modelli espressivi, mentre Google e OpenAI hanno migliorato i propri.
Sempre secondo TechCrunch, l’attività enterprise di ElevenLabs è cresciuta rapidamente nell’ultimo anno e oltre il 55% del business arriva da grandi aziende. L’azienda ha raccolto 500 milioni di dollari da Sequoia all’inizio del 2026, con una valutazione di 11 miliardi. Il fatturato annualizzato è passato da circa 330 milioni di dollari a inizio 2026 a oltre 600 milioni, e i dipendenti sono più di 800.
Le fonti non riportano prezzi, né in dollari né in euro, né dettagli sulla disponibilità in Italia.