Google amplia le capacità vocali dell’intelligenza artificiale con il rilascio di Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. I nuovi modelli di sintesi vocale puntano su un audio più naturale e permettono di gestire con maggiore precisione accento, ritmo, emozioni, pause e dialoghi.
gemini 3.8 flash tts: voci artificiali più espressive
Le nuove soluzioni superano il semplice meccanismo basato sull’inserimento di un testo e sulla successiva generazione dell’audio. Gemini 3.8 Flash TTS può creare una voce originale a partire da una descrizione formulata in linguaggio naturale, con il supporto di oltre 100 lingue e dialetti.
Google mette inoltre a disposizione più di 2.000 voci pronte per la produzione. Il sistema consente anche di replicare una voce autorizzata utilizzando un campione della durata di 30 secondi, così da mantenere una resa coerente durante la generazione dell’audio.
controllo di accento, emozioni e dialoghi
Entrambi i modelli sono in grado di seguire istruzioni dettagliate riga per riga. È possibile indicare tono, velocità, variazioni del dialetto, sussurri, risate, sospiri e altri segnali tipici della conversazione.
Un singolo copione può essere trasformato in un dialogo tra due interlocutori, mantenendo le rispettive voci costanti anche nella produzione di contenuti audio molto lunghi. Le applicazioni comprendono podcast, audiolibri, doppiaggio, agenti vocali e video narrati.
- Podcast
- Audiolibri
- Doppiaggio
- Agenti vocali
- Video narrati
gemini 3.8 flash tts e flash-lite tts: risultati nei test
Nei test comparativi, Gemini 3.8 Flash TTS ha raggiunto il primo posto complessivo nel Voice Design Benchmark di Hume AI, ottenendo un punteggio di 60,8 nella valutazione degli accenti. I modelli Flash e Flash-Lite hanno inoltre conquistato le prime due posizioni nell’indice generale della qualità di Hume.
Le prove di Voice Arena li hanno collocati ai vertici o nelle posizioni immediatamente successive in diverse lingue. Nelle categorie dedicate alla qualità della singola voce e alla variazione simile a quella umana, ElevenLabs ha invece ottenuto risultati superiori.
disponibilità di gemini 3.8 tts per utenti e sviluppatori
Flash TTS è in distribuzione all’interno di Gemini Notebook, mentre Flash-Lite TTS arriva in Google Vids. Entrambi i modelli sono disponibili anche per gli sviluppatori attraverso Gemini API e Google AI Studio.
replica vocale e sistemi di sicurezza
Google ha previsto specifiche misure di tutela per la replica delle voci. Il sistema richiede la verifica del consenso, integra il watermarking SynthID e utilizza credenziali C2PA. La funzione di replica vocale in AI Studio è bloccata in alcune aree, tra cui Regno Unito, Spazio economico europeo, India, Texas e Illinois.













Lascia un commento