Gemini 3.5 Transcribe è il nuovo modello di Google dedicato alla conversione della voce in testo. Il sistema punta a offrire una trascrizione più precisa, naturale e ordinata, anche in presenza di rumori, termini tecnici, accenti regionali e correzioni durante il parlato. La tecnologia è già integrata in alcuni prodotti Google e si prepara ad arrivare anche nel browser Chrome.
gemini 3.5 transcribe migliora la trascrizione vocale
Rispetto ai tradizionali modelli di riconoscimento vocale, Gemini 3.5 Transcribe elabora l’audio grezzo trasformandolo direttamente in un testo accurato, ripulito e formattato. Il modello è progettato per comprendere meglio il modo naturale di parlare, interpretare l’intento e riconoscere anche un vocabolario personalizzato.
Il sistema è in grado di gestire le autocorrezioni, come nel caso di un appuntamento inizialmente indicato per un giorno e poi modificato durante la frase. Inoltre, elimina intercalari come “ehm” e “ah”, organizza automaticamente il testo e consente di apportare modifiche attraverso comandi vocali naturali.
precisione, lingue e riconoscimento degli interlocutori
- Trascrizioni più precise: il tasso medio di errore sulle parole è del 4,0% nello streaming e del 2,6% nei casi non in streaming, secondo le misurazioni di Artificial Analysis.
- Riconoscimento del vocabolario personalizzato: il modello identifica termini specialistici, espressioni tecniche e grafie particolari inserite nel vocabolario fornito.
- Supporto linguistico globale: Gemini 3.5 Transcribe rileva e trascrive automaticamente più di 85 lingue, gestendo accenti regionali e dialetti differenti.
- Identificazione degli interlocutori: nell’audio preregistrato attribuisce le frasi a un massimo di tre persone, includendo i relativi timestamp. Il supporto per più di tre interlocutori è ancora sperimentale.
gemini 3.5 transcribe supera il modello chirp 3
Google descrive il nuovo sistema come un progresso significativo rispetto al modello di trascrizione Chirp 3, lanciato nel 2025. Oltre alla riduzione degli errori, Gemini 3.5 Transcribe offre una latenza più contenuta e una maggiore efficacia negli ambienti reali, compresi quelli caratterizzati da rumori di fondo.
Il tempo necessario per ottenere la trascrizione finale è migliorato del 70%. Nei test FLEURS, condotti su diverse lingue e aree geografiche, il modello ha raggiunto un tasso di errore del 5,50% nella modalità streaming e del 5,04% nella modalità non streaming.
gemini 3.5 transcribe abilita le azioni tramite la voce
Un altro obiettivo del modello consiste nel permettere l’esecuzione di attività attraverso comandi vocali. La funzione di chiamata degli strumenti consente a Gemini 3.5 Transcribe di delegare operazioni complesse, come la generazione di immagini o l’analisi di file, ad altri modelli Gemini.
Questa possibilità è già utilizzata nella funzione Speak to Window dell’app Gemini per macOS. Il modello è inoltre presente nell’app Gemini per macOS, in Gboard Rambler su Android e nel microfono della casella dei prompt di Google Antigravity.
disponibilità di gemini 3.5 transcribe
Su Google Antigravity, la tecnologia può combinare, con il consenso dell’utente, il contesto visualizzato sullo schermo e la cronologia della conversazione. In questo modo migliora la precisione nella trascrizione di nomi di file, documenti attivi e pensieri dell’agente.
Il modello arriverà prossimamente anche su Chrome, dove sarà possibile dettare contenuti in qualsiasi campo del web, comprese risposte, post e richieste rivolte a Gemini.
accesso per sviluppatori e aziende
- Sviluppatori: Gemini 3.5 Transcribe è disponibile in anteprima pubblica tramite Gemini API in Google AI Studio e Google Antigravity.
- Aziende: il modello è disponibile in anteprima pubblica attraverso Gemini Enterprise Agent Platform e arriverà prossimamente in Gemini Enterprise for Customer Experience.








Lascia un commento