Google lancia Gemini 3.5 Transcribe: addio a “ehm” e pause

Google ha presentato Gemini 3.5 Transcribe, il suo nuovo modello dedicato alla trascrizione audio che elimina automaticamente parole riempitive e esitazioni, producendo testo pulito in oltre 85 lingue. Rispetto al predecessore Chirp 3, il tempo di trascrizione migliora del 70%.

Innovazione - Ricerca 28 ago 2026

2 min.

Google lancia Gemini 3.5 Transcribe: addio a “ehm” e pause

Google ha lanciato Gemini 3.5 Transcribe, un modello speech-to-text costruito direttamente sull’architettura Gemini. Non è un aggiornamento di Chirp 3, il motore di trascrizione precedente: è un prodotto nuovo, con un’identità diversa e obiettivi più ampi. La caratteristica più visibile è la modalità Smart Transcription, che elimina automaticamente parole riempitive, ripetizioni e autocorrezioni, restituendo testo formattato e leggibile al posto di una trascrizione verbatim.

Il modello rileva e gestisce oltre 85 lingue, riconosce fino a tre parlanti distinti con timestamp associati, e produce timestamp a livello di singola parola. Supporta anche un vocabolario personalizzato fino a mille termini, utile per settori tecnici o medici dove il gergo specialistico fa spesso inciampare i sistemi di riconoscimento vocale generici. La latenza in streaming scende a livelli sub-secondo grazie al modello gemini-3.5-transcribe-live, accessibile tramite WebSocket attraverso la Gemini Live API. Rispetto a Chirp 3, il tempo totale di trascrizione migliora del 70%, secondo i dati pubblicati da Artificial Analysis.

Sul benchmark FLEURS, che misura le prestazioni multilingue, il modello registra un Word Error Rate del 5,50% in modalità streaming e del 5,04% in modalità non-streaming. Numeri che posizionano Google in modo più competitivo rispetto al passato, anche se non bastano per la vetta assoluta: ElevenLabs Scribe v2 e Microsoft MAI-Transcribe-1.5 mantengono tassi di errore inferiori sulle metriche di accuratezza grezza. Il punto di forza di Gemini 3.5 Transcribe sta altrove — nell’integrazione nativa con il resto della famiglia Gemini e nella capacità di delegare compiti complessi, come la generazione di immagini o l’analisi di file, ad altri modelli tramite function calling.

Google ha pensato a due tipi di utilizzo distinti. Il modello gemini-3.5-transcribe gestisce file audio pre-registrati — riunioni, trascrizioni di call center, podcast — attraverso la Interactions API. Il secondo, gemini-3.5-transcribe-live, è pensato per flussi in tempo reale: sottotitoli live, agenti vocali, interfacce di dettatura. Entrambi sono già disponibili per gli sviluppatori su Google AI Studio e sulla piattaforma Gemini Enterprise. L’applicazione Rambler su Android e il client macOS di Gemini utilizzano già il modello in produzione, con gli utenti consumer che ne beneficiano senza configurazioni aggiuntive.

Il contesto competitivo è cambiato in fretta. OpenAI ha pubblicato il proprio modello GPT-Transcribe circa un mese prima, e il confronto diretto tra i due prodotti è già in corso nelle community di sviluppatori. A un costo di circa 0,009 dollari al minuto per la versione live, Gemini 3.5 Transcribe costa circa la metà del modello realtime di OpenAI — un argomento concreto per chi costruisce pipeline di trascrizione su larga scala. La vera sfida, però, è convincere i team che già usano soluzioni specializzate a migrare verso un modello che punta su integrazione e pulizia del testo, non solo su accuratezza bruta. Se la funzione di Smart Transcription diventa uno standard atteso dagli utenti, il modello potrebbe ridefinire cosa si intende per “buona trascrizione” — non più una copia fedele del parlato, ma testo già pronto per essere letto.


Articoli simili

Ultime news


Amazon, accordo pluriennale con Qualcomm per lo sviluppo di chip AI personalizzati

L’accordo prevede lo sviluppo congiunto di chip per diverse generazioni…

Amazon, accordo pluriennale con Qualcomm per lo sviluppo di chip AI personalizzati
Un ricercatore lascia Anthropic: “Stiamo giocando con le nostre vite”

Jacob Coxon, ricercatore che ha lavorato sia in OpenAI che…

Un ricercatore lascia Anthropic: “Stiamo giocando con le nostre vite”
Nvidia acquisisce Hugging Face per 12,9 miliardi di dollari

Nvidia ha ufficialmente acquisito Hugging Face per 12,93 miliardi di…

Nvidia acquisisce Hugging Face per 12,9 miliardi di dollari
Tutte le volte che qualche voce autorevole dell’AI ha predetto la fine dell’umanità

Da Musk ad Altman ad Amodei: quasi tutti sono d'accordo…

Tutte le volte che qualche voce autorevole dell’AI ha predetto la fine dell’umanità
Anthropic rinuncia all’acquisizione di Decart: salta l’accordo da 6 miliardi di dollari

La decisione è arrivata dopo la fase di analisi finanziaria…

Anthropic rinuncia all’acquisizione di Decart: salta l’accordo da 6 miliardi di dollari

Privacy policy| Cookie policy| Cookie setting| © 2026