Amazon migliora la sintesi vocale con un nuovo modello text-to-speech

Amazon BASE TTS è stato addestrato con 100.000 ore di audio, conta 980 milioni di parametri e mostrerebbe "abilità emergenti".

2 min.

Amazon migliora la sintesi vocale con un nuovo modello text-to-speech

I ricercatori di Amazon hanno annunciato un nuovo modello di sintesi vocale, chiamato BASE TTS, che segna un enorme passo in avanti nel realismo e nella versatilità della voce sintetica.

Grazie alle sue dimensioni senza precedenti – 100.000 ore di registrazioni audio per addestrare la versione più grande da 980 milioni di parametri – il modello mostra quelle che vengono definite “abilità emergenti”: capacità che vanno al di là di ciò per cui è stato direttamente addestrato.

Il modello text-to-speech sviluppato dal colosso dell’e-commerce è inoltre disponibile in altre due dimensioni: 400 e 150 milioni, addestrate rispettivamente con 10.000 e 1.000 ore di contenuti audio.

Amazon migliora la sintesi vocale con un nuovo modello text-to-speech
Tabella comparativa tratta dal paper “BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data”

Le capacità del nuovo modello

Il modello BASE TTS sarebbe in grado di gestire testi linguisticamente complessi in modo sorprendentemente naturale. Riuscirebbe a pronunciare parole e frasi lunghe e complicate, applicare la giusta enfasi emotiva, gestire fenomeni come i sussurri e interpretare correttamente punteggiatura e simboli.

Oltre alla qualità e alla superiorità rispetto ai modelli precedenti, i ricercatori hanno progettato BASE TTS per essere “streamable”, ossia capace di generare l’audio in tempo reale a un bitrate contenuto. Questo lo rende adatto a un’ampia gamma di applicazioni in cui la voce sintetica deve essere realistica ed espressiva.


Articoli simili

Ultime news


I produttori cinesi di chip alzano i prezzi a causa della carenza globale di memoria ad alta larghezza di banda

Queste aziende, tra cui Huawei e Cambricon, stanno affrontando costi…

I produttori cinesi di chip alzano i prezzi a causa della carenza globale di memoria ad alta larghezza di banda
Amazon, accordo pluriennale con Qualcomm per lo sviluppo di chip AI personalizzati

L’accordo prevede lo sviluppo congiunto di chip per diverse generazioni…

Amazon, accordo pluriennale con Qualcomm per lo sviluppo di chip AI personalizzati
Un ricercatore lascia Anthropic: “Stiamo giocando con le nostre vite”

Jacob Coxon, ricercatore che ha lavorato sia in OpenAI che…

Un ricercatore lascia Anthropic: “Stiamo giocando con le nostre vite”
Nvidia acquisisce Hugging Face per 12,9 miliardi di dollari

Nvidia ha ufficialmente acquisito Hugging Face per 12,93 miliardi di…

Nvidia acquisisce Hugging Face per 12,9 miliardi di dollari
Tutte le volte che qualche voce autorevole dell’AI ha predetto la fine dell’umanità

Da Musk ad Altman ad Amodei: quasi tutti sono d'accordo…

Tutte le volte che qualche voce autorevole dell’AI ha predetto la fine dell’umanità

Privacy policy| Cookie policy| Cookie setting| © 2026