OpenAI compie un nuovo balzo in avanti nello sviluppo di intelligenza artificiale con il lancio di tre modelli audio che promettono di trasformare il modo in cui interagiamo con le macchine. L’azienda di San Francisco ha presentato GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper, tre strumenti progettati per rendere gli agenti vocali più naturali, reattivi e capaci di operare in tempo reale.
Questi modelli non si limitano a trascrivere o rispondere a domande, ma possono ascoltare, tradurre e agire durante conversazioni live, aprendo la strada a applicazioni come assistenti personali più intelligenti, traduttori istantanei e sistemi di customer service automatizzati. Secondo quanto riportato da Reuters e altre testate internazionali, i modelli sono già disponibili per i sviluppatori nella piattaforma di test di OpenAI, con costi che variano da 0,017 a 0,034 dollari al minuto a seconda delle funzionalità.
La vera novità risiede nella capacità di GPT-Realtime-Translate di gestire traduzioni in tempo reale tra 70 lingue di input e 13 di output, mantenendo il significato anche in contesti complessi, con accenti regionali o terminologie tecniche. Questo potrebbe rivoluzionare settori come il turismo, il commercio internazionale e la collaborazione globale, dove le barriere linguistiche rappresentano ancora un ostacolo. GPT-Realtime-2, invece, è ottimizzato per gestire richieste complesse e interruzioni, simulando una conversazione più umana, mentre GPT-Realtime-Whisper si concentra sul riconoscimento vocale avanzato, erede del popolare modello Whisper già utilizzato per la trascrizione automatica.
Gli esperti del settore hanno accolto con entusiasmo l’annuncio, sottolineando come questi strumenti possano accelerare l’adozione di agenti AI vocali in ambiti professionali e personali. “Questo è un passo significativo verso un’AI che non solo capisce, ma agisce in modo proattivo durante le interazioni umane”, ha commentato un analista di Neowin, evidenziando come OpenAI stia spingendo i confini oltre la semplice chat testuale. Tuttavia, restano aperte domande sulla privacy e sulla sicurezza dei dati vocali, temi che l’azienda dovrà affrontare man mano che questi modelli verranno integrati in applicazioni di uso quotidiano.

OpenAI accelera sull'hardware: lo smartphone con AI integrata arriverà nel 2027
Altman è pronto ad avviare la produzione di massa del…














