Sora di OpenAI supera 1 milione di download e diventa l’app AI più popolare del momento
OpenAI lancia nuove API vocali con traduzione e trascrizione in tempo reale
11 Maggio 2026
OpenAI accelera sul fronte delle interfacce vocali e introduce una nuova generazione di strumenti pensati per rendere le conversazioni tra utenti e applicazioni molto più naturali, continue e operative.
La società ha annunciato una serie di nuove funzionalità all’interno della propria Realtime API, con l’obiettivo di permettere agli sviluppatori di creare applicazioni capaci di parlare, comprendere, tradurre e trascrivere le conversazioni in tempo reale.
Al centro del lancio ci sono tre novità: GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper.
GPT-Realtime-2 porta il reasoning nelle conversazioni vocali
Il nuovo GPT-Realtime-2 rappresenta l’evoluzione del precedente modello vocale GPT-Realtime-1.5, ma introduce una differenza sostanziale: l’integrazione di capacità di ragionamento basate su modelli di classe GPT-5.
Secondo OpenAI, il sistema è stato progettato per gestire richieste più complesse e mantenere conversazioni articolate in modo più coerente rispetto alla generazione precedente.
L’obiettivo non è soltanto simulare una voce realistica. Il modello punta a trasformare l’interazione vocale in un’interfaccia capace di comprendere contesto, prendere decisioni e accompagnare l’utente durante task articolati.
Dalle risposte vocali agli assistenti che “agiscono”
Nel presentare il lancio, OpenAI ha spiegato che le nuove funzionalità vogliono superare il tradizionale schema “domanda-risposta” tipico degli assistenti vocali.
L’idea è costruire sistemi che possano ascoltare, ragionare, tradurre, trascrivere e persino eseguire azioni mentre la conversazione è ancora in corso.

Un passaggio che potrebbe avere conseguenze importanti soprattutto nel customer care, nella produttività aziendale e nelle piattaforme dedicate alla formazione o ai creator.
LEGGI ANCHE: OpenAI lancia GPT-5.5 e introduce agenti AI autonomi
Traduzioni simultanee in oltre 70 lingue
Tra le novità più rilevanti c’è anche GPT-Realtime-Translate, il nuovo sistema di traduzione simultanea progettato per lavorare direttamente durante una conversazione.
La funzione supporta oltre 70 lingue in input e 13 lingue in output, permettendo agli utenti di parlare nella propria lingua e ricevere traduzioni vocali quasi in tempo reale.
Secondo l’azienda, il sistema è stato sviluppato per mantenere il ritmo della conversazione senza interrompere il flusso naturale del dialogo.
Un possibile impatto su eventi, media e supporto clienti
Le applicazioni pratiche potrebbero essere numerose. OpenAI cita esplicitamente customer service, education, media, eventi e creator economy tra i settori che potrebbero beneficiare maggiormente delle nuove API vocali.
In prospettiva, strumenti di questo tipo potrebbero ridurre drasticamente le barriere linguistiche durante call internazionali, live streaming, webinar o assistenza clienti globale.
LEGGI ANCHE: AI Act e Formazione Obbligatoria: perché la tua azienda deve adeguarsi (e come farlo subito)
Arriva anche la trascrizione live con GPT-Realtime-Whisper
La terza novità annunciata è GPT-Realtime-Whisper, un sistema di speech-to-text pensato per trascrivere conversazioni vocali mentre avvengono.
A differenza dei tradizionali sistemi di trascrizione post-produzione, il nuovo modello lavora in diretta, catturando le parole durante l’interazione.
Una tecnologia che potrebbe trovare spazio in meeting aziendali, piattaforme collaborative, strumenti di accessibilità e software dedicati alla documentazione automatica delle conversazioni.

OpenAI prova ad anticipare gli abusi
L’espansione delle capacità vocali dell’intelligenza artificiale continua però ad alimentare interrogativi legati a spam, truffe online e impersonificazione vocale.
OpenAI sostiene di aver introdotto diversi sistemi di protezione per limitare possibili utilizzi impropri delle nuove funzionalità.
Secondo l’azienda, alcuni trigger interni permettono di interrompere automaticamente conversazioni che violano le policy sui contenuti dannosi o che mostrano comportamenti riconducibili a frodi e abusi digitali.
Quanto costano le nuove funzionalità vocali
Tutti i nuovi modelli sono già inclusi nella Realtime API di OpenAI.
Le funzionalità Translate e Whisper vengono tariffate al minuto, mentre GPT-Realtime-2 utilizza un modello basato sul consumo di token, seguendo la struttura già adottata per altri sistemi della piattaforma.
Il lancio conferma la strategia di OpenAI di spingere sempre di più verso interfacce AI multimodali e conversazionali, in una fase in cui la competizione nel settore degli assistenti vocali avanzati si sta intensificando rapidamente.
Potrebbe interessarti anche
Corsi, articoli, eventi: il mondo Ninja è ricco di risorse e di appuntamenti da non perdere.








