La voce che pensa: OpenAI apre il sipario su gpt-realtime | Chat GPT gratis italiano | ChatGPT immagini | ChatGPT login | Turtles AI

La voce che pensa: OpenAI apre il sipario su gpt-realtime
Un modello capace di parlare e ragionare nello stesso respiro, con voci più naturali, costi più leggeri e nuove funzioni che intrecciano audio, immagini e telefonia in un’unica esperienza senza interruzioni
Editorial Team29 agosto 2025

 


OpenAI ha ufficialmente reso disponibile l’API Realtime con il modello speech-to-speech gpt-realtime, migliorato nella qualità vocale, comprensione delle istruzioni e chiamata di funzioni, con supporto per immagini, SIP e server MCP remoti, a costi ridotti del 20 % rispetto alla preview.

Punti chiave:

  • API Realtime ora generalmente disponibile  non più in beta.
  • gpt-realtime, nuovo modello vocale, più naturale e preciso.
  • Funzionalità estese: input visivo, SIP, server MCP remoto.
  • Prezzo ridotto del 20 % su input/output audio token.

Nel cuore della novità annunciata il 28 agosto 2025, l’API Realtime è ora fuori dalla fase beta iniziata nell’ottobre precedente. Questo progresso rappresenta una pietra miliare per gli sviluppatori: finalmente un’interfaccia stabile e immediata per creare agenti vocali pronti per l’uso quotidiano.

La star dell’annuncio è il modello gpt-realtime, una soluzione speech-to-speech “all-in-one”: un singolo modello elabora l’audio in ingresso e restituisce audio in uscita, riducendo drasticamente la latenza rispetto alle pipeline tradizionali che combinano STT, LLM e TTS. Il risultato è conversazioni più snelle, naturali e senza interruzioni — quasi come dialogare con una persona.

Quanto alla resa vocale, gpt-realtime offre una voce più naturale, espressiva e capace di seguire comandi complessi  come leggere un disclaimer parola per parola, ripetere sequenze alfanumeriche o passare da una lingua all’altra senza soluzione di continuità. Le due nuove voci, Cedar e Marin, sono disponibili solo nell’API Realtime, mentre le otto voci esistenti ricevono aggiornamenti per beneficiarne.

Dal punto di vista tecnico, gpt-realtime mostra miglioramenti significativi su tre benchmark interni:

Big Bench Audio (ragionamento audio): 82,8 % vs 65,6 % del modello di dicembre 2024.

MultiChallenge Audio (seguire istruzioni): 30,5 % vs 20,6 %.

ComplexFuncBench (chiamata di funzioni): 66,5 % vs 49,7 %.
In più, è supportato il tool calling asincrono, che consente conversazioni fluide anche quando il modello attende risposte da funzioni esterne.

Sul fronte delle funzionalità dell’API, troviamo ora:

Supporto per server MCP remoti: basta indicare un URL e l’API gestisce automaticamente le chiamate agli strumenti, semplificando l’integrazione.

Input visivo: si possono inviare immagini, foto o screenshot insieme all’audio o al testo, consentendo al modello di “vedere” e rispondere a ciò che l’utente mostra.

Supporto SIP: l’API può collegarsi direttamente alla rete telefonica, ai sistemi PBX e agli endpoint SIP.

Prompt riutilizzabili, analoghi a quelli della Responses API, che permettono di salvare configurazioni di prompt da riutilizzare nelle sessioni.

La sicurezza non è trascurata: l’API integra classificatori attivi per rilevare contenuti problematici, supporto per la residenza dati in UE, policy anti-impersonificazione e standard trasparenti per segnalare l’uso di AI.

Infine, i prezzi: scontati del 20 % rispetto alla preview gpt-4o-realtime. Costi attuali: 32 $ per milione di token di input audio (0,40 $ per token in cache) e 64 $ per milione di token di output audio.

Il tutto è risuonato nei commenti su Reddit, dove si osserva:

“Realtime API is now GA with gpt-realtime (their best speech-to-speech yet): lower latency … more natural voices … better at instructions + function calls … support for images, SIP … pricing dropped ~20 % too.”

 OpenAI ha messo a disposizione uno strumento maturato e accessibile, pronto per usi reali nel customer support, nell’assistenza vocale e nell’educazione, abbattendo costi e barriere tecniche.