OpenAI svela le peculiarità di GPT-4o: voci imitate e suoni inquietanti | Ia medicina patologia | Chatgpt gratis | Intelligenza artificiale e medicina digitale | Turtles AI
Punti chiave
- GPT-4o, il nuovo modello AI di OpenAI, è addestrato su dati vocali oltre che su testo e immagini.
- Il modello può imitare voci umane e generare suoni disturbanti, ma sono stati implementati filtri per mitigare questi comportamenti.
- OpenAI ha limitato la capacità del modello di generare contenuti musicali per evitare violazioni del copyright.
- Le misure di sicurezza includono il rifiuto di richieste inadeguate e l’inibizione di contenuti legati a violenza, sessualità ed estremismo.
OpenAI svela le peculiarità di GPT-4o: il modello AI che può imitare voci umane e generare suoni disturbanti. Scopri come il nuovo aggiornamento vocale di ChatGPT potrebbe comportarsi in modi inaspettati.
OpenAI ha recentemente pubblicato un report dettagliato sul "red teaming" del suo modello GPT-4o, un sistema generativo che alimenta la nuova modalità vocale avanzata di ChatGPT. Il GPT-4o è il primo modello dell’azienda addestrato non solo su dati testuali e visivi, ma anche su dati vocali, e questa caratteristica ha portato a comportamenti singolari. In casi particolari, soprattutto in ambienti con rumore di fondo elevato, come all’interno di un’auto, il modello può imitare la voce dell’interlocutore, un fenomeno che OpenAI attribuisce alla difficoltà del sistema di comprendere discorsi distorti.
Il report descrive anche altre anomalie riscontrate durante i test. GPT-4o, in alcune circostanze, potrebbe generare vocalizzazioni non verbali inquietanti o inopportune, come gemiti, urla violente o suoni di spari, in risposta a determinate richieste. Sebbene OpenAI sostenga che il modello generalmente rifiuta di generare effetti sonori quando richiesto, ammette che alcune richieste riescono comunque a passare attraverso i filtri implementati.
Un altro aspetto interessante riguarda la potenziale violazione del copyright musicale da parte di GPT-4o. Il modello potrebbe riprodurre brani o cantare canzoni in modo tale da infrangere i diritti d’autore. Tuttavia, OpenAI ha sviluppato filtri specifici per prevenire questo comportamento, inibendo la capacità del modello di cantare o generare contenuti musicali nella versione alpha della modalità vocale avanzata, rilasciata in anteprima per un numero limitato di utenti.
Nel documento, OpenAI conferma che per garantire la sicurezza del modello sono state apportate modifiche significative. GPT-4o rifiuta di identificare le persone in base al loro modo di parlare, declina domande cariche come "quanto è intelligente questo interlocutore?" e blocca richieste relative a contenuti violenti, sessualmente espliciti o associati a estremismi e autolesionismo. La società sottolinea che l’addestramento su materiale protetto da copyright è praticamente inevitabile per sviluppare modelli AI avanzati come GPT-4o. Nonostante questo, OpenAI afferma di seguire pratiche rigorose per evitare l’uso improprio di dati protetti, sostenendo che il fair use può rappresentare una difesa legale contro accuse di utilizzo non autorizzato di contenuti protetti.
Questi aspetti sollevano questioni interessanti riguardo al futuro dell’AI e alla necessità di bilanciare innovazione e sicurezza. La capacità di un modello di generare contenuti vocali, sebbene intrigante, porta con sé sfide tecniche e legali che richiedono un’attenzione continua. OpenAI ha adottato misure preventive, ma il potenziale di un modello così avanzato comporta inevitabilmente rischi e incertezze che dovranno essere monitorati attentamente man mano che la tecnologia si evolve.
