VALL-E 2 : La Tecnologia di Clonazione Vocale di Microsoft | Large Language Models Paper | Large Language Models Cosa Sono | Chatgpt app | Turtles AI

VALL-E 2 : La Tecnologia di Clonazione Vocale di Microsoft
Editorial Team9 luglio 2024

 

 

MICROSOFT RIVOLUZIONA LA SINTESI VOCALE CON VALL-E 2 : VOCE UMANA DA POCHI SECONDI DI AUDIO

 

Microsoft ha presentato VALL-E 2, un sistema avanzato di clonazione vocale che promette prestazioni vocali di livello umano partendo da pochi secondi di audio. Questa innovazione rappresenta un notevole passo avanti nella sintesi vocale, raggiungendo per la prima volta la parità con la voce umana.

Un Nuovo Traguardo nella Sintesi Vocale

VALL-E 2, evoluzione del precedente VALL-E lanciato all’inizio del 2023, utilizza modelli linguistici basati su codec neurali per rappresentare il parlato come sequenze di codici. La caratteristica distintiva di VALL-E 2 è il metodo "Repetition Aware Sampling", che insieme ad altre tecniche di campionamento adattivo, migliora la coerenza e risolve problemi comuni nelle tecniche generative vocali tradizionali.

"VALL-E 2 sintetizza costantemente discorsi di alta qualità, anche per frasi complesse o ripetitive", hanno scritto i ricercatori. Questa potrebbe essere fondamentale per generare la  voce per persone che hanno perso la capacità di parlare.

Limitazioni e Preoccupazioni Etiche

Nonostante le potenzialità, Microsoft non intende rendere VALL-E 2 disponibile al pubblico. La dichiarazione etica dell’azienda sottolinea i rischi legati all’imitazione vocale senza consenso e all’uso di voci AI in truffe o attività criminali. I ricercatori hanno evidenziato la necessità di un metodo standard per marcare digitalmente i contenuti generati da AI, poichè rilevare tali contenuti con alta precisione rimane una sfida.

" Se il modello verrà generalizzato a speaker non visti nel mondo reale, dovrebbe includere un protocollo per garantire l’approvazione dell’uso della loro voce ed un modello di rilevamento del discorso sintetizzato", hanno scritto.

Risultati Eccezionali nei Test

In una serie di test, VALL-E 2 ha superato i benchmark umani in termini di robustezza, naturalezza e somiglianza del discorso generato, riuscendo ad ottenere questi risultati con solo 3 secondi di audio. Campioni di 10 secondi hanno prodotto una qualità ancora migliore. 

Microsoft non è l’unica azienda a sviluppare modelli AI avanzati senza renderli pubblici. Anche Meta e OpenAI seguono una linea simile con i loro sistemi Voicebox e Voice Engine, rispettivamente, citando preoccupazioni per la sicurezza.

" Ci sono molti casi d’uso entusiasmanti per i modelli di discorso generativo, ma a causa dei potenziali rischi di abuso, non rendiamo disponibile al pubblico il modello o il codice di Voicebox" ha dichiarato un portavoce di Meta AI a Decrypt lo scorso anno. OpenAI ha aggiunto che sta affrontando  le questioni di sicurezza prima di lanciare il suo modello di voci sintetiche.

Verso un Futuro Etico per l’AI Generativa

La richiesta di linee guida etiche si sta diffondendo in tutta la comunità AI, soprattutto mentre i regolatori iniziano a sollevare preoccupazioni sull’impatto dell’AI generativa nelle nostre vite quotidiane. La sfida consiste nel bilanciare l’innovazione tecnologica con la necessità di proteggere il pubblico dai potenziali abusi di queste potenti tecnologie.