Sesame AI Labs ha rilasciato il suo CSM 1B (Conversational Speech Model) | ChatGPT | Chat gpt traduzione | Chat gpt gratis italiano | Turtles AI
Il Conversational Speech Model (CSM) di Sesame rappresenta un significativo passo avanti nella generazione vocale, combinando input testuali e audio per produrre codici audio RVQ attraverso un’architettura avanzata. Questo modello sfrutta un backbone basato su Llama e un decoder audio compatto, generando codici audio Mimi.
Punti chiave:
- Architettura multimodale che integra testo e audio.
- Utilizzo di codici audio Mimi per una compressione efficiente.
- Capacità di produrre voci naturali e coinvolgenti.
- Disponibilità di una demo interattiva per testare le funzionalità.
Il CSM di Sesame è progettato per migliorare l’interazione uomo-macchina, offrendo risposte vocali più naturali e coinvolgenti. A differenza dei tradizionali modelli di sintesi vocale, che separano la generazione semantica dai dettagli acustici, il CSM adotta un’architettura multimodale basata su trasformatori, elaborando simultaneamente testo e audio. Questa integrazione consente al modello di adattare il tono e l’espressività in base al contesto della conversazione, rendendo l’interazione più fluida e realistica.
Un elemento fondamentale del CSM è l’utilizzo dei codici audio Mimi. Mimi è un codec audio neurale all’avanguardia sviluppato da Kyutai, che combina informazioni semantiche e acustiche in token audio a 12Hz con un bitrate di 1,1kbps. Questa tecnologia permette una compressione efficiente mantenendo alta fedeltà audio, rendendola particolarmente adatta per l’addestramento di modelli di linguaggio vocale e sistemi di sintesi vocale.
Per gli sviluppatori e i ricercatori interessati, Sesame ha reso disponibile una demo vocale interattiva basata su una variante ottimizzata del CSM. Questa demo offre l’opportunità di sperimentare direttamente le capacità del modello, evidenziando la naturalezza e la fluidità delle risposte generate. Inoltre, è disponibile uno spazio ospitato su Hugging Face per testare la generazione audio, facilitando l’accesso e la sperimentazione con il modello.
Per l’esecuzione del CSM, è necessaria una GPU compatibile con CUDA. Il codice è stato testato su CUDA 12.4 e 12.6, ma potrebbe funzionare anche su altre versioni. Si consiglia l’uso di Python 3.10, sebbene anche versioni più recenti possano essere compatibili. È importante notare che il modello open source disponibile è una versione base di generazione vocale, capace di produrre una varietà di voci senza essere specificamente ottimizzato per una voce particolare.
Sebbene il CSM sia stato addestrato principalmente per la generazione audio, non è progettato come un modello di linguaggio multimodale di uso generale e non può generare testo autonomamente. Per la generazione di testo, si consiglia l’utilizzo di un modello di linguaggio separato. Inoltre, pur avendo una certa capacità di supportare lingue diverse dall’inglese, a causa della contaminazione nei dati di addestramento, le prestazioni in altre lingue potrebbero non essere ottimali.
Sesame sottolinea l’importanza di un uso responsabile ed etico del CSM. È espressamente vietato utilizzare il modello per impersonare individui reali senza il loro consenso, diffondere disinformazione o contenuti ingannevoli, o per attività illegali o dannose. Gli utenti sono tenuti a rispettare tutte le leggi e le linee guida etiche applicabili, e l’azienda declina ogni responsabilità per eventuali usi impropri, condannando fermamente le applicazioni non etiche di questa tecnologia.
Il Conversational Speech Model di Sesame, integrando l’innovativo codec Mimi, rappresenta un significativo avanzamento nella generazione vocale, offrendo interazioni più naturali e coinvolgenti, pur richiedendo un utilizzo etico e responsabile.
