NVIDIA dà voce ai volti digitali: Audio2Face open source trasforma il suono in espressione | | | | Turtles AI

NVIDIA dà voce ai volti digitali: Audio2Face open source trasforma il suono in espressione
NVIDIA apre le porte della sua tecnologia di animazione facciale basata sull’audio, offrendo modelli e strumenti open source che trasformano suoni ed emozioni in espressioni 3D, dalla scena videoludica agli avatar interattivi
Editorial Team26 settembre 2025

 


NVIDIA ha reso open source Audio2Face, un sistema di animazione facciale generativa che, partendo da input audio, produce sincronizzazione labiale ed espressioni emotive su avatar 3D. Vengono distribuiti modelli, SDK, plugin e framework di training per uso e personalizzazione.

Punti chiave:

  • GPU-accelerato sistema che trasforma fonemi, intonazione ed emozioni in dati di animazione facciale 
  • Versioni open source includono modelli (regression v2.2, diffusion v3.0), SDK, plugin per Maya e Unreal, e framework di training
  • Repository con servizio micro-service che converte audio in blendshape ARKit animabili da un motore 3D
  • Modello “Audio2Face-3D v3.0” è disponibile su Hugging Face sotto licenza NVIDIA Open Model License 

Con la recente apertura del suo sistema Audio2Face, NVIDIA punta a democratizzare la generazione automatica di animazioni facciali realistiche per personaggi digitali, offrendo a sviluppatori, ricercatori e creatori l’accesso diretto a tecnologie che fino a poco tempo fa erano protette. Il cuore del sistema è un modello generativo che analizza l’audio  cogliendo fonemi, intonazione e segnali emotivi  e genera una sequenza animata per labbra, viso, mascella, occhi e lingua: tali dati vengono poi mappati su un volto tridimensionale, permettendo sia animazioni pre-registrate sia streaming in tempo reale per personaggi controllati da AI.

Il rilascio open source comprende vari componenti: il SDK Audio2Face per authoring e runtime, plugin per Autodesk Maya (v2.0) e Unreal Engine 5 (v2.5), il framework di training (v1.0) con dati di esempio, i modelli di animazione (regression v2.2 e diffusion v3.0) e modelli Audio2Emotion per estrarre il tono emotivo dall’audio.

Un elemento chiave del rilascio è il repository Audio2Face-3D Samples, che offre un microservizio in grado di trasformare audio in blendshape (forme di deformazione del volto) compatibili con ARKit, includendo la gestione delle emozioni e un’interfaccia pronta all’uso da integrare in motori grafici 3D. I modelli, come Audio2Face-3D v3.0, sono resi disponibili su piattaforme come Hugging Face e supportano l’accelerazione GPU tramite TensorRT su GPU NVIDIA moderne (Ampere, Hopper, Lovelace, ecc.).

Il rilascio open source apre la porta a personalizzazioni: chiunque può adattare o riaddestrare il modello per stili di animazione specifici, lingue particolari, espressività artistica o requisiti tecnici. In questa logica, NVIDIA incoraggia la community a contribuire con estensioni, ottimizzazioni e casi d’uso alternativi.

Diversi studi e aziende già utilizzano Audio2Face nei loro progetti: Reallusion ha integrato la tecnologia nei suoi strumenti (iClone, Character Creator, AccuLip), mentre studi di gioco come Survios e The Farm 51 l’hanno impiegata per accelerare la pipeline di animazione facciale nei loro titoli (Alien: Rogue Incursion, Chernobylite 2).

Questo rilascio può essere considerato un passo significativo nella diffusione di avatar digitali realistici e interattivi: modificando la barriera all’ingresso per animazioni di qualità elevata, favorisce innovazione e personalizzazione da parte di una platea più ampia.

Una piattaforma così accessibile potrebbe davvero trasformare il modo in cui pensiamo ai personaggi digitali: sia nei videogiochi sia nelle esperienze conversazionali.

Video