News

NVIDIA PersonaPlex: l’IA che ascolta e parla in tempo reale

NVIDIA ha annunciato PersonaPlex, un nuovo modello di intelligenza artificiale vocale che cambia radicalmente il modo in cui interagiamo con gli assistenti digitali. A differenza degli approcci tradizionali basati sulla sequenza riconoscimento, testo e sintesi vocale, PersonaPlex è in grado di ascoltare e parlare allo stesso tempo, rendendo le conversazioni più fluide e naturali.

Questa architettura elimina le pause innaturali tipiche degli assistenti vocali attuali e consente al sistema di reagire in tempo reale, interrompere, fermarsi o aggiornare le risposte in base al comportamento dell’interlocutore umano.

Un nuovo approccio alla conversazione vocale

PersonaPlex utilizza un sistema di suggerimenti ibrido che combina input vocali e testuali. L’utente fornisce un breve frammento audio per definire timbro e stile della voce, insieme a una descrizione testuale del ruolo del personaggio, che può spaziare da un operatore di banca a un personaggio immaginario.

Durante il dialogo, il modello mantiene la coerenza del personaggio e reagisce in modo dinamico. Nei test, il ritardo nel cambio di turno tra parlante e assistente è stato di appena 0,07 secondi, un valore nettamente inferiore rispetto a soluzioni concorrenti come Google Gemini Live.

Leggi anche:

Specifiche tecniche e addestramento

Dal punto di vista tecnico, PersonaPlex si basa sul modello di sintesi vocale Moshi e conta circa 7 miliardi di parametri. Supporta audio a 24 kHz ed è stato addestrato utilizzando 1.217 ore di dialoghi reali e oltre 140.000 conversazioni sintetiche.

L’addestramento è stato completato in sole 6 ore grazie all’uso di otto GPU NVIDIA A100. I dati sintetici hanno migliorato la capacità di seguire le istruzioni, mentre le registrazioni reali hanno contribuito a rendere le conversazioni più naturali e credibili.

Prestazioni e confronto con altri modelli

Nei test comparativi, PersonaPlex ha ottenuto un punteggio medio di naturalezza del dialogo pari a 3,90, superando modelli come Gemini Live, Qwen 2.5 Omni e lo stesso Moshi. Questo risultato evidenzia l’efficacia dell’approccio simultaneo ascolto-parlato adottato da NVIDIA.

Un progetto aperto, ma solo in inglese

NVIDIA ha sottolineato l’apertura del progetto: codice e pesi di PersonaPlex sono già disponibili su Hugging Face e GitHub sotto licenza MIT e NVIDIA Open Model License, che ne consentono anche l’uso commerciale.

Al momento, tuttavia, il modello supporta esclusivamente la lingua inglese. In futuro, l’estensione ad altre lingue potrebbe rendere PersonaPlex una base importante per una nuova generazione di assistenti vocali intelligenti.

Fonte

Ti potrebbe interessare:
Segui guruhitech su:

Esprimi il tuo parere!

Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.

Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].

Condividi l'articolo

Scopri di più da GuruHiTech

Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.

0 0 voti
Article Rating
Iscriviti
Notificami
guest
0 Commenti
Più recenti
Vecchi Le più votate