Grok Voice Transcribe 2.0 è ufficiale: xAI migliora precisione e trascrizioni multilingue

xAI ha presentato Grok Voice Transcribe 2.0, la nuova generazione del suo modello dedicato alla conversione dell’audio in testo. Il sistema punta soprattutto su una maggiore precisione e sulla capacità di gestire conversazioni reali, rumore ambientale e più lingue.
Il nuovo modello è già accessibile attraverso l’API di riconoscimento vocale di xAI e mantiene i prezzi della generazione precedente: $0,10 per ora di audio per le elaborazioni batch e $0,20 all’ora per le trascrizioni in tempo reale.
La società prevede inoltre di rendere progressivamente Grok Voice Transcribe 2.0 il modello predefinito della propria API, mentre la versione 1.0 verrà ritirata.
Grok Voice Transcribe 2.0 punta sulla precisione
La tecnologia alla base del nuovo modello deriva dal sistema audio utilizzato per Grok Voice. Secondo xAI, questa infrastruttura viene già impiegata in diversi contesti reali, comprese applicazioni legate all’assistenza clienti e agli agenti vocali.
Per sviluppare la nuova generazione, xAI afferma di aver utilizzato registrazioni provenienti da situazioni reali, includendo rumore di fondo, lingue differenti e diversi ambienti acustici. Il modello è stato successivamente perfezionato attraverso ulteriori processi di addestramento per migliorarne il comportamento nelle applicazioni quotidiane.
Secondo i dati comunicati dall’azienda, Grok Voice Transcribe 2.0 avrebbe raggiunto risultati particolarmente competitivi nei benchmark di riconoscimento vocale. xAI lo ha confrontato internamente con diversi sistemi concorrenti, utilizzando chiamate di assistenza clienti, conversazioni vocali, sequenze contenenti informazioni come codici e indirizzi email e comandi brevi pronunciati in lingue differenti.
Il salto più evidente riguarda le lingue
Uno dei miglioramenti principali riguarda la trascrizione multilingue. Il modello può riconoscere automaticamente la lingua utilizzata e continuare a trascrivere anche quando, durante la stessa conversazione, l’utente passa da una lingua all’altra.
La capacità diventa particolarmente importante con i comandi vocali brevi, nei quali il sistema dispone di pochissimo contesto per determinare correttamente la lingua.
Nei test dichiarati da xAI su frasi brevi destinate agli assistenti vocali in 19 lingue, il tasso di errore sulle parole sarebbe sceso dal 20,6% della versione precedente al 6,8% di Grok Voice Transcribe 2.0.
Sono risultati forniti direttamente dall’azienda e vanno quindi interpretati nel contesto delle condizioni e dei set di dati utilizzati per le sue valutazioni.

Leggi anche:
Trascrizione in tempo reale, più interlocutori e fino a otto canali
L’API può essere utilizzata sia per elaborare file audio già registrati sia per produrre trascrizioni in tempo reale.
Tra le funzionalità disponibili figurano i timestamp e i livelli di confidenza associati alle singole parole, l’identificazione di interlocutori differenti e il supporto alla trascrizione di fino a otto canali audio.
Gli sviluppatori possono inoltre indicare fino a 100 termini o espressioni specifiche da privilegiare durante l’elaborazione. Una possibilità utile in settori caratterizzati da terminologia tecnica, nomi di prodotti o vocaboli che un sistema generalista potrebbe interpretare erroneamente.
Il modello è stato progettato anche per restituire correttamente elementi strutturati come numeri, date, valute, numeri telefonici e indirizzi email, oltre a poter eliminare determinate parole riempitive dal risultato finale.
Per gli agenti conversazionali è presente anche una funzione di rilevamento dei turni, necessaria per capire quando una persona ha terminato di parlare e quando l’assistente può iniziare a rispondere.
Supportati file fino a 500 MB
Sul fronte tecnico, Grok Voice Transcribe 2.0 supporta 12 formati audio, differenti frequenze di campionamento e file con dimensioni fino a 500 MB. L’API mette inoltre a disposizione parametri dedicati a 25 lingue.
Una delle prime applicazioni indicate da xAI riguarda Loom, la piattaforma di registrazione dello schermo appartenente ad Atlassian. Dopo una valutazione comparativa, secondo xAI, Loom avrebbe iniziato a utilizzare il nuovo modello per la trascrizione dei propri video.
Per gli sviluppatori, Grok Voice Transcribe 2.0 è disponibile attraverso le interfacce REST e WebSocket di xAI. Durante la fase di transizione sarà ancora possibile selezionare manualmente grok-voice-transcribe-1, prima del progressivo abbandono della generazione precedente.
Con prezzi invariati e miglioramenti concentrati soprattutto sulla comprensione multilingue, xAI punta quindi a rendere il nuovo modello una soluzione più efficace per trascrizioni, assistenti vocali, call center e applicazioni AI in tempo reale.
Ti potrebbe interessare:
Segui guruhitech su:
- Google News: bit.ly/gurugooglenews
- Telegram: t.me/guruhitech
- Facebook: facebook.com/guruhitechfb
- Instagram: instagram.com/guruhitech_official/
- X (Twitter): x.com/guruhitech1
- Bluesky: bsky.app/profile/guruhitech.bsky.social
- Rumble: rumble.com/user/guruhitech
- VKontakte: vk.com/guruhitech
- MeWe: mewe.com/i/guruhitech
- Skype: live:.cid.d4cf3836b772da8a
- WhatsApp: bit.ly/whatsappguruhitech
Esprimi il tuo parere!
Ti è piaciuta questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.
Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].
Scopri di più da GuruHiTech
Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.
