News

Qwen 3.5-Omni: il nuovo modello AI che scrive codice dai video

Alibaba alza ulteriormente l’asticella nel campo dell’intelligenza artificiale multimodale con il lancio di Qwen 3.5-Omni, una versione evoluta del proprio modello linguistico capace di comprendere e generare contenuti a partire da testo, immagini, audio e video in modo simultaneo.

Disponibile nelle varianti Plus, Flash e Light, questo nuovo sistema rappresenta un salto significativo rispetto alla generazione precedente, soprattutto per quanto riguarda la capacità di contesto e le funzionalità avanzate legate alla voce e ai contenuti audiovisivi.

Una finestra di contesto enormemente ampliata

Il miglioramento più evidente riguarda la finestra di contesto, che passa da 32.000 a 256.000 token. Questo consente al modello di gestire quantità di informazioni molto più ampie, arrivando a elaborare fino a 10 ore di audio oppure circa 400 secondi di video in qualità 720p in un’unica sessione.

Anche il riconoscimento vocale ha fatto un balzo in avanti: il sistema ora supporta 113 lingue e dialetti, un incremento notevole rispetto alle 19 lingue disponibili nella versione precedente.

Prestazioni elevate nei benchmark

Secondo i dati diffusi dall’azienda, la versione Plus di Qwen 3.5-Omni ha ottenuto risultati superiori rispetto a Gemini 3.1 Pro in ambiti chiave come riconoscimento, traduzione e dialogo. Nelle attività legate ad audio e video, invece, le prestazioni risultano sostanzialmente equivalenti.

Particolarmente rilevante è il comparto di generazione vocale, dove il modello si distingue per una maggiore stabilità della voce in oltre 20 lingue, superando soluzioni note come ElevenLabs, GPT-Audio e Minimax.

Leggi anche:

Funzioni avanzate e controllo della voce

Tra le funzionalità più interessanti emergono strumenti come la clonazione vocale, il controllo preciso di velocità, volume ed emozione del parlato e la cosiddetta interruzione semantica, che migliora l’interazione naturale tra utente e sistema.

Un ruolo chiave è svolto da ARIA (Adaptive Rate Interleave Alignment), una tecnologia che sincronizza dinamicamente testo e voce, correggendo automaticamente errori come parole mancanti o pronunce poco chiare, soprattutto nei numeri.

La svolta: codice generato dai video

L’aspetto più sorprendente di Qwen 3.5-Omni è la funzione definita Audio-Visual Vibe Coding. In pratica, il modello è in grado di osservare una registrazione dello schermo accompagnata da istruzioni vocali e generare codice funzionante senza alcun input testuale.

Si tratta di un approccio completamente nuovo allo sviluppo software, in cui il linguaggio naturale e il contesto visivo diventano sufficienti per produrre risultati concreti.

Secondo quanto dichiarato da Alibaba, questa capacità non è stata progettata intenzionalmente, ma è emersa durante l’addestramento del modello, rendendola una delle innovazioni più inattese e interessanti nel panorama attuale dell’AI.

Fonte

Ti potrebbe interessare:
Segui guruhitech su:

Esprimi il tuo parere!

Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.

Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].

Condividi l'articolo

Scopri di più da GuruHiTech

Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.

0 0 voti
Article Rating
Iscriviti
Notificami
guest
0 Commenti
Più recenti
Vecchi Le più votate