News

Qwen3-Max Thinking supera Gemini e DeepSeek nei test di prestazioni

Alibaba ha presentato Qwen3-Max Thinking, una nuova versione del suo modello linguistico di grandi dimensioni che sta attirando l’attenzione della comunità tecnologica per risultati superiori a quelli di soluzioni concorrenti come Gemini e DeepSeek. Il modello introduce un approccio inedito al ragionamento artificiale, pensato per migliorare in modo significativo le capacità di problem solving e di analisi complessa.

Alla base di Qwen3-Max Thinking c’è un cambiamento radicale rispetto ai metodi di inferenza tradizionali. Invece di limitarsi a una generazione lineare dei token, il sistema utilizza una cosiddetta “modalità rigida”, che combina più fasi di elaborazione in maniera cumulativa. Questo consente al modello di non ripetere conclusioni già raggiunte e di concentrarsi sulle aree di incertezza ancora irrisolte.

Un metodo di pensiero ispirato all’uomo

Uno degli aspetti più interessanti di Qwen3-Max Thinking è l’uso dell’introspezione iterativa. Il modello è in grado di analizzare i passaggi precedenti del proprio ragionamento, sfruttando l’esperienza accumulata durante l’elaborazione per correggere il percorso e superare eventuali stalli. In pratica, si avvicina al modo in cui una persona riconsidera i propri pensieri quando incontra un problema complesso.

A questo si aggiunge la capacità di combinare simultaneamente una modalità di riflessione approfondita con una modalità operativa standard. Questa doppia natura rende il modello più flessibile, permettendogli di adattare il livello di analisi in base alla difficoltà del compito richiesto.

Leggi anche:

Risultati nei benchmark

I test di prestazione confermano le ambizioni di Alibaba. Nel benchmark GPQA, Qwen3-Max Thinking ha raggiunto 92,8 punti, mentre in LiveCodeBench v6 ha ottenuto 91,4 punti. Nei test dedicati al pensiero logico, come HMMT, il modello ha toccato quota 98, superando sia Gemini 3 Pro sia DeepSeek nelle rispettive versioni più avanzate.

Risultati rilevanti sono emersi anche in prove particolarmente complesse come Humanity’s Last Exam, dove il modello ha ottenuto 49,8 punti, e in Arena-Hard v2, con un punteggio di 90,2. In entrambi i casi, Qwen3-Max Thinking si è posizionato davanti a competitor di primo piano, rafforzando l’idea di un reale salto qualitativo.

Costi e disponibilità

Dal punto di vista economico, Qwen3-Max Thinking si colloca in una fascia intermedia rispetto ad altri modelli di fascia alta. Il costo per un milione di token di input è di 1,2 dollari, mentre per l’output si sale a 6 dollari. Una struttura di prezzo che lo rende competitivo per aziende e sviluppatori interessati a integrare capacità di ragionamento avanzato nei propri servizi.

Il modello è già accessibile tramite il chatbot Qwen Chat e attraverso API dedicate, aprendo la strada a nuove applicazioni in ambiti come l’analisi dei dati, la programmazione assistita e il supporto decisionale avanzato.

Fonte

Ti potrebbe interessare:
Segui guruhitech su:

Esprimi il tuo parere!

Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.

Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].

Condividi l'articolo

Scopri di piรน da GuruHiTech

Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.

0 0 voti
Article Rating
Iscriviti
Notificami
guest
0 Commenti
Piรน recenti
Vecchi Le piรน votate