L’IA impara a fare le domande giuste: in Battaglia Navale passa dall’8% all’82% di vittorie

Un gruppo di ricercatori del Massachusetts Institute of Technology (MIT) e dell’Università di Harvard ha ottenuto un risultato sorprendente nel campo dell’intelligenza artificiale. Insegnando ai modelli non solo a rispondere, ma anche a porre domande più efficaci, sono riusciti ad aumentare il tasso di successo in una versione collaborativa di Battaglia Navale dall’8% fino all’82%.
Lo studio, presentato durante l’International Conference on Learning Representations (ICLR), evidenzia un limite ancora presente nei moderni modelli linguistici: eccellono nel fornire risposte a domande complesse, ma spesso faticano quando devono esplorare scenari caratterizzati da incertezza e raccogliere informazioni passo dopo passo.
Perché Battaglia Navale è diventata un laboratorio per l’IA
Per studiare questo comportamento, il team ha scelto Battaglia Navale, un gioco utilizzato da anni nelle ricerche cognitive per comprendere come gli esseri umani cercano informazioni e prendono decisioni. I ricercatori hanno creato una variante in linguaggio naturale chiamata “Battaglia Navale collaborativa”.
In questa versione, un partecipante assume il ruolo di capitano e deve formulare domande sulla posizione delle navi nascoste, mentre un osservatore risponde semplicemente con “sì” o “no”. Oltre 40 persone hanno partecipato agli esperimenti, generando un grande archivio di domande e risposte utilizzato per costruire il dataset BattleshipQA.
Questo database è stato poi impiegato per valutare modelli avanzati come GPT-5 e sistemi più leggeri come Llama 4 Scout.
La vera sfida non era rispondere, ma chiedere meglio
I test hanno mostrato che molti modelli riuscivano già a completare una partita in meno mosse rispetto ai giocatori umani. Tuttavia, emergeva una differenza fondamentale: i sistemi più piccoli tendevano a formulare domande poco efficienti, raccogliendo informazioni in modo disordinato.
Per superare questo limite, gli studiosi hanno introdotto la inferenza Monte Carlo, una tecnica che consente di simulare molteplici scenari possibili e stimare quali domande possano fornire il maggior numero di informazioni utili.
Grazie a questo approccio, i modelli hanno iniziato a selezionare interrogativi molto più strategici. Il miglioramento più evidente è stato registrato da Llama 4 Scout, che è passato da un tasso di vittoria dell’8% a uno dell’82%, superando persino GPT-5 in termini di efficienza con un costo computazionale pari a circa l’1% di quello richiesto dal modello più avanzato.
Leggi anche:
Quando l’IA impara a simulare il mondo
Secondo Gabriel Grand, autore principale della ricerca e dottorando presso il CSAIL del MIT, il risultato dimostra che la capacità di formulare domande intelligenti dipende direttamente dalla capacità di costruire una rappresentazione del mondo.
In altre parole, quando un sistema riesce a immaginare diversi scenari possibili prima di agire, può identificare più rapidamente le informazioni davvero rilevanti e raggiungere la soluzione con meno tentativi.
Più precisione grazie al codice Python
I ricercatori hanno individuato un secondo problema: la precisione delle risposte fornite dagli osservatori artificiali. Sebbene GPT-5 si sia dimostrato molto affidabile, i modelli più piccoli commettevano errori nel confermare o negare la presenza delle navi.
Per ridurre questi sbagli, le domande formulate dal capitano sono state convertite automaticamente in codice Python. In questo modo il sistema poteva verificare ogni richiesta attraverso controlli espliciti anziché affidarsi esclusivamente al ragionamento linguistico.
La modifica ha portato a un incremento medio della precisione del 15%. In alcuni casi i miglioramenti sono stati ancora più significativi: GPT‑4o‑mini ha registrato quasi il 30% di accuratezza in più, mentre Claude 4 Opus ha ottenuto un incremento di otto punti percentuali.
Risultati confermati anche in “Indovina Chi?”
Gli scienziati hanno poi applicato lo stesso metodo a una versione digitale di Indovina Chi?, dove i modelli dovevano individuare un personaggio corretto eliminando progressivamente decine di possibilità.
Anche in questo caso i risultati sono stati notevoli. Llama 4 Scout è passato dal 30% al 72% di successi, mentre GPT‑4o è cresciuto dal 62% al 90%, confermando che la capacità di fare domande più informative può migliorare sensibilmente le prestazioni in contesti caratterizzati da molte alternative possibili.
Le applicazioni future oltre i giochi
Secondo gli autori, questi risultati potrebbero avere implicazioni molto più ampie rispetto ai semplici giochi da tavolo. Tecniche simili potrebbero essere impiegate nella diagnosi medica, nella ricerca scientifica, nella programmazione e in tutti quei problemi in cui è necessario trovare rapidamente una soluzione nascosta all’interno di un enorme spazio di possibilità.
Nonostante i progressi, gli esperti sottolineano che i modelli di IA non hanno ancora raggiunto il livello dei migliori giocatori umani. Le prossime fasi della ricerca punteranno infatti a testare questi sistemi in ambienti più complessi, con un numero molto maggiore di variabili e con forme di collaborazione sempre più avanzate tra esseri umani e intelligenza artificiale.
Ti potrebbe interessare:
Segui guruhitech su:
- Google News: bit.ly/gurugooglenews
- Telegram: t.me/guruhitech
- Facebook: facebook.com/guruhitechfb
- Instagram: instagram.com/guruhitech_official/
- X (Twitter): x.com/guruhitech1
- Bluesky: bsky.app/profile/guruhitech.bsky.social
- Rumble: rumble.com/user/guruhitech
- VKontakte: vk.com/guruhitech
- MeWe: mewe.com/i/guruhitech
- Skype: live:.cid.d4cf3836b772da8a
- WhatsApp: bit.ly/whatsappguruhitech
Esprimi il tuo parere!
Che ne pensi di questa notizia? Lascia un commento nell’apposita sezione che trovi più in basso e se ti va, iscriviti alla newsletter.
Per qualsiasi domanda, informazione o assistenza nel mondo della tecnologia, puoi inviare una email all’indirizzo [email protected].
Scopri di più da GuruHiTech
Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.
