Ataraxos è un sistema di intelligenza artificiale che ha battuto nettamente uno dei più forti giocatori di Stratego al mondo, affrontando un problema che per anni ha resistito ai sistemi AI: prendere decisioni quando una grande parte delle informazioni resta nascosta. Il risultato, pubblicato su Nature il 30 settembre 2026, mostra che reinforcement learning, belief modelling e ricerca al momento della decisione possono funzionare anche in giochi con enormi quantità di informazione imperfetta.
Stratego è un banco di prova particolarmente difficile perché ogni giocatore conosce la posizione dei pezzi avversari ma non la loro identità. Le configurazioni possibili superano 1033, un livello di incertezza che rende poco pratiche molte tecniche usate con successo in giochi come poker, scacchi o Go.
Quanto è forte Ataraxos
Nella valutazione descritta dagli autori, Ataraxos ha affrontato Pim Niemeijer, indicato nello studio come il giocatore di Stratego più titolato in attività. In una serie di 20 partite, l’AI ha ottenuto 15 vittorie, 1 sconfitta e 4 pareggi, pari a un effective win rate dell’85%.
Il sistema è stato poi mostrato al Campionato mondiale di Stratego 2025, dove ha ottenuto un effective win rate del 95% in 40 partite contro partecipanti all’evento. Gli autori hanno inoltre applicato lo stesso schema a Barrage Stratego, Hanabi e dou dizhu, ottenendo prestazioni di livello superiore o stato dell’arte.

Come funziona
Ataraxos combina tre elementi. Il primo è una rete policy-value addestrata tramite self-play, cioè milioni di partite giocate contro copie di sé stessa. Il secondo è una belief network che prova a modellare l’informazione nascosta e a stimare quali configurazioni dell’avversario siano plausibili. Il terzo è una procedura di test-time search che valuta diverse azioni proprio nel momento in cui deve essere scelta la mossa.
Il punto chiave è che il sistema non cerca di ricostruire con certezza ciò che non può vedere. Genera invece possibili stati compatibili con le informazioni disponibili, simula le conseguenze delle mosse e aggiorna la politica decisionale prima di scegliere.
Perché il costo di addestramento conta
Lo studio sottolinea anche l’efficienza. Il training principale è stato eseguito su 16 GPU NVIDIA H100 per una settimana, mentre la belief network ha usato 4 H100 per quattro giorni. Gli autori stimano un costo complessivo nell’ordine di poche migliaia di dollari, molto inferiore rispetto ad approcci precedenti che non avevano raggiunto lo stesso livello contro i migliori umani.
Il training ha comunque richiesto numeri enormi in termini assoluti: 163 milioni di partite completate e circa 208 miliardi di passi nell’ambiente simulato. L’efficienza è quindi relativa alla difficoltà del problema e al confronto con i sistemi precedenti, non significa che l’addestramento sia leggero in senso comune.

Perché Stratego è diverso da scacchi e Go
Negli scacchi entrambi i giocatori vedono l’intera posizione. In Stratego no: conoscere il valore reale dei pezzi dell’avversario fa parte del problema. Per questo una buona decisione dipende sia dalla posizione visibile sia da ciò che il sistema ritiene probabile dietro l’informazione nascosta.
È un tema che si collega alle ricerche sull’AI capace di imparare strategie e rappresentazioni del mondo. Su iCrewPlay Tech abbiamo seguito SIMA 2 e l’apprendimento autonomo nei videogiochi e i progetti che usano videogiochi e world model per addestrare sistemi AI. Ataraxos affronta un problema diverso: decidere bene quando una parte essenziale dello stato del mondo non è osservabile.
Cosa cambia davvero
Il risultato non dimostra che l’AI sappia gestire automaticamente negoziazioni, mercati o altri scenari reali. Mostra però che il limite dell’informazione nascosta può essere affrontato con un’architettura generale che unisce self-play, modellazione delle credenze e ricerca al momento della decisione.
La fonte primaria è lo studio Scalable decision-making for games of imperfect information, pubblicato su Nature il 30 settembre 2026.