Impartial Games: A Challenge for Reinforcement Learning
Questo articolo dimostra che gli algoritmi di apprendimento per rinforzo in stile AlphaZero non riescono a raggiungere una maestria di livello esperto in giochi imparziali come Nim a causa di un collo di bottiglia rappresentativo fondamentale nell'apprendimento di principi matematici astratti, rivelando che la semplice regolazione degli iperparametri non può superare la loro incapacità di generalizzare oltre gli stati memorizzati.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel mondo dell'intelligenza artificiale, un tipo specifico di programma per computer è diventato recentemente famoso per la sua capacità di padroneggiare complessi giochi di strategia. Giocando milioni di partite contro se stesso, questi programmi imparano a compiere mosse che spesso sorprendono anche i più grandi esperti umani. Sono diventati campioni in giochi come gli scacchi e il Go, dove il successo dipende dal riconoscimento di schemi, dalla valutazione delle posizioni e dalla pianificazione di molti passi avanti. L'idea sottostante è che se una macchina può imparare a vincere comprendendo il flusso di un gioco, potrebbe eventualmente imparare a risolvere qualsiasi problema complesso. Tuttavia, questo successo ha creato un falso senso di sicurezza. Si scopre che il modo in cui queste macchine apprendono non è universale. Esiste una classe specifica di giochi in cui le regole sono semplici, i pezzi sono condivisi da entrambi i giocatori e la strategia vincente si basa su una logica matematica nascosta piuttosto che sul riconoscimento di schemi. In questi giochi, i sistemi di intelligenza artificiale più avanzati si scontrano con un muro, fallendo nell'apprendere i principi stessi che rendono il gioco risolvibile per gli esseri umani.
Ricercatori dell'Imperial College London e della Queen Mary University of London hanno deciso di investigare questo punto cieco utilizzando un gioco chiamato Nim. Il Nim è un gioco giocato con diverse pile di oggetti, dove due giocatori si alternano nel rimuovere un numero qualsiasi di oggetti da una singola pila. L'obiettivo è essere colui che prende l'ultimo oggetto. Sebbene il gioco sembri semplice, il segreto per vincere è un calcolo matematico specifico che coinvolge i numeri binari delle dimensioni delle pile. Per un essere umano, imparare questa regola è una questione di comprensione di un singolo concetto astratto. Per l'intelligenza artificiale, la sfida è diversa. I ricercatori volevano vedere se gli stessi algoritmi di apprendimento che hanno conquistato gli scacchi potessero imparare a vincere a Nim, e se non fosse così, perché. Hanno costruito una versione personalizzata del famoso sistema di apprendimento AlphaZero e l'hanno addestrata a giocare a Nim su tabelloni di dimensioni crescenti, osservando attentamente come l'evoluzione della comprensione del computer.
I risultati sono stati netti e rivelatori. Quando i ricercatori hanno testato il sistema su un piccolo tabellone di Nim con cinque pile, il computer ha imparato a giocare bene. Poteva vincere costantemente, agendo come un campione che sa come iniziare una partita e condurla verso la vittoria. Tuttavia, non appena la dimensione del tabellone è aumentata a sei o sette pile, le prestazioni del sistema sono crollate. Il computer ha smesso di imparare come vincere. Invece di trovare le mosse corrette, ha iniziato a indovinare, performando non meglio di se avesse scelto le mosse in modo casuale. I ricercatori hanno scoperto che il problema non era la complessità del gioco o il fatto che il computer avesse bisogno di più tempo per l'addestramento. La questione era fondamentale nel modo in cui il cervello del computer, un tipo di rete neurale, elabora le informazioni. Queste reti sono eccellenti nel individuare connessioni tra le cose, come riconoscere che una certa disposizione di pezzi di scacchi di solito porta alla vittoria. Ma faticano immensamente con un tipo specifico di logica chiamata parità, che è essenzialmente un modo di contare se un numero è pari o dispari attraverso un gruppo di elementi. Nel Nim, la mossa vincente dipende interamente da questo tipo di logica di conteggio.
Per capire perché questo sia importante, i ricercatori hanno introdotto un nuovo modo di misurare l'abilità di un'intelligenza artificiale. Hanno distinto tra un "campione" e un "esperto". Un campione è un giocatore che può vincere dalla posizione iniziale guidando il gioco in un territorio familiare dove sa cosa fare. Un esperto, invece, può compiere la mossa perfetta da qualsiasi posizione sul tabellone, anche quelle che non ha mai visto prima. Lo studio ha dimostrato che l'intelligenza artificiale poteva diventare un campione su piccoli tabelloni, memorizzando le giuste mosse iniziali. Ma non riusciva a diventare un esperto. Quando il gioco passava alle fasi centrali o finali, o quando il tabellone era più grande, il computer non riusciva a capire la mossa corretta. La sua guida interna, che dovrebbe dirgli quali mosse sono buone, diventava confusa. Assegnava una probabilità alta a una mossa perdente e ignorava quella vincente. Anche quando il computer eseguiva milioni di simulazioni per controllare le sue scelte, non riusciva a correggere il suo errore iniziale perché la sua ipotesi di partenza era troppo lontana dalla realtà.
I ricercatori hanno testato se questo fallimento fosse dovuto al metodo di apprendimento stesso o alla difficoltà della logica del gioco. Hanno creato una versione del gioco in cui i due giocatori controllavano pile diverse e non avevano bisogno di usare la logica della parità per vincere. In questa versione modificata, la stessa intelligenza artificiale ha imparato rapidamente e facilmente, dimostrando che il sistema di apprendimento era capace. Ciò ha confermato che il problema non era il processo di addestramento, ma il tipo specifico di matematica richiesto per il gioco originale. Il computer semplicemente non riusciva ad apprendere la regola astratta della parità dai dati che generava giocando contro se stesso. Il rumore nei dati, causato dagli errori commessi dal computer durante la sua fase iniziale di apprendimento, rendeva impossibile per la rete individuare il modello sottostante.
Questa scoperta mette in discussione l'idea che l'attuale intelligenza artificiale possa risolvere qualsiasi problema fornendo abbastanza dati e potenza di calcolo. Suggerisce che esistano certi tipi di ragionamento logico che questi sistemi non possono apprendere da soli. I ricercatori propongono che, per padroneggiare davvero giochi come il Nim, e forse altri problemi complessi che si basano sulla matematica astratta, la futura intelligenza artificiale dovrà essere costruita diversamente. Suggeriscono di combinare il potere di riconoscimento degli schemi dei sistemi attuali con un modulo di ragionamento simbolico separato che possa gestire queste specifiche regole logiche. Finché non verrà apportato un simile cambiamento, questi potenti sistemi di apprendimento rimarranno campioni in alcuni ambiti, ma rimarranno ciechi alla logica fondamentale di altri, incapaci di raggiungere il livello di vera competenza che un essere umano può raggiungere con un singolo intuito.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.