Impartial Games: A Challenge for Reinforcement Learning
Diese Arbeit zeigt auf, dass AlphaZero-ähnliche Reinforcement-Learning-Algorithmen daran scheitern, Expertenniveau in unparteiischen Spielen wie Nim zu erreichen, was auf einen grundlegenden repräsentativen Engpass beim Erlernen abstrakter mathematischer Prinzipien zurückzuführen ist, wodurch verdeutlicht wird, dass eine einfache Hyperparameter-Optimierung deren Unfähigkeit, die bloß auswendig gelernten Zustände hinaus zu generalisieren, nicht überwinden kann.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der Welt der künstlichen Intelligenz ist vor kurzem ein spezieller Typ von Computerprogramm berühmt geworden, der für seine Fähigkeit bekannt ist, komplexe Strategiespiele zu meistern. Indem diese Programme Millionen von Spielen gegen sich selbst spielen, lernen sie, Züge zu machen, die selbst die größten menschlichen Experten überraschen. Sie sind Champions in Spielen wie Schach und Go geworden, bei denen der Erfolg davon abhängt, Muster zu erkennen, Positionen zu bewerten und viele Schritte im Voraus zu planen. Die zugrunde liegende Idee ist: Wenn eine Maschine lernen kann, zu gewinnen, indem sie den Fluss eines Spiels versteht, könnte sie schließlich lernen, jedes komplexe Problem zu lösen. Dieser Erfolg hat jedoch ein falsches Gefühl der Sicherheit erzeugt. Es stellt sich heraus, dass die Art und Weise, wie diese Maschinen lernen, nicht universell ist. Es gibt eine spezifische Klasse von Spielen, bei denen die Regeln einfach sind, die Figuren von beiden Spielern geteilt werden und die Gewinnstrategie auf einer verborgenen mathematischen Logik basiert, statt auf Mustererkennung. In diesen Spielen stoßen die fortschrittlichsten Systeme der künstlichen Intelligenz an eine Wand und scheitern daran, die Prinzipien zu erlernen, die das Spiel für Menschen lösbar machen.
Forscher des Imperial College London und der Queen Mary University of London beschlossen, diese blinden Flecken mithilfe eines Spiels namens Nim zu untersuchen. Nim ist ein Spiel, das mit mehreren Haufen von Objekten gespielt wird, wobei zwei Spieler abwechselnd beliebig viele Objekte aus einem einzigen Haufen entfernen dürfen. Das Ziel ist es, derjenige zu sein, der das letzte Objekt nimmt. Obwohl das Spiel einfach aussieht, liegt das Geheimnis des Gewinnens in einer spezifischen mathematischen Berechnung unter Verwendung der Binärzahlen der Haufen-Größen. Für einen Menschen ist das Erlernen dieser Regel eine Frage des Verständnisses eines einzigen abstrakten Konzepts. Für die künstliche Intelligenz ist die Herausforderung eine andere. Die Forscher wollten sehen, ob dieselben Lernalgorithmen, die Schach eroberten, auch lernen konnten, bei Nim zu gewinnen, und wenn nicht, warum. Sie bauten eine maßgeschneiderte Version des berühmten AlphaZero-Lernsystems und trainierten es darauf, Nim auf Brettern zunehmender Größe zu spielen, wobei sie genau beobachteten, wie sich das Verständnis des Computers entwickelte.
Die Ergebnisse waren deutlich und aufschlussreich. Als die Forscher das System auf einem kleinen Nim-Brett mit fünf Haufen testeten, lernte der Computer, gut zu spielen. Er konnte konsistent gewinnen und agierte wie ein Champion, der weiß, wie man ein Spiel beginnt und es in Richtung eines Sieges steuert. Doch sobald die Brettgröße auf sechs oder sieben Haufen anstieg, brach die Leistung des Systems zusammen. Der Computer hörte auf, zu lernen, wie man gewinnt. Anstatt die richtigen Züge zu finden, begann er zu raten und zeigte keine bessere Leistung, als wenn er Züge rein zufällig gewählt hätte. Die Forscher entdeckten, dass das Problem nicht die Komplexität des Spiels war oder dass der Computer mehr Zeit zum Trainieren benötigt hätte. Das Problem lag grundlegend in der Art und Weise, wie das Gehirn des Computers, eine Art neuronales Netzwerk, Informationen verarbeitet. Diese Netzwerke sind exzellent darin, Verbindungen zwischen Dingen zu erkennen, wie etwa die Erkenntnis, dass eine bestimmte Anordnung von Schachfiguren normalerweise zu einem Sieg führt. Aber sie haben enorme Schwierigkeiten mit einer spezifischen Art von Logik, der Parität, was im Wesentlichen eine Art des Zählens ist, ob eine Zahl über eine Gruppe von Gegenständen gerade oder ungerade ist. Bei Nim hängt der Gewinnzug vollständig von dieser Art von Zähl-Logik ab.
Um zu verstehen, warum dies von Bedeutung ist, führten die Forscher eine neue Methode zur Messung der Geschicklichkeit einer künstlichen Intelligenz ein. Sie unterschieden zwischen einem „Champion“ und einem Experten. Ein Champion ist ein Spieler, der von der Startposition aus gewinnen kann, indem er das Spiel in vertrautes Terrain lenkt, in dem er weiß, was zu tun ist. Ein Experte hingegen kann aus jeder Position auf dem Brett den perfekten Zug machen, selbst aus Positionen, die er noch nie gesehen hat. Die Studie zeigte, dass die künstliche Intelligenz auf kleinen Brettern ein Champion werden konnte, indem sie die richtigen Eröffnungszüge auswendig lernte. Aber sie scheiterte daran, ein Experte zu werden. Wenn das Spiel in die Mittel- oder Endphasen überging oder wenn das Brett größer wurde, konnte der Computer den richtigen Zug nicht finden. Sein interner Leitfaden, der eigentlich sagen soll, welche Züge gut sind, wurde verwirrt. Er wies einem verlorenen Zug eine hohe Wahrscheinlichkeit zu und ignorierte den gewinnbringenden Zug. Selbst wenn der Computer Millionen von Simulationen durchführte, um seine Entscheidungen zu überprüfen, konnte er seinen anfänglichen Fehler nicht korrigieren, weil seine erste Vermutung so weit daneben lag.
Die Forscher testeten, ob dieses Scheitern auf die Lernmethode selbst oder auf die Schwierigkeit der Spiellogik zurückzuführen war. Sie erstellten eine Version des Spiels, bei der die beiden Spieler verschiedene Haufen kontrollierten und die Paritätslogik nicht nutzen mussten, um zu gewinnen. In diesem modifizierten Spiel lernte dieselbe künstliche Intelligenz schnell und mühelos, was bewies, dass das Lernsystem selbst fähig war. Dies bestätigte, dass das Problem nicht der Trainingsprozess war, sondern die spezifische Art der Mathematik, die für das ursprüngliche Spiel erforderlich war. Der Computer konnte die abstrakte Regel der Parität schlichtweg nicht aus den Daten lernen, die er durch das Spielen gegen sich selbst generierte. Das Rauschen in den Daten, verursacht durch die Fehler, die der Computer während seiner frühen Lernphase machte, machte es dem Netzwerk unmöglich, das zugrunde liegende Muster zu erkennen.
Diese Erkenntnis stellt die Vorstellung infrage, dass die heutige künstliche Intelligenz jedes Problem lösen kann, wenn man ihr genügend Daten und Rechenleistung zur Verfügung stellt. Sie deutet darauf an, dass es bestimmte Arten von logischem Denken gibt, die diese Systeme nicht selbstständig erlernen können. Die Forscher schlagen vor, dass die zukünftige künstliche Intelligenz, um Spiele wie Nim und vielleicht andere komplexe Probleme, die auf abstrakter Mathematik basieren, wirklich zu meistern, anders aufgebaut sein muss. Sie schlagen vor, die Mustererkennungskraft aktueller Systeme mit einem separaten, symbolischen Denkmodul zu kombinieren, das diese spezifischen logischen Regeln handhaben kann. Bis eine solche Änderung erfolgt, werden diese leistungsstarken Lernsysteme in einigen Bereichen zwar Champions bleiben, aber gegenüber der grundlegenden Logik anderer Bereiche blind bleiben und nicht das Niveau der wahren Expertise erreichen können, das ein Mensch mit einer einzigen Einsicht erreicht.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.