Privileged observations enable rapid and reliable policy discovery directly in the physical world
Diese Arbeit zeigt, dass privilegierte Beobachtungen eines chaotischen physikalischen Systems entscheidend dafür sind, Reinforcement-Learning-Agenten zu ermöglichen, direkt in der realen Welt schnell leistungsstarke Strategien zu entdecken, da Agenten, denen solche Strömungsdaten fehlten, trotz des erfolgreichen Erlernens von widerstandsreduzierenden Strategien keine widerstandserhöhenden Strategien erlernen konnten.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich einen Schwimmer vor, der versucht, sich durch das Wasser zu bewegen. Wenn er die Strömungen um sich herum sehen könnte, würde er vielleicht lernen, seinen Körper so zu drehen, dass er den Widerstand durchschneidet, oder vielleicht so, dass er das Wasser einfängt, um sich selbst vorwärts zu drücken. Dies ist das Wesen der aktiven Strömungskontrolle: ein Feld, in dem Ingenieure versuchen, die unsichtbare, chaotische Bewegung von Flüssigkeiten zu manipulieren, um zu verbessern, wie sich Objekte bewegen oder wie sie ruhig liegen bleiben. Seit Jahrzehnten wissen Wissenschaftler, dass das Drehen eines Zylinders in einer Strömung verändern kann, wie stark das Wasser gegen ihn drückt. Manchmal reduziert eine stetige Drehung den Widerstand, wodurch das Objekt leichter hindurchgleiten kann. Ein anderes Mal kann eine spezifische rhythmische Drehung den Widerstand tatsächlich erhöhen und das Objekt zurückhalten. Die Herausforderung bestand bisher immer darin, das genaue Timing und die Geschwindigkeit dieser Drehung zu bestimmen, um das beste Ergebnis zu erzielen, insbesondere da die Wasserströmung chaotisch und schwer vorhersehbar ist.
Normalerweise, wenn Ingenieure einen Computer lehren wollen, ein solches System zu steuern, bauen sie ein virtuelles Modell des Wassers und lassen den Computer dort üben. Aber virtuelle Modelle sind niemals perfekt; sie lassen die winzigen, unordentlichen Details des echten Wassers vermissen. Deshalb beschlossen Forscher der ETH Zürich, die Simulation komplett zu überspringen. Sie bauten einen physischen Wasserkanal auf und brachten einem Computer-Agenten bei, direkt aus dem echten, wirbelnden Wasser zu lernen. Die Frage, die sie stellten, war einfach, aber tiefgründig: Muss der Computer das Wasser um das Objekt herum sehen, während er lernt, um den besten Weg zur Kontrolle des Wassers zu finden? Oder kann er es allein dadurch herausfinden, dass er den Druck und Zug auf das Objekt spürt?
Die Forscher richteten einen Tischwasserkanal ein, einen klaren Tank, in dem Wasser in einer Schleife zirkuliert. Im Inneren befindet sich ein Zylinder in der Strömung, und ein Motor kann ihn mit jeder beliebigen Geschwindigkeit oder Richtung drehen. Um zu messen, wie stark das Wasser gegen den Zylinder drückt, verwendeten sie einen empfindlichen Drehmomentsensor. Um das Wasser zu sehen, nutzten sie eine Technik namens Particle Image Velocimetry. Dabei wird eine Laserebene durch das Wasser geschickt, das winzige schwebende Partikel enthält, und es werden schnelle Fotos gemacht. Durch das Verfolgen, wie sich diese Partikel zwischen den Fotos bewegen, kann ein Computer eine detaillierte, Echtzeit-Karte der Geschwindigkeit und Richtung des Wassers direkt hinter dem Zylinder erstellen. Diese Karte ist die „privilegierte Beobachtung“ – zusätzliche Informationen, die der Computer während des Trainings sehen kann, die er später aber vielleicht nicht benötigt.
Sie trainierten einen universellen Lernagenten, eine Art künstliche Intelligenz, um den Zylinder zu steuern. In einem Satz von Experimenten erhielt der Agent sowohl das Gefühl des Widerstands als auch die detaillierte Karte der Wasserströmung. In einem anderen Satz wurde dem Agenten nur das Gefühl des Widerstands gegeben, wobei die Wasserkarte verborgen blieb. Das Ziel war zweifach: erstens, einen Weg zu finden, den Zylinder so zu drehen, dass der Widerstand so weit wie möglich reduziert wird, und zweitens, einen Weg zu finden, den Zylinder so zu drehen, dass der Widerstand so weit wie möglich erhöht wird.
Die Ergebnisse waren beeindruckend und offenbarten eine überraschende Asymmetrie. Wenn der Agent Zugang zur detaillierten Karte der Wasserströmung hatte, lernte er unglaublich schnell. Innerhalb von Minuten der Interaktion mit dem echten Wasser entdeckte er eine Strategie, um den Widerstand um etwa 32 Prozent zu reduzieren. Er fand auch schnell eine Strategie, um den Widerstand um etwa 25 Prozent zu erhöhen. Diese Zahlen entsprachen den besten bekannten von Menschen entwickelten Strategien, die über Jahrzehnte der Untersuchung entwickelt wurden, oder übertrafen sie sogar leicht.
Als die Forscher jedoch die Wasserkarte verbargen und den Agenten zwangen, nur unter Verwendung der Widerstandsmessung zu lernen, änderte sich die Geschichte völlig. Der Agent war immer noch in der Lage zu lernen, wie man den Widerstand reduziert, und erreichte schließlich eine Reduktion von etwa 31 Prozent. Es dauerte nur etwas länger und war etwas variabler. Aber als das Ziel darin bestand, den Widerstand zu erhöhen, scheiterte der Agent. Ohne die Wasserströmung zu sehen, gelang es keinem der Trainingsläufe, eine Strategie zu lernen, die den Widerstand signifikant erhöhte. Der Agent konnte nicht herausfinden, wie er das Wasser dazu bringen konnte, stärker zu drücken, obwohl die bestmögliche Strategie existierte und physikalisch möglich war.
Um zu verstehen, warum dies geschah, schauten die Forscher genau darauf, was das Wasser tat. Sie fanden heraus, dass das Wasser fast immer reagierte, indem es zuerst weniger gegen den Zylinder drückte, sobald der Zylinder zu rotieren begann, unabhängig davon, ob das Ziel darin bestand, mehr oder weniger zu drücken. Dieser anfängliche Abfall des Widerstands ist eine natürliche physikalische Reaktion. Für den Agenten, der versuchte, den Widerstand zu reduzieren, war dieser anfängliche Abfall ein hilfreiches Zeichen, dass er auf dem richtigen Weg war. Für den Agenten, der versuchte, den Widerstand zu erhöhen, war dieser anfängliche Abfall jedoch verwirrend; es fühlte sich an wie das Gegenteil dessen, was er erreichen wollte. Ohne die detaillierte Karte des Wassers, um das große Ganze zu sehen, konnte der Agent diesen anfänglichen Abfall nicht überwinden und lernte die richtige Strategie nie.
Die Forscher testeten dann, ob die Strategien, die der Agent mit der Wasserkarte gelernt hatte, auch ohne diese verwendet werden konnten. Sie zeichneten die exakten Rotationsmuster auf, die der Agent verwendete, wenn er die Karte hatte, und spielten diese exakten Muster dann als feste Sequenzen ab, ohne neue Beobachtungen vorzunehmen. Überraschenderweise funktionierten diese festen Sequenzen genauso gut wie der lebende, denkende Agent. Der Agent hatte eine spezifische Bewegungsabfolge gelernt, die so gut funktionierte, dass er das Wasser nicht ständig beobachten musste, um sie auszuführen. Dies beweist, dass die Wasserkarte nicht benötigt wurde, um die Aufgabe zu ausführen, aber sie war absolut essenziell, um die Aufgabe zu entdecken.
Dieser Befund unterstreicht einen entscheidenden Unterschied beim Lernen: Was man braucht, um eine Lösung zu finden, ist oft nicht dasselbe wie das, was man braucht, um sie anzuwenden. In diesem Fall fungierte die reichhaltige, detaillierte Sicht auf die Wasserströmung als Lehrer, der den Agenten durch die verwirrenden anfänglichen Reaktionen der Flüssigkeit führte. Sobald der Agent den richtigen Pfad gefunden hatte, konnte er ihn mit verbundenen Augen gehen. Die Studie legt nahe, dass in komplexen physikalischen Systemen der Zugang zu Zusatzinformationen während der Lernphase der entscheidende Faktor zwischen Erfolg und Misserfolg sein kann, selbst wenn diese Informationen zum Zeitpunkt der eigentlichen Ausführung des Systems nicht verfügbar sind. Sie zeigt, dass die künstliche Intelligenz, um die unordentliche, chaotische reale Welt zu meistern, möglicherweise mehr sehen muss, als ihr jemals erlaubt sein wird, tatsächlich zu nutzen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.