← Neueste Arbeiten
🤖 machine learning

VGFM: Expressive Robot Policies via Dense Value Guidance in Flow Matching

Das Paper schlägt Value-Guided Flow Matching (VGFM) vor, ein skalierbares Offline-Reinforcement-Learning-Framework, das dichte wertbasierte Führung in expressive Flow-Matching-Policies für die Robotersteuerung integriert, ohne Backpropagation durch die Zeit oder zusätzlichen algorithmischen Overhead zu erfordern, und dabei eine starke Leistung über diverse Lokomotions- und Manipulationsaufgaben hinweg erzielt.

Ursprüngliche Autoren: Prajwal Koirala, Mark Campbell

Veröffentlicht 2026-09-15
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Prajwal Koirala, Mark Campbell

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind seit langem Meister repetitiver, vorhersehbarer Aufgaben, doch ihnen beizubringen, mit der chaotischen, unvorhersehbaren Vielfalt der realen Welt umzugehen, blieb eine hartnäckige Herausforderung. Jahrelang haben Forscher versucht, dies zu lösen, indem sie Roboter mit riesigen Bibliotheken vergangener Bewegungen fütterten, in der Hoffnung, dass die Maschine menschliche Geschicklichkeit imitieren könnte, ohne jemals in der realen Welt üben zu müssen. Dieser Ansatz, bekannt als Offline-Lernen, bietet einen sicheren und effizienten Weg für das Training, stößt jedoch an eine Grenze, wenn der Roboter auf eine Situation trifft, die sich geringfügig von seinen Trainingsdaten unterscheidet. Der Roboter muss dann entscheiden, wie er handeln soll, wobei er oft zwischen vielen verschiedenen gültigen Wegen wählen muss, ähnlich wie ein Autofahrer an einer komplexen Kreuzung, der links abbiegen, geradeaus fahren oder sich durch den Verkehr schlängeln kann. Traditionelle Methoden haben Schwierigkeiten, diese reiche Vielfalt an Möglichkeiten zu erfassen, und zwingen den Roboter oft in einen einzigen, starren Pfad, der versagt, wenn sich die Bedingungen ändern. Um über diese Einschränkungen hinauszugehen, wenden sich Wissenschaftler generativen Modellen zu – einer Art künstlicher Intelligenz, die in der Lage ist, ein breites Spektrum möglicher Aktionen zu imaginieren, anstatt nur eine einzige.

Die Kernschwierigkeit liegt darin, diesen imaginativen Modellen beizubringen, nicht nur kreativ, sondern auch intelligent zu sein. Ein Roboter muss wissen, welche seiner vielen imaginierten Aktionen tatsächlich zum Erfolg führen wird. In der Vergangenheit erforderte der Versuch, ein Modell der Vorstellungskraft eines Roboters auf ein gutes Ergebnis zuzusteuern, einen rechenintensiven Prozess, bei dem der Computer jeden einzelnen Schritt des Denkprozesses des Roboters rückwärts verfolgen musste, um zu sehen, wo es schiefgelaufen war. Dies war langsam, instabil und machte den Trainingsprozess oft zu komplex, um skalierbar zu sein. Forscher der Cornell University haben nun eine neue Methode namens „Value-Guided Flow Matching“ eingeführt, die diesen Engpass vollständig umgeht. Anstatt den Computer zu zwingen, seine Schritte durch die Zeit zurückzuverfolgen, ermöglicht dieser neue Ansatz dem Roboter, in jedem einzelnen Moment seines Entscheidungsprozesses Anleitung zu erhalten, wodurch sichergestellt wird, dass selbst seine Zwischengedanken ihn auf ein erfolgreiches Ergebnis zusteuern.

Das Team unter der Leitung von Prajwal Koirala und Mark Campbell entwarf ein System, bei dem die Strategie (Policy) des Roboters für Bewegungen eher wie ein kontinuierlicher Fluss als wie eine Serie diskreter Sprünge aufgebaut ist. Stellen Sie sich einen Fluss vor, der von einer Quelle zu einem Ziel fließt; der Roboter beginnt mit einer einfachen, zufälligen Idee einer Bewegung und formt sie allmählich zu einer spezifischen Aktion aus. Die Innovation besteht hier darin, dass das System die Qualität dieser Aktion an jedem Punkt entlang des Flusslaufs überprüft, nicht erst am Ende. Durch die Vorhersage des endgültigen Ziels der Bewegung bei jedem Zwischenschritt kann das System ein „Wert“-Signal (Value Signal) – ein Maß dafür, wie gut diese Aktion ist – anwenden, ohne den gesamten generativen Prozess entwirren zu müssen. Das bedeutet, dass der Roboter lernt, seine Bewegungen kontinuierlich zu verfeinern, geleitet von einem Kritiker, der die Qualität der Aktion in Echtzeit bewertet, während er gleichzeitig die schweren Rechenkosten vermeidet, die durch das Zurückverfolgen durch die Zeit entstehen würden.

Um diese Idee zu testen, unterzog das Team sein System einer strengen Testreihe unter Verwendung eines Standard-Benchmarks namens OGBench, der eine breite Palette schwieriger Aufgaben umfasst. Diese Aufgaben reichten von der Navigation durch komplexe Labyrinthe mit vierbeinigen und humanoiden Robotern bis hin zur Manipulation von Objekten mit Roboterarmen. In den Labyrinth-Szenarien mussten die Roboter sich durch gewundene Korridore navigieren, während die Manipulationsaufgaben dazu erforderten, Würfel zu stapeln oder mit Objekten in unordentlichen Umgebungen zu interagieren. Das System wurde auf statischen Datensätzen vergangener Bewegungen trainiert, was bedeutete, dass es die Umgebung während der Lernphase nie sah, sondern nur die aufgezeichneten Daten. Die Ergebnisse waren beeindruckend: Die neue Methode schnitt bei fast allen diesen vielfältigen Aufgaben konsistent besser ab oder war mit den besten existierenden Techniken ebenbürtig. Sie erreichte hohe Erfolgsraten bei der Navigation in den AntMaze- und HumanoidMaze-Umgebungen und zeichnete sich durch die präzisen Bewegungen aus, die für die Cube- und Scene-Manipulation erforderlich waren.

Ein wichtiges Merkmal dieses Ansatzes ist seine Flexibilität während des tatsächlichen Einsatzes des Roboters. Sobeder das System trainiert ist, können Ingenieure die Menge der Rechenleistung, die zur Generierung einer einzelnen Aktion verwendet wird, anpassen, ohne das Modell neu trainieren zu müssen. Die Forscher fanden heraus, dass der Roboter durch die bloße Erhöhung der Anzahl der Schritte, die der Computer unternimmt, um die endgültige Bewegung zu berechnen, präzisere und komplexere Aufgaben ausführen kann. Dieser Kompromiss zwischen Geschwindigkeit und Genauigkeit ist entscheidend für reale Anwendungen, in denen ein Roboter in einer einfachen Situation schnell agieren muss, aber in einer empfindlichen Situation langsamer werden muss, um präzise zu sein. Die Studie zeigte, dass diese Skalierbarkeit fast ohne zusätzlichen Zeitaufwand erfolgt, sodass der Roboter durch die Nutzung von mehr Rechenleistung im Moment der Entscheidung expressiver und fähiger werden kann.

Der Erfolg dieser Methode deutet auf einen neuen Weg für die Robotersteuerung hin, der das Bedürfnis nach Sicherheit und Dateneffizienz mit der Forderung nach komplexem, anpassungsfähigem Verhalten in Einklang bringt. Indem sie die schwere Rechenlast der Rückverfolgung jedes Schritts eliminierten, haben die Forscher es möglich gemacht, Roboter zu trainieren, die lange, komplizierte Aktionssequenzen mit einem Grad an Ausdrucksstärke bewältigen können, der zuvor unerreichbar war. Das System beruht weder auf Magie noch auf Abkürzungen; es überdenkt schlichtweg, wie Anleitung angewendet wird, wodurch der Roboter lernt, aus einem dichten Strom von Feedback während seiner gesamten Entscheidungsreise zu lernen. Während die Robotik bestrebt ist, Maschinen zu entwickeln, die in unstrukturierten menschlichen Umgebungen operieren können, bieten Methoden wie diese einen skalierbaren und effektiven Weg, um ihnen die subtile Kunst beizubringen, die richtige Aktion aus einer Welt voller Möglichkeiten zu wählen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →