← Neueste Arbeiten
💻 computer science

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

Dieses Paper führt SUN (Semantically UNified) Programs und das Kuafu-System ein, welche die modellbasierte Steuerung und gelernte Policies überbrücken, indem sie automatisch typisierte, sprachgebundene Ausführbare Programme synthetisieren, die MPC-Verifikation und RL-Training vereinigen und dadurch robuste, langfristige Manipulation ohne manuelle dichte Belohnungen oder menschliche Demonstrationen ermöglichen.

Ursprüngliche Autoren: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

Veröffentlicht 2026-09-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind seit langem Meister der Fabrikböden, die dieselbe präzise Bewegung tausendfach ohne Fehler wiederholen können. Doch wenn sie gebeten werden, eine komplexe, mehrstufige Aufgabe in einem unordentlichen, unvorhersehbaren Zuhause auszuführen – wie etwa eine Schublade zu öffnen, eine Flasche herauszunehmen und sie auf einen Tisch zu stellen –, geraten sie oft ins Straucheln. Die Schwierigkeit liegt darin, die Lücke zwischen zwei verschiedenen Arten des Denkens über Bewegung zu schließen. Ein Ansatz stützt sich auf starre mathematische Regeln, um jeden Gelenkwinkel und jede Kraft zu berechnen, wodurch sichergestellt wird, dass der Roboter nicht kollidiert; diese Methode ist jedoch spröde und versagt, wenn sich die Welt geringfügig verändert. Der andere Ansatz nutzt Trial-and-Error-Lernen, bei dem ein Roboter übt, bis er eine Aufgabe beherrscht, was jedoch oft tausende Stunden menschlicher Demonstration oder sorgfältig gestalteter Belohnungen erfordert, die schwer zu entwerfen sind. Jahrelang operierten diese beiden Methoden in getrennten Silos, wobei die starren Planer nicht anpassungsfähig waren und die Lernenden die tiefere Logik der Aufgabe nicht verstehen konnten.

Forscher der University of California, Los Angeles, und ihre Kollegen haben ein neues System namens Kuafu vorgestellt, das versucht, diese beiden Ansätze miteinander zu verweben. Anstatt die Anweisungen an den Roboter als einen flüchtigen Satz von Zielen oder ein starres Skript zu behandeln, haben sie ein persistentes, typisiertes Programm erstellt, das als einzige Quelle der Wahrheit für den gesamten Prozess dient. Dieses Programm, das sie ein „Semantisch Vereinheitlichtes“ oder SUN-Programm nennen, ist so geschrieben, dass ein Computer die physischen Beziehungen zwischen Objekten verstehen kann, wie etwa in welche Richtung ein Schubladengriff zeigt oder wie weit eine Flasche angehoben werden muss. Entscheidend ist, dass dasselbe Programm verwendet wird, um die Aktionen des Roboters zu verifizieren, ihm das Bewegen beizubringen und die Daten zu generieren, die benötigt werden, damit er von Grund auf lernt. Indem das System die Kernbedeutung der Aufgabe vom anfänglichen Planungsstadium bis zur finalen Lernphase konstant hält, verhindert es, dass der Roboter von dem, was er eigentlich tun sollte, abdriftet.

Das System beginnt mit einer einfachen Sprachanweisung eines Menschen, wie zum Beispiel „Öffne die Schublade und stelle den Becher hinein“. Ein künstlicher Intelligenz-Agent liilt diese Anweisung und konstruiert das SUN-Programm, indem er vordefinierte Bausteine auswählt, die physische Aktionen und Einschränkungen beschreiben. Er testet dieses Programm dann in einer High-Fidelity-Simulation unter Verwendung einer hochentwickelten Steuerungsmethode, um zu sehen, ob die Aufgabe physisch möglich ist. Wenn die Simulation ergibt, dass die Anweisungen fehlerhaft oder unmöglich auszuführen sind, repariert das System das Programm automatisch, bevor überhaupt ein Lernprozess beginnt. Dieser Screening-Prozess ist entscheidend, da er sicherstellt, dass der Roboter niemals gebeten wird, eine Aufgabe zu lernen, die nicht ausführbar ist, wodurch schlechte Ideen aussortiert werden, bevor sie Zeit und Rechenleistung verschwenden.

Sobald das Programm validiert ist, nutzt das System es, um tausende erfolgreiche Beispiele für die Ausführung der Aufgabe durch den Roboter zu generieren. Diese Beispiele sind keine bloßen Zufallsbewegungen; sie werden durch das persistente Programm geleitet, welches jede Phase der Aufgabe verfolgt, vom Moment, in dem der Greifer den Griff berührt, bis zu dem Moment, in dem die Schublade vollständig geöffnet ist. Der Roboter lernt dann aus diesen Beispielen, zuerst indem er die erfolgreichen Bewegungen imitiert, und anschließend durch einen Prozess von Versuch und Irrtum, der streng durch das ursprüngliche Programm begrenzt ist. Dies stellt sicher, dass der Roboter zwar lernt, flexibel und reaktiv zu sein, aber niemals das ultimative Ziel aus den Augen verliert. Das Ergebnis ist eine Policy, die komplexe, mehrstufige Aufgaben mit einem Maß an Zuverlässigkeit ausführen kann, das bisherige Methoden nicht erreichten.

In einer Testreihe mit neun verschiedenen Manipulationsaufgaben, die vom Stapeln von Würfeln bis hin zum Neuausrichten von Flaschen und Öffnen von Schubladen reichten, zeigte das System eine signifikante Verbesserung gegenüber bestehenden Methoden. Während andere Ansätze, die auf spärlichen Belohnungen (sparse rewards) oder Online-Planung basieren, Schwierigkeiten hatten, öfter als ein Drittel der Fälle erfolgreich zu sein, erreichte dieses neue System eine Erfolgsquote von über 82 Prozent. Die Forscher fanden heraus, dass das System besonders effektiv bei Aufgaben war, die viele Schritte erforderten, wobei es seine Leistung selbst bei zunehmender Komplexität der Sequenz beibehielt. Darüber hinaus war die durch dieses System generierte Datenqualität so hoch, dass sie es einem visuellen Lernmodell ermöglichte, in 46 Prozent der Versuche erfolgreich zu sein – ein Wert, der mehr als doppelt so hoch war wie die Erfolgsrate von Modellen, die auf Daten aus anderen Generierungsmethoden trainiert wurden.

Der wahre Test eines jeden Robotersystems ist, ob es aus der Sicherheit einer Computersimulation in die reale Welt wechseln kann. Um dies zu verifizieren, setzten die Forscher die trainierten Policies auf physischen Robotern der Marken Franka und Kinova ein und nutzten Kameras, um die Aktionen des Roboters ohne Vorwissen über die spezifische Aufgabenstruktur zu steuern. Ohne zusätzliche Feinabstimmung oder praktisches Training in der realen Welt absolvierten die Roboter 34,7 Prozent der physischen Versuche über verschiedene Konfigurationen hinweg erfolgreich. Dieser Zero-Shot-Transfer, bei dem ein vollständig in der Simulation trainierter Roboter sofort an einer echten Maschine arbeitet, deutet darauf hin, dass das persistente Programm die wesentliche Logik der Aufgabe erfolgreich erfasst hat, was es der gelernten Verhaltensweise ermöglicht, auf die physische Welt zu generalisieren.

Die Forscher räumen ein, dass dieser Ansatz Grenzen hat. Er stützt sich derzeit auf eine vordefinierte Bibliothek physischer Aktionen und erfordert ein klares Verständnis der Objekte in der Szene, was bedeutet, dass er verformbare Objekte wie Stoffe oder Flüssigkeiten noch nicht ohne signifikante neue Programmierung handhaben kann. Zudem schreitet das System in einer einzigen Richtung durch die Aufgaben voran und kann nicht zurückweichen, falls ein physischer Fehler auftritt, was die Fähigkeit einschränkt, sich von bestimmten Arten von Fehlern zu erholen. Dennoch etablieren die Ergebnisse ein neues Prinzip für das Roboterlernen: Dass die Beibehaltung der semantischen Bedeutung einer Aufgabe über Planung, Verifizierung und Lernen hinweg eine robuste Grundlage für die Automatisierung schafft. Indem das System sicherstellt, dass das Verständnis des Roboters für die Aufgabe nicht driftet, schlägt es die Brücke zwischen starrer Kontrolle und flexiblem Lernen und bietet einen Weg zu Robotern, die komplexe Aufgaben in der realen Welt zuverlässig ausführen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →