← Neueste Arbeiten
💻 computer science

HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy

Das Papier schlägt HaWMPO vor, ein halluzinationsbewusstes, auf Weltmodellen basierendes Policy-Optimierungs-Framework, das generalistische Roboter-Policies verbessert, indem es Vorhersagehalluzinationen während imaginierter Rollouts abschätzt und unterdrückt, wodurch die Erfolgsraten bei komplexen Langzeit-Manipulationsaufgaben sowohl in Benchmarks als auch auf realen Robotern signifikant gesteigert werden.

Ursprüngliche Autoren: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

Veröffentlicht 2026-09-10
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die lernen können, eine Vielzahl von Aufgaben auszuführen – vom Stapeln von Blöcken bis hin zum Falten von Wäsche –, sind seit langem ein Ziel der künstlichen Intelligenz. Um dies zu erreichen, haben Forscher „Generalisten-Policys“ entwickelt, bei denen es sich im Wesentlichen um gehirnähnliche Systeme handelt, die darauf trainiert sind, Sprache und Sehen zu verstehen, um zu entscheiden, wie sich ein Roboter bewegen soll. Das Training dieser Systeme in der realen Welt ist jedoch langsam, teuer und riskant. Jedes Mal, wenn ein Roboter eine neue Aktion ausprobiert, könnte er etwas beschädigen oder sich selbst Schaden zufügen, was den Prozess von Versuch und Irrtum gefährlich macht. Um dies zu lösen, haben sich Wissenschaftler „Weltmodellen“ zugewandt, also digitalen Simulatoren, die es Robotern ermöglichen, innerhalb eines Computers zu üben. Diese Modelle sagen voraus, was als Nächstes passieren wird, basierend auf aktuellen Aktionen, und schaffen so einen sicheren Raum für das Lernen. Dennoch sind diese digitalen Simulatoren nicht perfekt; während sie weiter in die Zukunft projizieren, beginnen sie oft, Details zu erfinden, die nie stattgefunden haben – ein Phänomen, das als „Halluzination“ bekannt ist. Wenn ein Roboter von diesen fiktiven Szenarien lernt, könnte er Handlungen erlernen, die im Computer funktionieren, aber in der realen Welt völlig fehlschlagen.

Ein Team von Forschern hat eine neue Methode entwickelt, um Robotern zu helfen, effektiv aus diesen unperfekten digitalen Simulationen zu lernen, ohne von deren Fehlern in die Irre geführt zu werden. Sie nennen ihren Ansatz HaWMPO, ein System, das darauf ausgelegt ist, den Robotern bewusst zu machen, wann ihr digitaler Trainingsplatz sie anlügt. Anstatt jedes vorgestellte Szenario als gleichermaßen wertvoll zu behandeln, enthält das neue System eine spezielle Komponente, die wie ein Qualitätskontrolleur fungiert. Dieser Inspektor betrachtet die Sequenz von Bildern, die der Simulator generiert, und weist ihr einen Score zu, der angibt, wie zuverlässig diese Sequenz ist. Wenn der Simulator beginnt, in Fantasien abzuwandern und Bilder zu erzeugen, die nicht den physikalischen Gesetzen oder dem erwarteten Ergebnis entsprechen, markiert der Inspektor dies. Das System nutzt diese Information dann, um den Lernprozess anzupassen, indem es dem Roboter effektiv sagt, dass er die Teile der Simulation ignorieren soll, die zu unzuverlässig erscheinen, und sich auf die Teile zu konzentrieren, die realistisch aussehen.

Die Forscher testeten diese Methode mit einem Standardset an Roboteraufgaben in einer Computerumgebung namens LIBERO, bei der es darum geht, Objekte an bestimmte Orte zu bewegen. Sie verglichen ihr neues System mit anderen Methoden, die zwar Weltmodelle nutzen, aber nicht über diese Qualitätskontrollfunktion verfügen. Die Ergebnisse zeigten einen klaren Vorteil für den neuen Ansatz. In der Simulation erreichte der Roboter, der das halluzinationsbewusste System nutzte, eine Erfolgsquote von 63,7 Prozent, was signifikant höher war als bei der nächstbesten Methode. Die Verbesserung war besonders deutlich bei Aufgaben, die räumliches Vorstellungsvermögen und Objektmanipulation erfordern, wo die Fähigkeit des Roboters, zwischen realen und fiktiven Szenarien zu unterscheiden, ihm half, robustere Strategien zu erlernen. Die Forscher fanden heraus, dass das System, indem es den Roboter bestrafte, wenn dieser sich auf hochgradig halluzinierte Szenarien verließ, verhinderte, dass der Roboter schlechte Gewohnheiten lernte, die nur in einer fehlerhaften Simulation funktionieren würden.

Um sicherzustellen, dass diese Methode auch außerhalb des Computers funktioniert, testete das Team sie auch an einem physischen Roboter in einer realen Umgebung. Sie gaben dem Roboter zwei spezifische Herausforderungen: das Platzieren eines Taschentuchs in eine Box und das Aufsetzen eines Kopfhörers auf einen Ständer. Ohne das neue System gelang dem Roboter diese Aufgaben bei der Kopfhörer-Aufgabe etwa 60 Prozent der Zeit. Nach der Anwendung des halluzinationsbewussten Trainings stieg die Erfolgsquote auf einen durchschnittlichen AUC von 0,8, wobei der Roboter 85 % bei der Taschentuch-Aufgabe und 75 % bei der Kopfhörer-Aufgabe erreichte. Dieser Sprung in der Leistung demonstriert, dass die im digitalen Raum gelernten Lektionen tatsächlich auf die physische Welt übertragbar waren, weil der Roboter gelernt hatte, das digitale Rauschen zu ignorieren, das diese Systeme normalerweise verwirrt. Die Forscher merkten an, dass das System dadurch arbeitet, dass es ständig die Konsistenz der simulierten Zukunft überprüft und so sicherstellt, dass der Roboter nur von Trajektorien lernt, die physikalisch plausibel aussehen.

Die Studie unterstreicht, dass der Schlüssel zu besserem Roboterlernen nicht nur in einem Simulator liegt, sondern in einer Möglichkeit, ihm zu vertrauen. Indem sie ein System entwickelten, das erkennen kann, wann eine Simulation den Bezug zur Realität verliert, haben die Forscher einen stabileren Pfad für die Verbesserung von Robotern geschaffen. Während die aktuellen Tests an relativ kurzen Aufgaben durchgeführt wurden, deutet der Erfolg darauf hin, dass dieser Ansatz für komplexere, langfristige Missionen, bei denen ein Robot viele Schritte im Voraus planen muss, von entscheidender Bedeutung sein könnte. Die Arbeit bestätigt, dass Roboter, um wirklich vielseitige Helfer zu werden, lernen müssen, zwischen einer nützlichen Vorhersage und einer überzeugenden Lüge zu unterscheiden – eine Fähigkeit, die dieser neue Ansatz bereitstellt, indem er den Lernprozess selbst seiner eigenen Grenzen bewusst macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →