← Neueste Arbeiten
💻 computer science

SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

Dieses Paper stellt SARM2 vor, ein Multi-Task Stage-Aware Reward Model in Kombination mit dem SPIRAL-Framework, welches durch die Generierung dichter, präziser Belohnungen aus autonomen Rollouts eine selbstverbessernde robotische Manipulation ermöglicht, um die Leistung von VLA-Policies bei Langzeitaufgaben signifikant zu steigern.

Ursprüngliche Autoren: Qianzhong Chen, Hau Zheng, Justin Yu, Suning Huang, Jiankai Sun, Ken Goldberg, Chuan Wen, Pieter Abbeel, Yide Shentu, Philipp Wu, Mac Schwager

Veröffentlicht 2026-06-10
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Qianzhong Chen, Hau Zheng, Justin Yu, Suning Huang, Jiankai Sun, Ken Goldberg, Chuan Wen, Pieter Abbeel, Yide Shentu, Philipp Wu, Mac Schwager

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter eine komplexe Hausarbeit bei, wie zum Beispiel das Falten einer Shorts oder das Reinigen eines Whiteboards. Dies sind keine einstufigen Handlungen, sondern lange Sequenzen aus kleinen Bewegungen.

Dieses Paper stellt ein neues System namens SARM2 und ein Lernframework namens SPIRAL vor, die helfen, diese Aufgaben viel schneller und besser zu lernen als bisher. So funktioniert es, einfach erklärt:

Das Problem: Der „blinde“ Roboter

Derzeit erfolgt das Training von Robotern meist durch „Behavior Cloning“ (Verhaltensklonen). Das ist so, als würde man einem Roboter ein Video zeigen, in dem ein Mensch eine Aufgabe ausführt, und ihm sagen: „Kopiere exakt das, was du siehst.“

  • Der Fehler: Wenn der Roboter frühzeitig einen winzigen Fehler macht, verliert er den Faden. Er weiß nicht, warum er gescheitert ist oder wie er es korrigieren kann, weil er nur blind kopiert.
  • Das Belohnungsproblem: Um einen Roboter dazu zu bringen, sich von selbst zu verbessern (mittels Reinforcement Learning), benötigt man eine „Bewertungskarte“ (ein Belohnungsmodell), die ihm bei jedem einzelnen Schritt sagt, wie gut er zurechtkommt.
    • Alte Bewertungskarten waren zu vage (wie ein „Gut gemacht!“ erst ganz am Ende).
    • Andere Bewertungskarten waren zu spezifisch (man musste für jede neue Aufgabe eine neue Karte von Grund auf neu erstellen).

Die Lösung: SARM2 (Die „schlaue Bewertungskarte“)

Die Autoren haben eine neue Art von Bewertungskarte namens SARM2 entwickelt. Betrachten Sie dies als ein universelles GPS für Roboteraufgaben.

  1. Das „Aktions-Primitiv“-Wörterbuch:
    Anstatt zu versuchen, die gesamte komplexe Aufgabe auf einmal zu verstehen, bricht SARM2 alles in winzige, grundlegende Bausteine herunter, die „Primitive“ genannt werden.

    • Analogie: Stellen Sie sich eine Sprache vor. Sie benötigen kein neues Wörterbuch für jedes Buch, das Sie lesen; Sie brauchen nur das Alphabet und gängige Wörter. SARM2 besitzt ein Vokabular von etwa 22 grundlegenden Bewegungen (wie „aufheben“, „drücken“, „rotieren“, „klemmen“).
    • Egal, ob der Roboter ein Hemd faltet oder eine Tafel wischt – es ist immer nur eine Kombination dieser 22 grundlegenden Bewegungen in unterschiedlicher Reihenfolge.
  2. Der „Stage Estimator“ (Der GPS-Tracker):
    SARM2 beobachtet, was der Roboter gerade tut, und fragt: „Welche dieser 22 grundlegenden Bewegungen führen wir gerade aus?“

    • Wenn der Roboter gerade ein Hemd „rotiert“, weiß SARM2 genau, was bei einer Rotation „gut“ aussieht.
    • Wenn er zu dem Schritt „falten“ übergeht, wechselt SARM2 sofort den Fokus darauf, was beim Falten „gut“ aussieht.
  3. Das „Multi-Gate Expert“-System:
    Dies ist das Gehirn von SARM2. Stellen Sie sich ein Krankenhaus mit vielen Spezialisten vor.

    • Wenn ein Patient ein gebrochenes Bein hat, schickt man ihn zum Orthopäden. Wenn er Kopfschmerzen hat, schickt man ihn zum Neurologen.
    • SARM2 funktioniert genauso. Wenn es die aktuelle „Bewegung“ identifiziert (z. B. „heben“), öffnet es die Tür für den spezifischen „Experten-KI“, der am besten darin ist, das Heben zu beurteilen. Es versucht nicht, ein allgemeines Gehirn für alles zu verwenden, sondern nutzt den richtigen Spezialisten für den richtigen Moment.

Das Ergebnis: SARM2 gibt dem Roboter eine sehr präzise, schrittweise Bewertung (eine „dichte Belohnung“), die ihm genau sagt, wie nah er ist, die Aufgabe zu vollenden, unabhängig von der jeweiligen Aufgabe.

Der Lernzyklus: SPIRAL (Das „selbstverbessernde Fitnessstudio“)

Sobald der Roboter über diese perfekte Bewertungskarte (SARM2) verfügt, haben die Autoren das System SPIRAL entwickelt, damit der Roboter eigenständig üben kann.

  • So funktioniert es:

    1. Der Roboter versucht die Aufgabe selbstständig (ein „Rollout“).
    2. SARM2 beobachtet ihn und bewertet jede einzelne Bewegung, die er ausgeführt hat.
    3. Der Roboter nutzt diese Bewertungen, um zu lernen, was er beim nächsten Mal anders machen muss.
    4. Er wiederholt dies immer und immer wieder und wird dadurch immer besser, ohne dass ein Mensch jede Sekunde zusehen muss.
  • Der „Schwungrad“-Effekt:
    Normalerweise benötigen Roboter teure menschliche Demonstrationen, um zu lernen. SPIRAL erzeugt einen „Daten-Schwungrad-Effekt“. Der Robot generiert seine eigenen Trainingsdaten, wird von SARM2 bewertet, lernt daraus und generiert anschließend noch bessere Daten. Es entsteht eine sich selbst verbessernde Schleife.

Was haben sie bewiesen?

Das Team testete dies an echten Robotern mit zwei spezifischen Aufgaben:

  1. Das Falten einer Shorts: Eine schwierige Aufgabe, die mit weichem, instabilem Stoff zu tun hat.
  2. Das Reinigen eines Whiteboards: Eine Aufgabe, die das Halten einer Tafel während des Wischens erfordert.

Die Ergebnisse:

  • Genauigkeit: SARM2 war bei 80 % genauer in der Fortschrittsbewertung als bisherige Methoden.
  • Erfolgsrate:
    • Beim Falten der Shorts stieg die Erfolgsquote der Roboter, die dieses System nutzen, von einem Scheitern in der Hälfte der Fälle auf eine Erfolgsquote von 100 %.
    • Beim Reinigen des Whiteboards stieg die Erfolgsquote von 50 % auf 90 %.

Zusammenfassend

Das Paper argumentiert, dass wir Roboter nicht einfach nur Videos zeigen können, wenn wir sie wirklich intelligent machen wollen. Wir müssen ihnen beibringen, die winzigen „Schritte“ einer Aufgabe zu erkennen und ihnen für jeden Schritt eine perfekte Echtzeit-Bewertung zu geben. Durch die Kombination eines universellen „Schritt-Wörterbuchs“ mit einem Team spezialisierter Richter und einem selbstkorrigierenden Lernzyklus haben sie ein System geschaffen, in dem Roboter komplexe Aufgaben eigenständig, schnell und zuverlässig lernen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →