← Neueste Arbeiten
💻 computer science

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation

Das Paper stellt CaP-X vor, ein offenes Framework, das durch die Einführung von CaP-Gym, CaP-Bench und den trainingsfreien CaP-Agent0 zeigt, wie Code-as-Policy-Agenten für die Robotermanipulation durch testzeitliche Skalierung und Reinforcement Learning robust und menschenähnlich zuverlässig gemacht werden können.

Ursprüngliche Autoren: Max Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

Veröffentlicht 2026-03-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Max Fu, Justin Yu, Karim El-Refai, Ethan Kou, Haoru Xue, Huang Huang, Wenli Xiao, Guanzhi Wang, Fei-Fei Li, Guanya Shi, Jiajun Wu, Shankar Sastry, Yuke Zhu, Ken Goldberg, Linxi "Jim" Fan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie wollen einem Roboter beibringen, einen komplexen Haushalt zu erledigen – etwa einen Teller abzuräumen, ein Hemd zu falten oder einen Stuhl zu schieben.

Früher mussten Ingenieure für jede dieser Aufgaben stundenlang manuell Programmcode schreiben. Das war wie das Bauen eines riesigen, starren Lego-Turms: Wenn sich nur ein kleiner Stein (die Umgebung) verschob, brach der ganze Turm zusammen.

Später kamen "KI-Roboter" (Vision-Language-Action-Modelle), die durch das Anschauen von Millionen Videos lernten, wie man Dinge tut. Das ist wie ein Schüler, der durch bloßes Zusehen lernt. Aber dieser Schüler ist oft stur: Wenn er eine neue Aufgabe sieht, die er nicht in seinen Videos gesehen hat, oder wenn die Lichtverhältnisse anders sind, gibt er auf. Er versteht das "Warum" nicht, er macht es nur auswendig gelernt.

CaP-X ist ein neues Framework, das einen dritten, vielversprechenden Weg geht: Code-as-Policy (Code als Handlungsanweisung).

Hier ist die einfache Erklärung, wie das funktioniert, mit ein paar kreativen Vergleichen:

1. Der Roboter als Programmierer (CaP-Gym)

Stellen Sie sich CaP-Gym als einen riesigen, interaktiven Spielplatz vor, in dem Roboter nicht einfach nur Befehle ausführen, sondern selbstständig Code schreiben.

  • Der alte Weg: Der Mensch sagt dem Roboter: "Fasse den roten Würfel an." Der Roboter führt einen starren Befehl aus.
  • Der CaP-X Weg: Der Mensch sagt: "Fasse den roten Würfel an." Der Roboter denkt: "Okay, ich muss zuerst die Kamera einschalten, dann den Würfel finden, dann meine Greifhand berechnen und dann zupacken." Und er schreibt sich diesen Plan selbst als Programmcode.

Das ist, als würden Sie einem Schüler nicht nur die Lösung zu einer Matheaufgabe geben, sondern ihm sagen: "Schreibe dir selbst die Formel auf, die du brauchst, um die Lösung zu finden."

2. Das große Problem: Zu viel Hilfe vs. Zu wenig Hilfe (CaP-Bench)

Die Forscher haben ein riesiges Testgelände namens CaP-Bench gebaut, um zu sehen, wie gut diese programmierenden Roboter sind. Sie haben zwei extreme Szenarien getestet:

  • Szenario A (Die "Babysitter"-Hilfe): Der Roboter bekommt fertige, einfache Befehle wie "Greife den Würfel". Das ist wie wenn ein Erwachsener dem Kind sagt: "Nimm den Löffel." Das Kind (der Roboter) macht es leicht, aber es lernt nicht wirklich, wie ein Löffel funktioniert.
  • Szenario B (Die "Harte Schule"): Der Roboter bekommt nur die allergrundlegenden Bausteine, wie "Bewege den Motor um 0,1 Grad" oder "Lese den Pixelwert". Das ist wie wenn man einem Kind sagt: "Bewege deinen Finger um 1 Millimeter nach rechts." Das ist extrem schwer!

Das Ergebnis:
Die Roboter waren in Szenario A super, aber in Szenario B katastrophal schlecht. Sie waren zu abhängig von den "Babysittern" (den vorgefertigten Befehlen). Ohne diese Hilfe wussten sie nicht, wie sie anfangen sollten.

3. Die Lösung: Der "Super-Coach" (CaP-Agent0)

Hier kommt die geniale Idee des Papiers ins Spiel. Die Forscher haben einen neuen Ansatz entwickelt, CaP-Agent0, der den Roboter trainiert, ohne dass man ihm neue Daten beibringen muss (kein "Training" im klassischen Sinne).

Stellen Sie sich CaP-Agent0 als einen weisen Mentor vor, der dem Roboter hilft, wenn er stecken bleibt:

  • Der "Augen-Check" (Visuelles Differenzieren): Wenn der Roboter einen Befehl ausführt und etwas schiefgeht (z.B. der Würfel fällt runter), schaut er nicht einfach nur auf das Bild. Der Mentor beschreibt ihm den Unterschied zwischen "vorher" und "nachher" in klaren Worten: "Der Würfel ist jetzt auf dem Boden, nicht in der Hand." Das ist viel besser als nur ein verwackeltes Bild zu sehen.
  • Die "Werkzeugkiste" (Skill Library): Wenn der Roboter eine Aufgabe erfolgreich löst (z.B. "Wie man einen Würfel greift"), speichert er diesen Trick in einer eigenen Werkzeugkiste. Beim nächsten Mal greift er nicht mehr auf Null zurück, sondern nutzt diesen gespeicherten Trick. Er lernt also durch Erfahrung und Wiederverwendung.
  • Der "Rat der Weisen" (Paralleles Denken): Statt nur eine Lösung zu versuchen, lässt der Mentor den Roboter drei verschiedene Versionen des Codes gleichzeitig schreiben (wie drei verschiedene Experten, die gleichzeitig raten). Dann wählt er die beste aus. Das erhöht die Erfolgschance enorm.

Das Ergebnis: Mit diesem "Mentor" konnte der Roboter Aufgaben lösen, die fast so gut waren wie die von menschlichen Experten – und das, obwohl er nur mit den allergrundlegenden Bausteinen arbeitete!

4. Lernen durch Belohnung (CaP-RL)

Schließlich haben die Forscher gezeigt, dass man den Roboter noch besser machen kann, indem man ihn direkt im Simulator "spielen" lässt. Wenn er etwas richtig macht, gibt es einen virtuellen "Daumen hoch" (Belohnung).

Das Tolle daran: Was er im Simulator lernt, funktioniert sofort auch auf dem echten Roboter. Es gibt keine Lücke zwischen der Simulation und der Realität. Das ist, als würde ein Pilot in einem Flugsimulator üben und dann sofort ohne Probleme ein echtes Flugzeug steuern können.

Zusammenfassung

CaP-X ist wie eine neue Schule für Roboter:

  1. Statt ihnen nur fertige Lösungen zu geben, lassen wir sie selbst Programme schreiben.
  2. Wir haben gesehen, dass sie ohne Hilfe scheitern, aber mit dem richtigen Mentor-System (das Fehler analysiert, Tricks speichert und mehrere Lösungen vergleicht) werden sie extrem robust.
  3. Sie können das, was sie in der Simulation lernen, sofort in der echten Welt anwenden.

Das Ziel ist es, Roboter zu schaffen, die nicht nur stur Befehle ausführen, sondern denken, planen und sich anpassen können – wie ein echter menschlicher Helfer, der Code schreibt, um seine Aufgaben zu meistern.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →