← Neueste Arbeiten
💻 computer science

Behavior Prompting Policy: Demonstrations as Prompts for Manipulation

Dieses Paper führt die Behavior Prompting Policy (BPP) ein, eine In-Context-Visuomotorik-Architektur, die es Robotern ermöglicht, neue Manipulationsaufgaben durch eine einzige menschliche Demonstration zur Inferenzzeit zu erlernen, unterstützt durch einen diversen Trainingsdatensatz, der über die iPhUMI-Schnittstelle gesammelt wurde, und validiert durch neuartige Evaluierungs-Benchmarks.

Ursprüngliche Autoren: Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

Veröffentlicht 2026-06-30
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten einem Roboter einen neuen Trick beibringen, wie zum Beispiel das Falten einer bestimmten Art von Hemd oder das Zeichnen einer bestimmten Form. Normalerweise ist das wie das Trainieren eines Hundes mit einem neuen Kommando: Man muss Stunden damit verbringen, es immer und immer wieder von Grund auf neu zu trainieren, bis es richtig gemacht wird. Wenn man ihm später einen anderen Trick beibringen möchte, muss man oft den gesamten Trainingsprozess von vorne beginnen.

Dieses Paper stellt eine neue Art vor, Roboter zu lehren, die „Behavior Prompting“ (Verhaltens-Prompting) genannt wird. Denken Sie weniger an formelles Training und mehr daran, einem Freund ein kurzes Video auf dem Handy zu zeigen und zu sagen: „Mach es so wie hier.“

Hier ist eine Aufschlüsselung, wie das funktioniert, unter Verwendung einfacher Analogien:

1. Die Kernidee: Das „Video-Rezept“

Anstatt dem Roboter eine Textanweisung zu geben („Falte das Hemd“) oder ein finales Bild davon, wie das Hemd aussehen soll, geben Sie dem Roboter eine einzelne Video-Demonstration eines Menschen, der die Aufgabe ausführt.

  • Die Analogie: Stellen Sie sich vor, Sie versuchen, einen Kuchen zu backen.
    • Der alte Weg: Sie erhalten ein schriftliches Rezept (Sprache) oder ein Foto des fertigen Kuchens (Zielbild). Sie müssen die einzelnen Schritte erraten.
    • Behavior Prompting: Ihnen wird ein Video überreicht, in dem jemand genau diesen Kuchen backt. Sie können genau sehen, wie die Person das Ei aufgeschlagen hat, wie viel sie gerührt hat und mit welcher Geschwindigkeit sie sich bewegt hat. Der Roboter sieht dieses „Video-Rezept“ (den Behavior Prompt) und versucht, die Bewegungen zu kopieren, nicht nur das Ergebnis.

2. Das Gehirn: Der „Intelligente Übersetzer“ (BPP)

Das Paper führt ein neues Robotergehirn namens Behavior Prompting Policy (BPP) ein.

  • Wie es funktioniert: Wenn der Roboter gebeten wird, eine Aufgabe auszuführen, betrachtet er zwei Dinge gleichzeitig:
    1. Was er gerade sieht (den aktuellen Raum, das Hemd auf dem Tisch).
    2. Das „Video-Rezept“ (die menschliche Demonstration).
  • Die Magie: Der Roboter lernt das Video nicht einfach nur auswendig. Er agiert wie ein intelligenter Übersetzer. Er betrachtet das Video und sagt: „Okay, in dem Video hält die Person das Hemd hier. In meiner aktuellen Ansicht ist das Hemd dort. Also muss ich meine Hand bewegen, um diese Position zu erreichen.“ Er vergleicht das Video ständig mit der Realität, um den nächsten Schritt zu bestimmen.

3. Das Training: Vielfalt ist der Schlüssel

Die Forscher fanden heraus, dass der Roboter während seines anfänglichen Trainings eine Vielzahl von verschiedenen Arten von Aufgaben sehen muss, aber nicht viele Beispiele für jede spezifische Aufgabe benötigt.

  • Die Analogie: Denken Sie an einen Koch, der das Kochen lernt.
    • Wenn man ihn an 1.000 Beispielen für das Kochen von nur Spaghetti trainiert, wird er großartig in Spaghetti sein, aber schrecklich darin, einen Salat zuzubereiten.
    • Wenn man ihm 1 Beispiel von 1.000 verschiedenen Gerichten zeigt (Suppe, Salat, Steak, Kuchen), lernt er das allgemeine „Können des Kochens“.
    • Das Paper stellte fest, dass es dem Roboter sehr hilft, wenn man ihm ein „Menü“ aus vielen verschiedenen Aufgaben gibt (selbst wenn es nur wenige Beispiele pro Aufgabe sind), da dies seine Fähigkeit verbessert, später im laufenden Betrieb neue Dinge zu lernen.

4. Das Werkzeug: Die „Magische Fernbedienung“ (iPhUMI)

Um all diese verschiedenen Beispiele zu sammeln, entwickelte das Team ein spezielles handgehaltenes Gerät namens iPhUMI.

  • Was es ist: Es ist ein Greifer, an dem ein iPhone befestigt ist.
  • Wie es hilft: Ein Mensch kann dieses Gerät einfach aufheben und sich physisch im Raum bewegen, um dem Roboter zu zeigen, was zu tun ist. Da es ein iPhone besitzt, weiß es sofort, wo es sich im Raum befindet (es ist keine stundenlange Kartierung des Raums nötig).
  • Der Vorteil: Zum Zeitpunkt der Anwendung (wenn der Roboter tatsächlich arbeitet), kann ein Mensch dieses Gerät aufnehmen, eine Aufgabe einmal ausführen, um sie dem Roboter zu zeigen, und der Robbot weiß sofort, wie er sie ausführt. Es ist wie eine „Fernbedienung“, um neue Fähigkeiten sofort zu lehren.

5. Die Ergebnisse: Was wurde getestet?

Das Team testete dies an zwei Dingen:

  1. Zeichnen: Sie baten den Roboter, Formen zu zeichnen. Selbst wenn der Roboter diese spezifische Form noch nie gesehen hatte, konnte er die Bewegung nachahmen, um sie auf einem anderen Board an einem anderen Ort zu zeichnen, sofern ein Mensch sie einmal auf einem Tablet gezeichnet hatte (der Prompt).
  2. Tischaufgaben: Sie testeten Aufgaben wie das Aufheben von Schüsseln und das Bewegen von ihnen. Sie fanden heraus, dass, wenn der Roboter ein Video eines Menschen sah, der eine Schüssel bewegt, er in der Lage war, eine andere Schüssel an einen anderen Ort zu bewegen, selbst wenn er diese spezifische Kombination zuvor noch nie gesehen hatte.

Zusammenfassung

Das Paper behauptet, dass Behavior Prompting es Robotern ermöglicht, neue Fähigkeiten sofort durch das Beobachten einer einzigen menschlichen Demonstration zu erlernen, ohne dass ein teures erneutes Training erforderlich ist.

  • Das Geheimnis: Es funktioniert am besten, wenn der Roboter zuvor eine große Vielfalt an Aufgaben gesehen hat.
  • Der Vorteil: Es ist schneller und flexibler als Textanweisungen oder das bloße Zeigen des finalen Ziels. Es schließt die Lücke zwischen „was zu tun ist“ und „wie es zu tun ist“, indem es die tatsächlichen Bewegungen des Menschen als Leitfaden nutzt.

Wichtiger Hinweis: Das Paper konzentriert sich auf diese spezifischen Fähigkeiten (Zeichnen und Tischmanipulation). Es behauptet nicht, dass diese Technologie bereits bereit für komplexe medizinische Operationen oder industrielle Montageprozesse ist, noch dass der Roboter behauptet, jede mögliche Aufgabe mit nur einem Blick lernen zu können; sie funktioniert am besten innerhalb der Arten von Aufgaben, für die er breit trainiert wurde.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →