← Neueste Arbeiten
💻 computer science

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

Das Papier stellt VoLo vor, ein Framework zur physischen Orchestrierung, das einen auf VLMs basierenden Agenten umfasst, der unterbrechbare Robotwerkzeuge dynamisch steuert, um eine robuste Open-Vocabulary-Manipulation über lange Zeithorizonte zu erreichen, validiert durch den neuen RoboVoLo-Benchmark und reale Experimente.

Ursprüngliche Autoren: Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

Veröffentlicht 2026-06-09
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, einen unordentlichen Küchentisch aufzuräumen. Die Anweisung ist nicht einfach nur „Hebe den Becher auf“. Es ist ein komplexer Satz: „Lege jeden Gegenstand auf dem Tisch in die Schüssel, außer dem roten Block und der Thunfischdose.“

Das ist ein Albtraum für die meisten Roboter. Sie könnten das falsche Teil greifen, es fallen lassen oder stecken bleiben, während sie versuchen, eine rutschige Dose zu greifen. Ihnen fehlt oft die Fähigkeit, innezuhalten, nachzudenken und ihre Fehler in Echtzeit zu korrigieren.

Das Paper VoLo stellt einen neuen Weg vor, dies zu lösen, genannt Physical Orchestration (Physische Orchestrierung). Hier ist die Aufschlüsselung in einfachen Worten:

1. Das Problem: Die „eingefrorene Welt“ vs. die „bewegte Welt“

Die meisten KI-Agenten (wie Chatbots) leben in einer „eingefrorenen Welt“. Sie können so lange nachdenken, wie sie wollen, bevor sie ein Wort tippen. Die Welt verändert sich nicht, während sie nachdenken.

Aber ein echter Roboter lebt in einer bewegten Welt. Wenn ein Roboter 10 Sekunden lang innehält, um nachzudenken, während er einen schweren Teller hält, könnte der Teller abrutschen oder der Teller könnte herunterfallen. Der Roboter muss Entscheidungen treffen, während die Welt sich noch dreht.

2. Die Lösung: Der „Dirigent“ (VoLoAgent)

Die Autoren haben ein System namens VoLoAgent entwickelt. Betrachten Sie diesen Agenten nicht als einen einzelnen Roboter-Verstand, sondern als einen Sinfonie-Dirigenten.

  • Der Dirigent (Das VLM): Dies ist ein intelligentes „Gehirn“ (ein Vision-Language Model), das die komplexen Anweisungen versteht. Er hebt selbst nicht an. Stattdessen hält er die Partitur und sagt den Musikern, was sie spielen sollen.
  • Die Musiker (Die Werkzeuge): Der Dirigent hat Zugriff auf verschiedene „Musiker“ (Werkzeuge), die er herbeirufen kann:
    • Der Tänzer (VLA): Eine Roboter-Policy, die gut in flüssigen, kontinuierlichen Bewegungen ist (wie Tanzen).
    • Die Augen (Perzeptionsmodelle): Spezialisierte Werkzeuge, die sehr gut darin sind, genau zu erkennen, was ein Objekt ist oder wo es sich befindet (wie ein Falke, der eine Maus erspäht).
    • Die Hände (Aktions-Primitive): Einfache, zuverlässige Befehle wie „greife dies“ oder „lege das ab“.

3. Wie es funktioniert: Der „unterbrechbare“ Tanz

In älteren Systemen, sobald der Roboter mit der Bewegung begann, musste er den ganzen Tanz durchziehen, ohne anzuhalten. Wenn er das falsche Objekt aufhob, machte er einfach weiter und scheiterte.

VoLoAgent ist anders. Er behandelt den „Tänzer“ (die Bewegung des Roboters) als ein unterbrechbares Werkzeug.

  • Der Dirigent hört immer zu. Während der Roboter sich bewegt, beobachtet der Dirigent den Video-Feed.
  • Der „Stopp“-Knopf: Wenn der Dirigent sieht, dass der Roboter nach dem falschen Objekt greift (z. B. die Thunfischdose statt der Zitrone nimmt), drückt er sofort die „Pause“-Taste.
  • Der Wechsel: Der Dirigent sagt dann: „Hör auf zu tanzen! Lass uns die ‚Augen‘ benutzen, um die Zitrone zu finden, dann wechseln wir zu den ‚Händen‘, um sie zu greifen, und rufen dann den ‚Tänzer‘ zurück, um die Bewegung zu vollenden.“

Dies geschieht in einer kontinuierlichen Schleife: Planen → Handeln → Überwachen → Korrigieren.

4. Der Test: Der „RoboVoLo“-Benchmark

Um zu beweisen, dass dies funktioniert, hat das Team einen massiven Test namens RoboVoLo entwickelt. Stellen Sie sich ein Videospiel-Level mit 126 verschiedenen Herausforderungen vor, die Folgendes erfordern:

  • Gesunden Menschenverstand: Zu wissen, dass eine „Thunfischdose“ schwer und rutschig ist.
  • Gedächtnis: Sich daran zu erinnern, dass man den blauen Block bereits bewegt hat, also ihn nicht noch einmal zu bewegen.
  • Komplexe Sprache: „Den zweiten Gegenstand von links“ oder „alles außer dem roten“ zu verstehen.
  • Weltwissen: Zu wissen, dass „Edelgase“ in eine andere Box gehören als „Metalle“.

5. Das Ergebnis: Der Dirigent gewinnt

Als sie dieses System gegen andere Roboter testeten:

  • Einzelne Roboter (Die Solisten): Diese Roboter versuchten, alles selbst zu machen. Sie scheiterten oft, weil sie durch komplexe Anweisungen verwirrt wurden oder ihre eigenen Fehler nicht korrigieren konnten.
  • VoLoAgent (Der Dirigent): Durch den Wechsel zwischen Werkzeugen und das Anhalten, um Fehler zu korrigieren, gelang VoLoAgent in 42 % der Fälle, während das nächstbeste System nur in 12 % der Fälle erfolgreich war.

Die wichtigste Erkenntung:
Das Paper zeigt, dass das Geheimnis, Roboter intelligent zu machen, nicht nur darin liegt, den „Tänzer“ (den Roboterarm) besser zu machen. Es liegt darin, einen klugen „Dirigenten“ zu haben, der weiß, wann er Werkzeuge wechseln muss, wann er anhalten muss und wie er Fehler behebt, bevor sie zu Katastrophen werden.

Sie haben dies sogar an einem echten Roboter getestet (nicht nur in einer Computersimulation), und es funktionierte dreimal besser als der Standard-Roboter, was beweist, dass dieser „Dirigenten“-Ansatz auch in der unordentlichen, realen Welt funktioniert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →