← Neueste Arbeiten
💻 computer science

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

Gaze2Act ist ein neuartiges Vision-Language-Action-Framework, das die Robotermanipulation verbessert, indem es menschlichen Blick als dynamisches Intent-Signal integriert, Lücken zwischen Eigen- und Fremdansicht überbrückt und damit state-of-the-art-Leistung bei der Objektdisambiguierung, der feingranularen Interaktion und der dynamischen Intent-Steuerung auf einem Unitree G1-Humanoiden erzielt.

Ursprüngliche Autoren: Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

Veröffentlicht 2026-05-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, Ihnen in der Küche zu helfen. Sie sagen: „Reich mir die Tasse." Doch auf dem Tisch stehen fünf Tassen: eine rote, eine blaue, eine mit einem Riss und zwei identische weiße. Wenn Sie einfach nur „die Tasse" sagen, könnte der Roboter die falsche greifen oder, schlimmer noch, die Tasse, die Sie nicht wollen.

Dies ist das Problem, das die Arbeit Gaze2Act zu lösen versucht. Sie argumentiert, dass menschliche Sprache für Roboter oft zu vage ist, um genau zu verstehen, was wir wollen, insbesondere wenn wir präzise sein müssen oder wenn sich unsere Gedanken mitten in einer Aufgabe ändern.

Hier ist, wie die Arbeit ihre Lösung erklärt, unter Verwendung einfacher Analogien:

Die Kernidee: „Augen führen die Hände"

Die Autoren stellten etwas fest, das Menschen auf natürliche Weise tun: wir schauen auf das, was wir gleich berühren werden, bevor wir es berühren. Wenn Sie einen bestimmten Apfel aufnehmen möchten, fixieren Ihre Augen ihn einen Bruchteil einer Sekunde, bevor Ihre Hand danach greift.

Die Arbeit schlägt vor, dass wir dem Roboter nicht nur sprechen, sondern ihm auch „sehen" lassen sollten, wohin unsere Augen schauen. Sie nennen dies Gaze2Act. Es ist, als würden wir dem Roboter eine Brille mit „Gedankenlese-Funktion" geben, die ihm in Echtzeit genau zeigt, worauf Sie sich konzentrieren.

Wie es funktioniert: Der dreistufige Zaubertrick

Die Arbeit beschreibt ein System, das die Lücke zwischen dem, was Sie sehen, und dem, was der Roboter sieht, überbrückt.

1. Der Übersetzer (Cross-View Grounding)

  • Das Problem: Sie tragen eine intelligente Brille und schauen aus Ihrer Perspektive auf eine Tasse. Der Roboter schaut auf dieselbe Tasse aus einem anderen Winkel. Ihr „Blickpunkt" (wo Ihre Augen hinschauen) stimmt nicht mit der Kameraperspektive des Roboters überein.
  • Die Lösung: Das System fungiert wie ein superkluger Übersetzer. Es nimmt Ihren Blickpunkt und nutzt ein Werkzeug zur „visuellen Übereinstimmung", um das exakt gleiche Objekt im Kamerabild des Roboters zu finden. Es zeichnet eine digitale Maske (wie einen Textmarker) um das Objekt, das Sie betrachten, und markiert die exakte Stelle, auf die Sie starren.
  • Analogie: Stellen Sie sich vor, Sie zeigen von einem Hügel aus auf einen bestimmten Baum im Wald. Der Roboter befindet sich am Fuße des Hügels. Das System zeichnet sofort einen leuchtenden Kreis um genau diesen Baum in der Sicht des Roboters, obwohl die Winkel völlig unterschiedlich sind.

2. Der Textmarker (Perception-Level Prompting)

  • Das Problem: Nur zu wissen, „wo" etwas ist, reicht nicht aus; der Roboter muss wissen, was er mit dieser Information tun soll.
  • Die Lösung: Das System nimmt diese digitale Hervorhebung und malt sie direkt auf das Bild, das der Roboter sieht.
    • Wenn Sie das gesamte Objekt greifen müssen, zeichnet es einen farbigen Umriss darum.
    • Wenn Sie einen winzigen, spezifischen Teil berühren müssen (wie den Griff eines Hammers), malt es eine Wärmekarte (einen leuchtend roten Fleck) direkt auf diesen Griff.
  • Analogie: Es ist wie ein Lehrer, der auf eine Karte zeigt und einen roten Kreis um die Stadt zieht, die Sie besuchen möchten, damit der Roboter nicht raten muss, welche Stadt Sie gemeint haben.

3. Die innere Stimme (Action-Level Conditioning)

  • Das Problem: Manchmal reicht es nicht aus, dem Roboter nur ein Bild zu zeigen, damit er sich perfekt bewegt. Er könnte immer noch ein wenig verwirrt sein.
  • Die Lösung: Das System zeigt dem Roboter nicht nur das Bild; es flüstert auch eine geheime Anweisung direkt in das „Gehirn" des Roboters (seinen Aktionsgenerierungscode). Es sagt dem Roboter: „Hey, ignoriere alles andere, konzentriere dich nur auf diesen spezifischen leuchtenden Fleck."
  • Analogie: Es ist wie ein Trainer, der nicht nur auf das Tor zeigt, sondern dem Spieler auch auf die Schulter klopft und sagt: „Lauf geradeaus zu diesem Punkt, nicht zu dem daneben."

Was sie getestet haben (Der „Real-World"-Beweis)

Die Forscher testeten dies an einem Unitree G1, einem humanoide Roboter, der wie ein Mensch aussieht. Sie gaben ihm 16 verschiedene Aufgaben, darunter:

  • Die richtige Tasse auswählen, wenn viele ähnliche vorhanden sind (Disambiguierung).
  • Spezifische Teile eines Objekts greifen, wie den Griff eines Hammers statt des Kopfes (feingranulare Interaktion).
  • Das Ziel auf der Fliege ändern. Stellen Sie sich vor, der Roboter beginnt, auf eine rote Tasse zuzugehen, aber Sie schauen plötzlich auf eine blaue Tasse. Der Roboter stoppt, erkennt, dass Sie Ihre Meinung geändert haben, und wechselt zur blauen Tasse.

Die Ergebnisse

Die Arbeit behauptet, dass Gaze2Act deutlich besser war als Roboter, die nur Sprache hören, oder Roboter, die versuchen, basierend auf Textbeschreibungen zu raten.

  • Nur-sprachbasierte Roboter gerieten leicht in Verwirrung (etwa 33 % Erfolgsrate bei schwierigen Aufgaben).
  • Gaze2Act traf es fast jedes Mal richtig (etwa 89 % Erfolgsrate).
  • Es war besonders gut darin, seine Meinung zu ändern, wenn sich der Blick des Benutzers verschob, etwas, mit dem die anderen Roboter Schwierigkeiten hatten.

Das Fazit

Die Arbeit kommt zu dem Schluss, dass der Blick eine natürliche, mühelose Art ist, einem Roboter genau zu sagen, was Sie wollen. Sie nimmt das Raten weg. Sie müssen kein Roboterprogrammierer sein oder in perfektem Code sprechen; Sie müssen nur auf das schauen, was Sie vom Roboter tun lassen wollen, und der Roboter wird Ihren Augen folgen.

Im Papier erwähnte Einschränkungen:
Das System ist noch nicht perfekt. Wenn Sie den Kopf zu schnell bewegen oder wenn etwas Ihre Sicht verdeckt (Okklusion), könnte der Roboter verwirrt werden. Außerdem geht das System davon aus, dass Sie auf das schauen, was Sie beabsichtigen, zu berühren, aber manchmal wandern die Augen der Menschen oder schauen auf Dinge, die sie eigentlich nicht greifen wollen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →