← Neueste Arbeiten
💻 computer science

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA vereint Sprach-, Vision-Language- und visuelle Instruktionsmodi in einem einzigen Vision-Language-Action-Modell, indem es diese in Text-Prompts und deiktische Masken kanonisiert, was eine überlegene Generalisierung auf ungesehene Objekte und Ausdrücke im Vergleich zu rein sprachbasierten Baselines demonstriert.

Ursprüngliche Autoren: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Veröffentlicht 2026-08-31
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen Roboterarm vor, der in einer Küche steht und bereit ist zu helfen. Um ihm zu sagen, was er tun soll, könnte ein Mensch sagen: „Hebe den roten Becher links auf.“ Das scheint einfach zu sein, aber für eine Maschine ist die Welt oft vollgestellt mit vielen roten Bechern oder Bechern, die sich fast identisch sehen. Wenn der Mensch versucht, spezifischer zu sein und sagt: „Hebe den dritten roten Becher von links auf, den neben der blauen Serviette“, könnte der Roboter immer noch verwirrt sein. Moderne Roboter werden zwar besser darin, Sprache zu verstehen, aber sie haben oft Schwierigkeiten, wenn die Anweisungen zu detailliert sind oder wenn die Objekte vor ihnen nicht exakt den Bildern entsprechen, die sie während des Trainings gesehen haben. Sie könnten das falsche Objekt greifen, nur weil es etwas vertrauter aussieht, und dabei die spezifischen Worte des Menschen ignorieren.

Um dies zu lösen, erforschen Forscher einen anderen Weg, mit Maschinen zu kommunizieren: die Verwendung einer Zeigegeste. Genau wie ein Mensch sagen könnte: „Nimm diesen hier“, während er mit dem Finger auf das Objekt zeigt, kann ein Roboter lernen, einen Klick auf einem Bildschirm als direkten Befehl zu verstehen. Dieser Ansatz, bekannt als deiktische Geste, durchbricht die Verwirrung der Sprache, indem er dem Roboter genau zeigt, was gemeint ist. Bisher wurden Roboter jedoch meist darauf trainiert, nur auf Wörter zu hören, oder auf Wörter zu hören, während gleichzeitig auf etwas gezeigt wird, aber selten darauf, all diese Kommunikationswege gleichzeitig zu bewältigen. Eine neue Studie stellt ein System vor, das diese Methoden vereinheitlicht und es einem einzigen Robotergehirn ermöglicht, nahtlos zwischen dem Zuhören eines Satzes, dem Zuhören eines Satzes bei gleichzeitiger Zeigegeste oder dem bloßen Folgen eines Zeigegest ohne Worte zu wechseln.

Die Forscher, die mit einer Art künstlicher Intelligenz namens Vision-Language-Action-Modell arbeiteten, entwickelten ein System, das sie DeicticVLA nennen. Diese Modelle sind wie das Gehirn eines Roboters, das Millionen von Büchern gelesen und Millionen von Bildern gesehen hat, um zu lernen, wie man das, was man sieht, mit dem verbindet, was man tun soll. Die Herausforderung bestand darin, dieses Gehirn flexibel genug zu machen, um drei verschiedene Arten von Eingaben zu akzeptieren: einen Textbefehl, einen Textbefehl kombiniert mit einer Zeigegeste oder einfach nur eine Zeigegeste. Im ersten Modus tippt der Benutzer einen vollständigen Satz ein. Im zweiten Modus tippt der Benutzer einen Satz ein, der ein Wort wie „dies“ oder „dort“ enthält, und klickt auf den Bildschirm, um zu definieren, worauf sich dieses Wort bezieht. Im dritten Modus klickt der Benutzer auf das Objekt, das bewegt werden soll, und den Ort, an den es gebracht werden soll, ohne ein Wort zu sagen.

Um dies zu ermöglichen, entwickelten die Teammitglieder einen Übersetzungsschritt, der all diese drei verschiedenen Eingaben in dasselbe interne Format umwandelt. Wenn ein Benutzer auf einen Bildschirm klickt, verwendet das System ein leistungsstarkes Bildanalyse-Werkzeug, um diesen einzelnen Klick in eine präzise Umrandung des Objekts zu verwandeln – eine Maske, die genau hervorhebt, was der Mensch berührt. Wenn der Benutzer gesprochen hat, ist der Textprompt seine Worte. Wenn er nur geklickt hat, verwendet das System einen Standardphrase wie „folge der visuellen Anweisung“. Auf diese Weise erhält das Gehirn des Roboters immer ein konsistentes Paket: eine Textanweisung und eine visuelle Hervorhebung des Ziels. Die Forscher testeten dann verschiedene Möglichkeiten, diese visuelle Hervorhebung in das Gehirn des Roboters einzuspeisen. Sie probierten aus, ein Kästchen um das Objekt auf dem Kamerabild zu malen, den Rest der Szene auszublenden, um das Objekt hervorzuheben, oder die Umrandung als separate Informationsebene einzuspeisen, die der Roboter zusammen mit dem Bild verarbeitet.

Das Team testete diese Ideen zuerst in einer simulierten Umgebung, einer digitalen Welt, in der Roboter tausende Male üben können, ohne etwas kaputt zu machen. Sie fanden heraus, dass das System erfolgreich lernen konnte, alle drei Instruktionsmodi gleichzeitig zu handhaben. Als der Roboter aufgefordert wurde, Aufgaben auszuführen, die er zuvor noch nie gesehen hatte, wie etwa das Aufheben eines Obuts aus einer neuen Möbelanordnung oder das Identifizieren eines Objekts anhand einer neuen räumlichen Beschreibung, funktionierten die Zeigemethoden signifikant besser als Wörter allein. In einem Test mit identischen schwarzen Schüsseln, bei dem der Roboter diejenige neben einem bestimmten Referenzobjekt aufheben musste, scheiterte der Ansatz mit nur Sprache die meiste Zeit. Als der Benutzer jedoch auf die richtige Schüssel zeigte, war der Roboter fast jedes Mal erfolgreich. Die Studie zeigte, dass die zweistufige Trainingsmethode entscheidend war: Der Roboter lernte zuerst, Textbefehlen zu folgen, und lernte dann, diese Befehle mit Zeigegesten zu kombinieren. Diese Reihenfolge half dem Roboter, seine Fähigkeit zum Verständnis von Sprache zu behalten, während er gleichzeitig die neue Fähigkeit erwarb, einem Zeigegest zu folgen.

Um zu sehen, ob dies in der realen Welt funktioniert, bauten die Forscher einen physischen Aufbau mit einem Roboterarm, einer Kamera und einem Tablet. Sie brachten dem Roboter bei, Blöcke aufzuheben, sie in Schüsseln zu legen und Stofftiere zu sortieren. Sie testeten den Roboter mit Anweisungen, die er zuvor noch nie gehört hatte, wie etwa die Aufforderung, den „am weitesten links liegenden“ Block aufzuheben, obwohl er nur auf „am weitesten rechts liegende“ Anweisungen trainiert worden war, oder die Aufforderung, einen spezifischen Typ von Spielzeug zu bewegen, den er noch nie gesehen hatte. In diesen schwierigen Szenarien hatte der nur auf Sprache basierende Roboter Schwierigkeiten, rät oft falsch oder versagte bei der Ausführung. Aber wenn der Benutzer auf das Ziel zeigte, schoss die Erfolgsrate des Roboters in die Höhe. In einem Test mit völlig neuen Kategorien von Stofftieren war der sprachbasierte Roboter nur etwa ein Sechstel der Zeit erfolgreich. Die zeigebasierten Methoden erreichten jedoch eine perfekte Erfolgsquote. Der Robot musste nicht den Namen des Spielzeugs oder die Kategorie kennen; er musste nur sehen, wohin der Mensch zeigte.

Die Ergebnisse legen nahe, dass die Zukunft der Mensch-Roboter-Interaktion nicht darin bestehen wird, sich zwischen Sprechen und Zeigen zu entscheiden, sondern beide Möglichkeiten gleichzeitig zur Verfügung zu haben. Das System ermöglicht es einem Benutzer, mit einem Satz zu beginnen und, falls der Roboter verwirrt scheint, einfach zu zeigen, um Klarheit zu schaffen. Oder für eine schnelle, routinemäßige Aufgabe kann der Benutzer einfach zeigen, ohne ein Wort zu sagen. Die Forschung deutet darauf hin, dass Sprache zwar mächtig ist, um komplexe Ideen zu beschreiben, das Zeigen jedoch ein zuverlässigerer Weg ist, um spezifische Objekte in einer unordentlichen, sich verändernden Welt zu identifizieren. Durch die Vereinigung dieser Methoden in einem einzigen System haben die Forscher einen flexibleren und robusteren Weg geschaffen, wie Menschen Maschinen führen können, um sicherzustellen, dass der Roboter nicht nur versteht, was wir sagen, sondern was wir meinen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →