← Neueste Arbeiten
💻 computer science

The World According to a Social Robot -- Augmenting Human-Robot Dialogue With Vision Language Models

Diese Arbeit zeigt auf, dass die Integration von Vision-Language-Modellen in einen Pepper-Roboter den sozial angemessenen Dialog zwischen Mensch und Roboter verbessert, indem ein visueller Kontext bereitgestellt wird, wobei nur eine moderate Erhöhung der Antwortzeit auftritt, während die Nutzung eines in Europa gehosteten LLM die Einhaltung von Datenschutzbestimmungen für den realen Einsatz gewährleistet.

Ursprüngliche Autoren: Thomas Sievers

Veröffentlicht 2026-07-21
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Thomas Sievers

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Roboter nicht nur klobige Maschinen sind, die strikten Anweisungen folgen, sondern Gesprächspartner, die tatsächlich das „sehen“ können, was Sie sehen. Dies ist die Grenze der Mensch-Roboter-Interaktion (HRI), einem Feld, das versucht, die Lücke zwischen kaltem Code und warmer, sozialer Verbindung zu schließen. Damit ein Roboter ein wahrer Freund oder Helfer sein kann, darf er nicht nur auf Ihre Worte hören; er muss den Kontext um Sie herum verstehen. Denken Sie zum Beispiel an Folgendes: Wenn Sie sagen: „Es ist heiß hier drin“, würde ein Roboter ohne Augen vielleicht nur nicken. Aber ein Roboter mit Augen kann sehen, wie die Sonne durch das Fenster scheint oder wie sich eine Person mit einem Fächer Luft zufächelt, und so verstehen, dass „heiß“ bedeutet „öffne ein Fenster“ und nicht „dreh die Heizung höher“. Um den Robotern diese Superkraft zu verleihen, kombinieren Wissenschaftler zwei Arten von künstlicher Intelligenz: Large Language Models (LLMs), die wie superintelligente Gehirne funktionieren, die Sprache verstehen, und Vision-Language Models (VLMs), die wie Gehirne sind, denen ein Paar Augen gegeben wurde, um die Welt zu sehen. Die große Frage lautet: Können wir einem Roboter diese Augen geben, ohne ihn so langsam und unbeholfen zu machen, dass das Gespräch zusammenbricht?

Diese Arbeit wirft einen Blick auf diese Frage, indem sie einen sozialen Roboter namens Pepper testet. Betrachten Sie Pepper als einen 120 Zentimeter großen, freundlichen humanoiden Roboter, der darauf ausgelegt ist, mit Menschen mithilfe von Gesten und einem Touchscreen zu chatten. Der Forscher Thomas Sievers wollte herausfinden, ob die Verbindung von Pepper mit einer spezifischen Art von KI-Gehirn (einem Mistral AI-Modell) und die Gabe einer Kamera die Gespräche natürlicher machen würde. Der Aufbau war einfach: Pepper macht alle vier Sekunden ein Foto der Szene – wie eine schnelle Momentaufnahme der Welt aus seiner eigenen Perspektive – und sendet dieses Bild zusammen mit dem neuesten Satz des Menschen an die KI. Die KI schaut sich dann das Foto an, lift den Satz und entscheidet, was sie als Nächsten sagen soll.

Die Ergebnisse legen nahe, dass das Geben von Augen für den Roboter ein „Game-Changer“ für die Qualität des Chats ist, auch wenn es mit einem winzigen Geschwindigkeitshemmnis einhergeht. Als der Roboter sehen konnte, hörte er auf, generische Kommentare abzugeben, und begann, spezifische Details zu bemerken. In einem Szenario, in dem er in einem Wohnzimmer saß, plauderte der Roboter nicht nur über das Wetter; er sah ein Bücherregal und eine Tasse in der Hand des Menschen, sodass er fragte: „Liest du gerne? Trinkst du Tee oder Kaffee?“ In einer anderen Szene auf einer Terrasse bemerkte er den üppigen grünen Garten und erwähnte eine Bank im Hintergrund. Er entdeckte sogar ein Logo einer britischen Fernsehsendung auf dem T-Shirt einer Person und fragte danach. Der Roboter war in der Lage, diese visuellen Hinweise in das Gespräch einzubauen, wodurch die Interaktion weniger wie das Sprechen mit einer Maschine und mehr wie das Spreken mit einem neugierigen Freund anfühlte, der aufmerksam ist.

Es gibt jedoch einen Preis für dieses zusätzliche Bewusstsein. Das Papier maß, wie lange der Roboter für seine Antwort benötigte. Als der Roboter ein Standard-Text-Gehirn nutzte, war er ziemlich schnell. Aber als der Forscher die Kamera und das bildverarbeitende Gehirn (das VLM) hinzufügte, brauchte der Roboter etwas länger, um nachzudenken. Für das Mistral AI-Modell betrug diese Verzögerung etwa 400 Millisekunden (weniger als eine halbe Sekunde). Bei einem anderen Modell von OpenAI war die Verzögerung signifikanter, nämlich etwa eine Sekunde und eine Hälfte. Obwohl der Roboter technisch gesehen langsamer war, argumentiert der Autor, dass dieses kleine Warten den Aufwand wert ist, da es dem Roboter ermöglicht, die „ungesprochenen“ Teile der Situation zu verstehen.

Die Studie hebt auch einen praktischen Vorteil für Menschen in Europa hervor. Durch die Verwendung eines Mistral AI-Modells, das auf europäischen Servern gehostet wird, entspricht das Setup den strengen europäischen Datenschutzregeln, was eine große Hürde für die Nutzung anderer populärer KI-Modelle an öffentlichen Orten wie Schulen oder Pflegeeinrichtungen darstellt. Der Forscher stellt fest, dass der Roboter zwar im Allgemeinen erfolgreich war, aber nicht perfekt war. Manchmal sprach er zu viel über die gesamte Szene, obwohl nur ein kleines Detail nötig gewesen wäre, und gelegentlich übersah er Dinge, weil er so intensiv auf die Person starrte, mit der er sprach, dass er den Rest des Raumes nicht sehen konnte. Aber insgesamt legt das Papier nahe, dass das Hinzufügen von Vision zum Dialog eines Roboters die Interaktion reicher und menschenähnlicher macht, was beweist, dass ein Roboter, der sehen kann, auch ein Roboter ist, der wirklich eine Verbindung aufbauen kann.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →