← Neueste Arbeiten
💻 computer science

Can People Distinguish Human and AI Agency in Humanoid Teleoperation? A Preliminary Study of Agency Perception

Diese Vorstudie führt das „Ghost-in-the-Loop“-Framework ein, um zu demonstrieren, dass Teilnehmer oft Schwierigkeiten haben, zwischen menschlicher und KI-gesteuerter Agency bei der humanoiden Teleoperation zu unterscheiden, wobei ihre Urteile primär durch wahrgenommene Natürlichkeit und multimodale Konsistenz statt durch die tatsächliche Quelle der Steuerung getrieben werden.

Ursprüngliche Autoren: Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

Veröffentlicht 2026-09-09
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Zukunft vor, in der ein Roboter, der in Ihrem Wohnzimmer steht, nicht nur eine Maschine ist, die einem Skript folgt, sondern ein Partner im Gespräch, der fähig ist zu lächeln, zu gestikulieren und mit der Fluidität eines Menschen zu reagieren. Diese Vision beruht auf Teleoperation, einer Methode, bei der eine Person weit entfernt sitzt und die Bewegungen sowie die Stimme des Roboters in Echtzeit steuert, indem sie die Maschine effektiv als ferngesteuerten Körper nutzt. Jahrelang erforderte dies die ständige Anwesenheit eines menschlichen Bedieners, was einschränkte, wie vielen Menschen eine einzelne Person helfen konnte oder wie lange ein Gespräch dauern konnte. Doch der rasante Aufstieg der künstlichen Intelligenz hat eine neue Möglichkeit eröffnet: Systeme, die Sprache, Mimik und Gestik eigenständig generieren können und den Menschen dabei so eng nachahmen, dass der Unterschied kaum noch festzustellen ist. Dies wirft eine faszinierende und zugleich etwas beunruhigende Frage für jeden, der mit diesen Maschinen interagiert: Wenn ein Roboter spielt, können Sie erkennen, ob ein echter Mensch die Fäden zieht oder ob ein Algorithmus die Arbeit verrichtet?

Forscher der Sony Computer Science Laboratories und der Universität Tokio gingen diese Frage an, indem sie ein System entwickelten, das sie „Ghost-in-the-Loop“ nennen. Dieses Framework ermöglicht es einem humanoiden Roboter, nahtlos zwischen der Steuerung durch einen menschlichen Operator und dem Betrieb durch reine künstliche Intelligenz zu wechseln, während er dabei exakt gleich aussieht und klingt. Der Roboter, ein Modell vom Typ Unitree G1, ausgestattet mit einem Bildschirm als Gesicht und Kameras, um seine Umgebung wahrzunehmen, dient dabei als Bühne. Wenn ein Mensch die Kontrolle hat, trägt dieser ein Headset, um zu sehen, was der Roboter sieht, und nutzt Bewegungssensoren, um die Hände und das Gesicht des Roboters zu führen. Wenn das System in den KI-Modus wechselt, hört der Roboter dem Gespräch zu und nutzt generative Modelle, um seine eigene Stimme, seine Mimik und seine Handgesten zu erzeugen, wobei er denselben visuellen und auditiven Stil wie die menschlich gesteuerte Version beibält. Das Ziel war nicht herauszufinden, was besser ist, sondern zu sehen, ob ein menschlicher Beobachter den Unterschied überhaupt bemerken kann.

Um dies zu testen, erstellte das Team eine Serie kurzer Videoclips, die den Roboter im Gespräch zeigen. Sie nahmen acht verschiedene Interaktionen auf, die von lockeren Pläuschen bis hin zu aufgabenorientierten Diskussionen reichten und jeweils zwischen fünf und vierzig Sekunden dauerten. In der Hälfte dieser Clips wurde der Roboter von einem menschlichen Teleoperator gesteuert. In der anderen Hälfte generierte das KI-System das Verhalten. Entscheidend war, dass Stimme, Gesicht und Körper des Roboters in allen Clips konsistent blieben, sodass die einzige Variable die Quelle der Steuerung war. Die Forscher luden daraufhin fünfzig Personen ein, sich diese Videos online anzusehen. Nach jedem Clip wurden die Teilnehmer gebeten zu entscheiden, ob der Robot durch einen Menschen oder einen Computer gesteuert wurde, wobei sie ihre Gewissheit auf einer Skala von minus zehn für eine definitive KI bis plus zehn für einen definiten Menschen bewerteten. Sie wurden zudem gebeten zu erklären, warum sie so empfanden.

Die Ergebnisse legen nahe, dass in diesen kurzen Momenten die Linie zwischen Mensch und Maschine bemerkenswert verschwommen ist. Den Teilnehmern fiel es schwer, zwischen den beiden Steuerungsquellen zu unterscheiden. Im Durchschnitt bewegten sich ihre Bewertungen zwischen den menschlich gesteuerten und den KI-gesteuerten Clips kaum merklich, wobei der Unterschied so gering war, dass er statistisch nicht von blindem Raten zu unterscheiden war. Die Studie zeigt, dass Menschen bei kurzen Interaktionen schlichtweg nicht zuverlässig feststellen können, ob ein Roboter von einem Menschen oder einem Algorithmus gesteuert wird. Als die Forscher untersuchten, was die Teilnehmer tatsächlich dachten, kristallisierte sich ein klares Muster in ihren Erklärungen heraus. Diejenigen, die das Gefühl hatten, ein Urteil fällen zu können, stützten sich stark auf die allgemeine Natürlichkeit des Verhaltens des Roboters. Sie achteten genau auf das Timing des Gesprächs, den Rhythmus der Bewegungen und darauf, ob Stimme, Mimik und Handgesten harmonisch zusammenwirkten.

Wenn die Bewegungen des Roboters steif wirkten, das Timing unpassend war oder die verschiedenen Körperteile nicht perfekt mit der Stimme synchron zu sein schienen, neigten die Teilnehmer eher dazu, auf eine KI zu tippen. Wenn der Roboter hingegen mit einem kohärenten Fluss agierte, bei dem Gestik und Mimik perfekt mit der Sprache übereinstimmten, glaubten die Menschen eher, dass ein Mensch hinter den Steuerungen steckte. Dies bedeutet nicht, dass die KI perfekt war, sondern vielmehr, dass die Fehler in der Leistung der KI subtil genug waren, um bei einem flüchtigen Blick übersehen zu werden. Die Studie legt nahe, dass unsere Fähigkeit, eine Handlungsfähigkeit (Agency) wahrzunehmen, weniger von der verwendeten Technologie abhängt, sondern von der Konsistenz der Performance. Wenn der Roboter als eine Einheit auftritt, akzeptiert das Gehirn ihn als einen einzelnen Akteur, unabhängig davon, ob dieser Akteur aus Fleisch oder Code besteht.

Diese vorläufige Arbeit schlägt ein neues Kapitel für die Gestaltung der Roboter der Zukunft auf. Sie impliziert, dass wir in naher Zukunft möglicherweise nicht ständig darüber nachdenken müssen, ob ein Roboter während kurzer Austauschprozesse echt oder künstlich ist. Stattdessen kann sich der Fokus darauf verlagern, wie diese Systeme menschliche und künstliche Intelligenz miteinander verschmelzen lassen können – etwa indem ein Mensch übernimmt, wenn ein Gespräch komplexer wird, während die KI die Routineaufgaben bewältigt. Die Forscher merken an, dass ihre Ergebnisse spezifisch für diese kurzen, strukturierten Clips sind und dass längere, komplexere Interaktionen andere Muster offenbaren könnten. Vorerst bestätigt die Studie: Wenn ein Roboter spricht, lächelt und sich mit genügend Kohärenz bewegt, ist der menschliche Geist bereit, ihn als Partner zu akzeptieren, wodurch die wahre Natur seiner Handlungsfähigkeit ein stilles Geheimnis bleibt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →