← Neueste Arbeiten
💻 computer science

SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction

Das Papier präsentiert SocioGesture, ein Echtzeit-System zur adaptiven Wahrnehmung sozialer Gesten für die Mensch-Roboter-Interaktion, das ein leichtgewichtiges Dual-Stream-Modell nutzt, welches mittels okklusionsbewusster Korruption trainiert wurde, um eine robuste, latenzarme Erkennung auf Edge-Geräten zu erreichen, während es seinen Wortschatz durch Offline-Adaption kontinuierlich erweitert.

Ursprüngliche Autoren: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Veröffentlicht 2026-09-07
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter lernen, sich in unserer Welt zu bewegen, aber damit sie auf natürliche Weise mit uns interagieren können, müssen sie mehr tun, als nur gesprochenen Befehlen zu folgen. Sie müssen die stille Sprache der menschlichen Bewegung verstehen: ein Winken zur Begrüßung, eine erhobene Handfläche zum Stoppen oder ein Telefon, das an das Ohr gehalten wird, um zu signalisieren: „Ich bin beschäftigt.“ Dies ist die Herausforderung der Mensch-Roboter-Interaktion, einem Feld, das sich der Aufgabe widmet, Maschinen beizubringen, diese sozialen Signale zu lesen. Die Schwierigkeit liegt in der unordentlichen Realität der echten Welt. Im Gegensatz zu einem Video, das in einem ruhigen Büro betrachtet wird, sieht ein Roboter Menschen aus beweglichen Winkeln, oft mit Händen, die hinter dem Körper verborgen oder im Schatten verloren sind. Zudem kann es sich ein Roboter nicht leisten, innezuhalten und lange nachzudenken; wenn er zu lange zögert, um eine Geste zu interpretieren, fühlt sich die Interaktion unterbrochen und unnatürlich an. Das Ziel ist es, ein System zu bauen, das schnell genug ist, um mit einem Gespräch Schritt zu halten, klug genug, um mit fehlenden Informationen umzugehen, und in der Lage ist, aus seinen Fehlern zu lernen, ohne dass ein Mensch es jedes Mal neu programmieren muss.

Forscher bei OpenMind haben ein neues System namens SocioGesture entwickelt, um dieses Problem zu lösen. Es handelt sich um ein Echtzeit-Wahrnehmungswerkzeug, das speziell für Roboter entwickelt wurde, die soziale Gesten erkennen müssen, während sie sich bewegen und arbeiten. Das System arbeitet, indem es das Skelett einer Person beobachtet – die Karte ihrer Gelenke und Knochen – anstatt zu versuchen, deren Kleidung oder den Hintergrund zu analysieren. Dieser Ansatz wurde gewählt, weil ein Skelett auch dann erkennbar bleibt, wenn sich die Beleuchtung ändert oder die Person unterschiedliche Kleidung trägt. Die Forscher wussten jedoch, dass das Standard-Skelett-Tracking oft versagt, wenn eine Hand verdeckt ist oder sich der Kamerawinkel verschiebt. Um dies zu beheben, bauten sie ein Modell, das der Konfidenz (dem Vertrauensgrad) jedes einzelnen Gelenks Aufmerksamkeit schenkt. Wenn sich die Kamera des Roboters unsicher ist, wo eine Hand ist, vermerkt das System diese Unsicherheit, anstatt blind zu raten. Es kombiniert die grobe Bewegung des Körpers mit den feinen Details der Hand und führt sie in einer einzigen, blitzschnellen Berechnung zusammen, die direkt auf dem Onboard-Computer des Roboters läuft.

Die Kerninnovation von SocioGesture liegt darin, wie es mit den unvermeidlichen Lücken in den Daten umgeht. In vielen früheren Systemen führte der Ausfall eines wichtigen Gelenks, wie etwa des Handgelenks, dazu, dass der gesamte Erkennungsversuch scheiterte. Dieses neue System ist darauf trainiert, solche Lücken zu erwarten. Die Forscher haben ihre Trainingsdaten bewusst „korrumpiert“, indem sie Hände und Arme in den Computersimulationen verborgen haben, um das Modell dazu zu zwingen, zu lernen, eine Geste auch dann zu erkennen, wenn Teile des Skeletts unsichtbar sind. Dieses Training findet statt, bevor der Roboter jemals das Labor verlässt, sodass der Roboter keine zusätzliche Rechenleistung benötigt, um robust zu sein. Wenn der Roboter im Einsatz ist, trifft er Entscheidungen basierend auf dem, was er sieht. Wenn er sich einer Geste sehr sicher ist, handelt er sofort. Wenn er unsicher ist, rät er nicht; stattdessen hebt er diesen Moment der Interaktion für eine spätere Überprüfung auf. Dies schafft eine Sicherheitsschleife, in der der Roboter vermeidet, gefährliche Fehler zu machen – wie etwa auf jemanden zuzugehen, der versucht, ihn zu stoppen –, während er gleichzeitig Daten sammelt, um intelligenter zu werden.

Das System wurde in einer Vielzahl von Innen- und Außenbereichen mit echten Menschen getestet. Die Forscher sammelten einen Datensatz von sieben gängigen sozialen Gesten, darunter das Winken, um einen Roboter näher heranzubitten, das Hochhalten einer Hand, um ihn zu stoppen, oder das Vortäuschen eines Telefonats, um Unverfügbarkeit zu signalisieren. Sie nahmen auch eine „Ablenkungsgeste“ auf, wie das Kratzen am Kopf, um sicherzustellen, dass der Roboter dies nicht mit einem Telefonat verwechselt. Bei Tests an Menschen, die der Roboter noch nie zuvor gesehen hatte, identifizierte das System Gesten in fast allen Fällen korrekt, selbst wenn die Hände teilweise verdeckt waren. In einem spezifischen Test, bei dem die Hände vollständig aus den Daten maskiert wurden, sprang die Genauigkeit des Systems von schlechten 31 Prozent auf starke 85 Prozent, was beweist, dass die Trainingsmethode funktionierte. Das System lief zudem schnell genug, um mit einer Standardvideokamera Schritt zu halten, indem es einen vollständigen Frame in nur 25 Millisekunden auf einem am Roboter montierten Computer verarbeitete, was für einen menschlichen Beobachter schnell genug ist, um unmittelbar zu wirken.

Vielleicht der bedeutendste Befund ist die Fähigkeit des Systems, nach dem Einsatz zu lernen. Die Forscher richteten einen Prozess ein, bei dem der Roboter Momente markiert, in denen er sich unsicher war, und diese Videoclips an einen leistungsfähigeren Computer in der Cloud sendet. Dieser leistungsfähige Computer beschriftet die Geste, und der Roboter nutzt diese neuen Informationen, um sein eigenes „Gehirn“ zu aktualisieren. In einem Test, bei dem der Roboter drei neue Gesten lernte – ein Daumenhochzeigen, ein Händeschütteln und ein Salutieren –, lernte er diese erfolgreich, ohne die ursprünglichen sieben zu vergessen. Das System behielt seine hohe Genauigkeit bei den alten Gesten bei und identifizierte die neuen etwa zwei Drittel der Zeit korrekt. Dies demonstriert einen Weg nach vorn, auf dem Roboter ihr Vokabular an sozialen Signalen im Laufe der Zeit erweitern können, indem sie sich an neue Situationen anpassen, ohne dass sie abgeschaltet und von Grund auf neu trainiert werden müssen.

Die Forscher testeten das System auch an einem Live-Roboter, einer humanoiden Maschine namens Unitree G1, die mit fünf neuen Personen interagierte, die nicht Teil der Trainingsdaten waren. In 150 Versuchen erkannte der Roboter die Geste in 97 Prozent der Fälle korrekt. Wenn der Roboter entschied zu handeln, wählte er in 98 Prozent der Fälle das richtige Verhalten – wie etwa Herankommen oder Anhalten. Die wenigen Male, in denen er nicht handelte, lagen nicht daran, dass er einen Fehler machte, sondern weil er vorsichtig war; er entschied sich zu warten, anstatt ein Risiko einzugehen. Dieser konservative Ansatz ist genau das, was die Designer für einen Roboter im öffentlichen Raum beabsichtigt haben. Die Studie legt nahe, dass wir durch die Kombination eines leichtgewichtigen, schnellen Modells mit einer „Safety-First“-Strategie und einer Schleife für das Offline-Lernen Roboter bauen können, die nicht nur effizient, sondern auch sozial kompetent und anpassungsfähig an die Unvorhersehbarkeit menschlicher Interaktionen sind.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →