← Nieuwste papers
💻 computer science

SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction

Het artikel presenteert SocioGesture, een realtime, adaptief systeem voor de perceptie van sociale gebaren voor mens-robotinteractie, dat gebruikmaakt van een lichtgewicht dual-stream model getraind met occlusie-bewuste corruptie om robuuste, lage-latentie herkenning op edge-apparaten te bereiken terwijl het continu zijn vocabulaire uitbreidt via offline adaptatie.

Oorspronkelijke auteurs: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Gepubliceerd 2026-09-07
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots leren zich te bewegen door onze wereld, maar om op een natuurlijke manier met ons te kunnen interageren, moeten ze meer doen dan alleen gesproken commando's opvolgen. Ze moeten de stille taal van menselijke beweging begrijpen: een zwaai om hallo te zeggen, een opgeheven handpalm om stop te zeggen, of een telefoon tegen het oor gehouden om te signaleren: "Ik ben druk." Dit is de uitdaging van mens-robotinteractie, een vakgebied dat zich toewijdt aan het leren van machines hoe ze deze sociale signalen kunnen lezen. De moeilijkheid ligt in de rommelige realiteit van de echte wereld. In tegenstelling tot een video die wordt bekeken in een rustig kantoor, ziet een robot mensen vanuit bewegende hoeken, vaak met handen die achter lichamen verborgen zijn of verloren gaan in de schaduw. Bovoltreikken kan een robot het zich niet veroorloven om lang te pauzeren en na te denken; als het te lang aarzelt om een gebaar te interpreteren, voelt de interactie onderbroken en onnatuurlijk aan. Het doel is om een systeem te bouwen dat snel genoeg is om een gesprek bij te houden, slim genoeg is om om te gaan met ontbrekende informatie, en in staat is om van zijn fouten te leren zonder dat er telkens een mens nodig is om het te herprogrammeren.

Onderzoekers bij OpenMind hebben een nieuw systeem ontwikkeld genaamd SocioGesture om dit probleem op te lossen. Het is een real-time perceptietool die specif으로 is ontworpen voor robots die sociale gebaren moeten herkennen terwijl ze bewegen en werken. Het systeem werkt door naar het skelet van een persoon te kijken—de kaart van hun gewrichten en botten—in plaats te proberen hun kleding of de achtergrond te analyseren. Deze aanpak is gekozen omdat een skelet herkenbaar blijft, zelfs wanneer de verlichting verandert of de persoon verschillende kleding draagt. De onderzoekers wisten echter dat standaard skelettracking vaak faalt wanneer een hand wordt afgeschermd of een camerahoek verschuift. Om dit op te lossen, bouwden ze een model dat aandacht besteedt aan de betrouwbaarheid van elk afzonderlijk gewricht. Als de camera van de robot onzeker is over waar een hand zich bevindt, merkt het systeem deze onzekerheid op in plaats van blindelings te gokken. Het combineert de brede beweging van het lichaam met de fijne details van de hand, en voegt deze samen in één enkele, razendsnelle berekening die direct op de ingebouwde computer van de robot draait.

De kerninnovatie van SocioGesture is hoe het omgaat met de onvermijdelijke hiaten in de gegevens. In veel eerdere systemen zou, als een cruciaal gewricht zoals een pols ontbrak, de hele poging tot herkenning mislukken. Dit nieuwe systeem is getraind om die hiaten te verwachten. De onderzoekers hebben hun trainingsdata doelbewust "gecorrumpeerd" door handen en armen te verbergen in de computersimulaties, waardoor het model heeft geleerd hoe het een gebaar moet herkennen, zelfs wanneer delen van het skelet onzichtbaar zijn. Deze training vindt plaats voordat de robot het laboratorium überhaupt verlaat, zodat de robot niet over extra rekenkracht hoeft te beschikken om robuust te zijn. Wanneer de robot in het veld is, neemt hij beslissingen op basis van wat hij ziet. Als hij zeer zeker is over een gebaar, handelt hij onmiddellijk. Als hij onzeker is, gokt hij niet; in plaats daarvan bewaart hij dat moment van interactie voor latere beoordeling. Dit creëert een veiligheidslus waarbij de robot vermijdt om gevaarlijke fouten te maken, zoals iemand benaderen die probeert hem te stoppen, terwijl hij tegelijkertijd gegevens verzamelt om slimmer te worden.

Het systeem werd getest in een verscheidenheid aan binnen- en buitenomgevingen met echte mensen. De onderzoekers verzamelden een dataset van zeven veelvoorkomende sociale gebaren, waaronder zwaaien om een robot dichterbij te laten komen, een hand opsteken om hem te stoppen, of doen alsof men aan het bellen is om onbeschikbaarheid te signaleren. Ze voegden ook een "afleidingsgebaar" toe, zoals het krabben aan iemands hoofd, om ervoor te zorgen dat de robot dit niet zou verwarren met een telefoongesprek. Bij tests op mensen die de robot nog nooit eerder had gezien, identificeerde het systeem gebaren in bijna alle gevallen correct, zelfs wanneer de handen gedeeltelijk verborgen waren. In een specifieke test waarbij de handen volledig uit de data werden weggefilterd, sprong de nauwkeurigheid van het systeem van een slechte 31 procent naar een sterke 85 procent, wat bewees dat de trainingsmethode werkte. Het systeem liep ook snel genoeg om een standaard videocamera bij te houden, waarbij een volledig frame in slechts 25 milliseconden werd verwerkt op een op een robot gemonteerde computer, wat snel genoeg is om instant aan te voelen voor een menselijke waarnemer.

Misschien wel de meest significante bevinding is het vermogen van het systeem om te leren na de inzet. De onderzoekers stelden een proces in waarbij de robot momenten markeerde waarvan hij onzeker was en de videoclips naar een krachtigere computer in de cloud stuurde. Die krachtige computer labelde het gebaar, en de robot gebruikte die nieuwe informatie om zijn eigen brein bij te werken. In een test waarbij de robot drie nieuwe gebaren leerde—een duim omhoog geven, een handdruk en een saluut—leerde hij deze succesvol zonder de oorspronkelijke zeven te vergeten. Het systeem behield zijn hoge nauwkeurigheid op de oude gebaren terwijl het de nieuwe gebaren ongeveer tweederde van de tijd correct identificeerde. Dit demonstreert een pad vooruit waarbij robots hun vocabulaire van sociale signalen in de loop van de tijd kunnen uitbreiden en zich kunnen aanpassen aan nieuwe situaties zonder dat ze telkens opnieuw moeten worden uitgeschakeld en getraind.

De onderzoekers testten het systeem ook op een live robot, een humanoïde machine genaamd Unitree G1, die interactie had met vijf nieuwe mensen die geen deel hadden uitgemaakt van de trainingsdata. In 150 proeven herkende de robot het gebaar in 97 procent van de gevallen correct. Wanneer de robot besloot te handelen, koos hij in 98 procent van de gevallen het juiste gedrag—zoals naderen of stoppen. De weinige keren dat hij niet handelde, kwam dat niet door een fout, maar omdat hij voorzichtig was; hij koos ervoor om te wachten in plaats het risico te lopen op een verkeerde beweging. Deze conservatieve aanpak is precies wat de ontwerpers beoogden voor een robot in een openbare ruimte. De studie suggereert dat door een lichtgewicht, snel model te combineren met een veiligheid-eerst-strategie en een lus voor offline leren, we robots kunnen bouwen die niet alleen efficiënt zijn, maar ook sociaal bewust en aanpasbaar aan de onvoorspelbare aard van menselijke interactie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →