← Nieuwste papers
💻 computer science

HAP: A Hand-Driven Active Perception Framework for Egocentric Head Motion Prediction

Dit artikel introduceert HAP, een door de hand gestuurde actieve perceptie-framework die toekomstige egocentrische hoofdbewegingen voorspelt door doelbetrouwbaarheid af te leiden en dynamische occlusies te modelleren via een predictieve graaf, gevalideerd door een nieuwe dataset genaamd Bottle en superieure prestaties ten opzichte van bestaande baselines.

Oorspronkelijke auteurs: Yunji Feng, Junyi Ma, Guanzhong Sun, Chenyang Xu, Hesheng Wang

Gepubliceerd 2026-09-17
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yunji Feng, Junyi Ma, Guanzhong Sun, Chenyang Xu, Hesheng Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Wanneer we iemand zien reiken naar een beker, volgen onze ogen niet simpelweg de hand; ze anticiperen op waar de hand naartoe gaat en bewegen om het doel in duidelijk zicht te houden. Dit is de essentie van actieve perceptie: het idee dat waarnemen geen passieve registratie van de wereld is, maar een actief proces waarbij we onze lichamen bewegen om de specifieke informatie te verzamelen die we nodig hebben. In de context van robots of kunstmatige intelligentie die menselijk gedrag proberen te begrijpen, creëert dit een moeilijke puzzel. De meeste systemen zijn goed in het voorspellen waar een hand als volgende naartoe zal gaan, maar ze falen vaak in het voorspellen waar het hoofd van een persoon naartoe zal draaien. Een robot die alleen de hand volgt, kan de plank misslaan door niet te merken dat de persoon op het punt staat om om een hoek te kijken om te zien wat hij of zij aan het pakken is, wat kan leiden tot een onhandige of mislukte interactie. Begrijpen hoe het hoofd beweegt om verborgen objecten te onthullen, is even belangrijk als weten waar de hand naartoe beweegt, omdat de oriëntatie van het hoofd bepaalt welk visueel bewijs de persoon vervolgens zal verkrijgen.

Een team van onderzoekers aan de Shanghai Jiao Tong University en de China University of Mining and Technology heeft een nieuwe manier ontwikkeld om dit probleem op te lossen. Ze hebben een systeem ontwikkeld genaamd HAP, wat staat voor een Hand-Driven Active Perception framework. In plaats van het hoofd te behandelen als een secundair deel van het lichaam dat simpelweg de hand volgt, behandelt HAP het hoofd als een instrument voor het verzamelen van informatie. Het systeem werkt door iemands hand te observeren terwijl deze naar objecten reikt en vervolgens te raden welk object die persoon beoogt aan te raken. Het stopt daar niet; het berekent ook hoe dat object mogelijk verborgen of geblokkeerd kan worden door andere items in de scène. Door de gok over het doel te combineren met een kaart van wat momenteel zichtbaar is en wat mogelijk zichtbaar zal worden, kan het systeem precies voorspellen hoe de persoon met zijn hoofd zal draaien om het doel in het oog te houden.

Om dit idee te bouwen en te testen, moesten de onderzoekers eerst een nieuwe collectie videodata creëren. Ze namen honderden korte clips op van mensen die naar objecten op een tafel reiken, waarbij de scène werd vastgelegd met camera's die zowel kleur als diepte zien. In deze video's blijven de objecten statisch, maar verandert de zichtbaarheid van het doelwit naarmate de persoon beweegt, waardoor de persoon gedwongen wordt de blik te verleggen om te zien wat hij of zij aan het doen is. Deze dataset, die ze Bottle noemden, bevat gesynchroniseerde opnames van handbewegingen en hoofdbewegingen, die laten zien hoe mensen hun gezichtspunt aanpassen wanneer het doelwit moeilijk zichtbaar wordt. De onderzoekers gebruikten deze gegevens om hun computermodel te trainen om de subtiele aanwijzingen in handbewegingen te herkennen die duiden op een specifiek doelwit, en om te begrijpen hoe de veranderende kijkervaring van de scène de beweging van het hoofd beïnvloedt.

De kern van het HAP-systeem is een methode voor het redeneren over wat verborgen is. Wanneer een persoon naar een object reikt, kijkt het systeem naar de vorm van het object en het pad van de hand om een waarschijnlijkheid toe te kennen aan elk mogelijk doelwit. Vervolgens bouwt het een dynamische kaart van de scène, waarbij het bijhoudt welke objecten het zicht op andere objecten blokkeren. Deze kaart is niet statisch; deze wordt bijgewerkt terwijl de persoon beweegt, waarbij niet alleen wordt berekend wat momenteel verborgen is, maar ook wat verborgen zou kunnen raken als de persoon zijn positie licht zou veranderen. Het systeem gebruikt een netwerk dat deze relaties in een specifieke volgorde verwerkt, vergelijkbaar met een informatiestroom, om te begrijpen hoe de zichtbaarheid van het doelwit in de loop van de tijd verandert. Hierdoor kan het model anticiperen dat als een doelwit gedeeltelijk geblokkeerd is, de persoon waarschijnlijk zijn hoofd zal draaien om het te onthullen, in plaats van simpelweg in dezelfde richting te blijven kijken.

De resultaten van het onderzoek tonen aan dat deze aanpak aanzienlijk beter werkt dan eerdere methoden. Bij tests op zowel hun nieuwe dataset als een bestaande publieke collectie video's, maakte het HAP-systeem minder fouten in het voorspellen van de toekomstige positie en oriëntatie van het hoofd in vergelijking met andere geavanceerde modellen. De onderzoekers ontdekten dat het simpelweg raden van het doelwit niet genoeg was; het systeem moest de veranderende zichtbaarheid van dat doelwit begrijpen om nauwkeurige voorspellingen te doen. Ze ontdekten ook dat het combineren van de complexe voorspelling met een eenvoudige aanname dat het hoofd met een constante snelheid beweegt, hielp om de resultaten te verzachten, vooral voor de directe toekomst. Deze combinatie van het begrijpen van het doel, het volgen van de obstakels en het respecteren van de natuurlijke stroom van beweging stelde het systeem in staat om hoofd bewegingen met hoge precisie te voorspellen.

De studie onderzocht ook wat er gebeurt als het systeem wordt gedwongen om één harde gok te doen over het doelwit in plaats van een reeks mogelijkheden aan te houden. De resultaten toonden aan dat het aanhouden van een mate van onzekerheid over welk object de persoon probeert te pakken, de uiteindelijke voorspelling juist verbeterde. Dit suggereert dat in de vroege stadia van een reikbeweging, voordat de hand contact maakt, het brein waarschijnlijk meerdere opties overweegt, en de hoofdbeweging deze flexibiliteit weerspiegelt. Door deze onzekerheid in het model te behouden, kon het systeem zich beter aanpassen aan de uiteindelijke uitkomst. De onderzoekers concludeerden dat de meest succesvolle voorspellingen voortkwamen uit het behandelen van het hoofd als een actieve sensor die zich constant aanpast aan het veranderende landschap van de scène, in plaats van slechts een passieve volger van de hand.

Hoewel het systeem goed presteerde in de gecontroleerde omgeving van tabletop-experimenten, erkennen de onderzoekers dat het voor uitdagingen staat in meer complexe, real-world omgevingen. De huidige methode vereist aanzienlijke rekenkracht om de relaties tussen veel objecten te volgen, en het is afhankelijk van hoogwaardige videodata die niet altijd beschikbaar is. De bevindingen bieden echter een duidelijke weg voorwaarts voor het creëren van robots en virtuele assistenten die op een natuurlijkere manier met mensen kunnen interageren. Door te begrijpen dat hoofdbeweging wordt gedreven door de behoefte om het doel helder te zien, kunnen deze systemen menselijke behoeften anticiperen en hun eigen bewegingen coördineren om een succesvolle interactie te ondersteunen. Het werk demonstreert dat om menselijk gedrag werkelijk te begrijpen, machines moeten leren de wereld niet alleen te zien als een verzameling bewegende onderdelen, maar als een dynamische puzzel waarbij de waarnemer constant verschuift om de ontbrekende stukjes te vinden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →