← Nieuwste papers
💬 NLP

AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild

AnyMo is een geometrie-bewust, opzet-agnostisch raamwerk dat gebruikmaakt van op fysica gebaseerde IMU-simulatie en LLM-uitlijning om robuust, generaliseerbaar menselijk bewegingsbegrip mogelijk te maken over diverse draagbare apparaten en onbekende datasets heen, en dat bestaande methoden aanzienlijk overtreft in zero-shot activiteitsherkenning, cross-modale retriever en bewegingsbeschrijving.

Oorspronkelijke auteurs: Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim

Gepubliceerd 2026-05-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een smartwatch, een fitness-tracker of zelfs een sensor in je schoen hebt. Deze apparaten zijn uitstekend in het waarnemen van hoe je lichaam beweegt. Maar hier zit het probleem: een beweging ziet er volledig anders uit, afhankelijk van waar de sensor zich bevindt.

Als je met je hand zwaait, ziet een sensor aan je pols een grote, snelle zwaai. Een sensor aan je heup ziet een klein, subtiel wiebelen. Een sensor op je hoofd ziet bijna niets. Huidige AI-modellen zijn als studenten die alleen hebben gestudeerd voor één specifieke toets; als je de sensor naar een andere plek verplaatst of het merk van het apparaat verandert, raakt de AI in de war en faalt hij.

Het artikel introduceert AnyMo, een nieuw AI-kader dat is ontworpen als een "universele vertaler" voor menselijke beweging, ongeacht waar de sensor is geplaatst.

Hier is hoe AnyMo werkt, opgesplitst in eenvoudige concepten:

1. De "Virtuele Gym" (Geometrie-bewuste simulatie)

In plaats van te proberen miljoenen real-world sensoren van elke mogelijke plek op het menselijk lichaam te verzamelen (wat onmogelijk is), bouwt AnyMo een virtuele gym.

  • De Analogie: Stel je een 3D-digitaal mannequin voor. De onderzoekers plaatsten niet alleen een sensor op de pols van het mannequin. Ze "verfden" virtueel duizenden kleine sensoren over de hele huid van het mannequin – op de elleboog, de knie, de rug, het voorhoofd.
  • De Fysica: Ze gebruikten fysica om precies te simuleren hoe die sensoren zouden vibreren en draaien terwijl het mannequin liep, rende of danste. Dit creëerde een enorme bibliotheek met "wat-als"-scenario's, waardoor de AI leerde dat een "wandeling" er anders uitziet op een knie dan op een schouder, maar fundamenteel dezelfde actie blijft.

2. Het "Blinddoekpuzzel" (Setup-onafhankelijke vooropleiding)

Zodra de AI had geleerd van de virtuele gym, moesten ze hem leren omgaan met real-world situaties waarbij sensoren ontbreken of willekeurig zijn geplaatst.

  • De Analogie: Stel je voor dat je de AI een volledige puzzel toont van een lopende persoon, maar je blinddoekt hem vervolgens zodat hij slechts 2 of 3 puzzelstukjes kan zien (de daadwerkelijke sensoren op een echt persoon).
  • De Truc: De AI moet raden hoe het hele plaatje eruitziet op basis van slechts die paar stukjes. Door dit keer op keer te oefenen met verschillende "blinddoeken" (verschillende sensoropstellingen), leert de AI de kernstructuur van de beweging in plaats van specifieke sensorlocaties te memoriseren. Het leert de "ziel" van de beweging, niet alleen de "huid" van de sensordata.

3. De "Vertaler" (Tokenisatie en LLM)

Rauwe sensordata is slechts een stroom van getallen (acceleratie, snelheid, enz.). Grote Taalmodellen (LLM's) zoals het model dat in dit artikel wordt gebruikt, zijn uitstekend in het begrijpen van woorden, maar ze stikken in rauwe getallen.

  • De Analogie: AnyMo fungeert als een vertaler. Het neemt de rommelige, continue stroom van sensornummers en comprimeert deze tot compacte "bewegingstokens" (zoals woorden in een zin).
  • Het Resultaat: In plaats van de AI een miljoen getallen te voeden, voert het hem een korte zin van "bewegingswoorden" in. Hierdoor kan de AI beweging direct verbinden met taal.

Wat kan AnyMo doen?

Het artikel testte AnyMo op drie hoofdtaken, en het presteerde beter dan alle eerdere methoden:

  1. Zero-Shot Herkenning (Het "Raad de Activiteit"-spel):

    • Ze toonden AnyMo data van 14 verschillende datasets die het nooit eerder had gezien (verschillende sensoren, verschillende mensen, verschillende activiteiten).
    • Resultaat: AnyMo kon correct raden wat de persoon aan het doen was (bijvoorbeeld "koken", "wandelen", "dansen") zonder ooit expliciet te zijn getraind op die specifieke datasets. Het verbeterde de nauwkeurigheid met ongeveer 12% ten opzichte van de volgende beste methode.
  2. Cross-Modal Zoeken (De "Zoekmachine"):

    • Tekst-naar-Beweging: Je typt "een persoon opent een koelkast" en de AI vindt het exacte videofragment of de sensordata die overeenkomt.
    • Beweging-naar-Tekst: Je uploadt een sensoropname en de AI vindt de tekstopdracht die erbij past.
    • Resultaat: AnyMo was aanzienlijk beter in het vinden van de juiste match dan andere modellen, zelfs wanneer de data van volledig verschillende apparaten kwam.
  3. Bewegingscaptions (De "Verhaler"):

    • Je geeft de AI een sensoropname en het schrijft een zin die beschrijft wat er is gebeurd.
    • Resultaat: In plaats van generieke dingen te zeggen zoals "arm bewegen", schreef AnyMo specifieke beschrijvingen zoals: "Een persoon loopt een gang af, draait rechtsaf en opent een kast." Het ving het verhaal van de beweging, niet alleen de fysica.

De Conclusie

Het artikel beweert dat door sensorplaatsing te behandelen als een gestructureerd, geometrisch probleem (met gebruik van de vorm van het lichaam) in plaats van een willekeurige variabele, en door de AI te leren beweging te vertalen naar taal, AnyMo een algemeen doelmodel voor draagbare beweging creëert.

Het herkent niet alleen een specifieke activiteit op een specifiek horloge; het begrijpt het concept van menselijke beweging, waardoor het werkt met elk apparaat, op elk lichaamsdeel, in het wild.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →