MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval
Dit artikel introduceert MRBench, een uitgebreide benchmark voor menselijke beweging-tekst-retrieval met diverse, gebalanceerde en multigranulaire data om de beperkingen van bestaande datasets aan te pakken, samen met een lichtgewicht granulariteitsbewust model dat de cross-domein generalisatie en retrieval-prestaties over verschillende beschrijvingsniveaus aanzienlijk verbetert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren menselijke beweging te begrijpen, niet alleen door ernaar te kijken, maar door te luisteren naar hoe we het beschrijven. Dit is de wereld van menselijke beweging-tekstextractie, een vakgebied waar computers proberen een video van een dansende of wandelende persoon te koppelen aan de specifieke woorden die die actie beschrijven. Denk aan een superkrachtige bibliothecaris die niet alleen naar de titel van het boek kijkt, maar het verhaal binnenin begrijpt om de exacte match te vinden voor een verzoek als: "Laat me de video zien waarin de persoon over zijn eigen veters struikelt." Lange tijd hebben wetenschappers bibliotheken van deze bewegingsvideo's en beschrijvingen gebouwd om hun robots op te trainen. Er is echter een addertje onder het gras: als de bibliotheek alleen video's bevat van mensen die in een rechte lijn door een witte kamer lopen, en de beschrijvingen zijn allemaal slechts "persoon loopt", dan leert de robot een zeer nauwe, saaie versie van de wereld. Hij kan misschien geweldig zijn in het vinden van die ene specifieke wandeling, maar hij zal volledig de weg kwijt zijn als je hem vraagt om iemand te vinden die een backflip maakt in een park of een onhandige struikeling in een keuken.
Dit is precies het probleem dat een team onderzoekers van de Shanghai Jiao Tong Universiteit en het Beijing Zhongguancun Academy besloot aan te pakken. Ze realiseerden zich dat de oude bibliotheken met bewegingsdata te simpel, te repetitief en niet representatief waren voor de rommelige, diverse realiteit van hoe mensen zich daadwerkelijk bewegen. Daarom bouwden ze een gloednieuwe, enorme bibliotheek genaamd MRBench. In plaats van alleen "lopen", bevat hun bibliotheek 3.390 verschillende bewegingen variërend van binnenhuis dansbewegingen tot wilde, echte acties vastgelegd uit video's en zelfs computergegenereerde animaties. Ze dekten 118 verschillende categorieën van beweging af, waarbij ze ervoor zorgden dat geen enkele type beweging de collectie domineerde. Maar ze stopten niet bij alleen de video's; ze schreven ook de beschrijvingen opnieuw. Ze creëerden drie niveaus van detail voor elke beweging: een korte, krachtige samenvatting (zoals "persoon valt"), een standaardbeschrijving (zoals "persoon valt achterover naar de vloer"), en een supergedetailleerd, fijnmazig verslag (zoals "persoon begint staand, leunt achterover, stort in en landt bewegingsloos"). Dit stelt hen in staat om te testen of een computer een eenvoudige opdracht kan begrijpen versus een complexe, gedetailleerde verhaal.
Toen ze hun nieuwe bibliotheek op de proef stelden, kwamen ze erachter dat de oude, populaire computermodellen een harde les hadden te leren wachtte. Deze modellen, die slim leken wanneer ze op de oude, simpele bibliotheken werden getest, worstelden aanzienlijk wanneer ze geconfronteerd werden met de diversiteit van MRBench. Ze waren als een student die de antwoorden op een specifieke oefentoets had uit het hoofd geleerd, maar faalde toen de vragen anders werden geformuleerd of over nieuwe onderwerpen gingen. De onderzoekers ontdekten dat deze modellen zeer gevoelig waren voor hoe gedetailleerd de tekst was; ze raakten vaak in de war wanneer de beschrijving niet precies was wat ze gewend waren. Om dit op te lossen, ontwierp het team een nieuw, lichtgewicht model dat fungeert als een flexibele vertaler. Het behoudt een solide basis voor het begrijpen van standaardbeschrijvingen, maar voegt speciale "adapters" toe die snel kunnen aanpassen om korte samenvattingen of lange, gedetailleerde verhalen te begrijpen zonder de weg kwijt te raken. Door deze nieuwe aanpak te testen, lieten ze zien dat het mogelijk is om computers beter te laten begrijpen in het volledige spectrum van menselijke beweging en taal, van een snelle "sprong" tot een gedetailleerde play-by-play van een gymnastiekroutine, zonder te vergeten hoe ze de basis moeten afhandelen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.