← नवीनतम पेपर
💻 computer science

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

यह शोध पत्र MRBench प्रस्तुत करता है, जो मौजूदा डेटासेट की सीमाओं को दूर करने के लिए विविध, संतुलित और बहु-स्तरीय डेटा से युक्त एक व्यापक मानव गति-पाठ पुनर्प्राप्ति (human motion-text retrieval) बेंचमार्क है, साथ ही एक हल्का ग्रैनुलैरिटी-अवेयर (granularity-aware) मॉडल भी पेश करता है जो विभिन्न विवरण स्तरों में क्रॉस-डोमेन सामान्यीकरण और पुनर्प्राप्ति प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानव गति (human movement) को समझने के लिए सिखाने की कोशिश कर रहे हैं, केवल उसे देखकर ही नहीं, बल्कि इस बात को सुनकर भी कि हम उस गति का वर्णन कैसे करते हैं। यह ह्यूमन मोशन-टेक्स्ट रिट्रीवल (human motion-text retrieval) की दुनिया है, जहाँ कंप्यूटर नाचते या चलते हुए व्यक्ति के वीडियो को उस विशिष्ट शब्दों के साथ मिलाने की कोशिश करता है जो उस क्रिया का वर्णन करते हैं। इसे एक सुपर-पावर्ड लाइब्रेरियन की तरह समझें जो न केवल किताब के शीर्षक को देखता है, बल्कि उस कहानी को भी समझता है जो उसके अंदर है, ताकि वह "मुझे वह वीडियो दिखाएं जहाँ व्यक्ति अपने जूतों के फीतों में उलझकर गिर जाता है" जैसे अनुरोध के लिए सटीक मिलान ढूंढ सके। लंबे समय से, वैज्ञानिक इन मोशन वीडियो और उनके विवरणों की लाइब्रेरी बनाने के लिए इन रोबोटों को प्रशिक्षित कर रहे हैं। हालाँकि, इसमें एक पेंच है: यदि लाइब्रेरी में केवल एक सफेद कमरे में सीधी रेखा में चलते हुए लोगों के वीडियो हैं, और विवरण केवल "व्यक्ति चलता है" जैसे हैं, तो रोबोट दुनिया का एक बहुत ही संकीर्ण और उबाऊ संस्करण सीखता है। वह उस एक विशिष्ट चाल को खोजने में बहुत अच्छा हो सकता है, लेकिन यदि आप उससे पार्क में बैकफ्लिप करने वाले या रसोई में लड़खड़ाने वाले किसी व्यक्ति को खोजने के लिए कहें, तो वह पूरी तरह से खो जाएगा।

यह बिल्कुल वही समस्या है जिसे शंघाई जियाओ टोंग यूनिवर्सिटी और बीजिंग झोंगगुआनकुन एकेडमी की शोधकर्ताओं की एक टीम ने हल करने का निर्णय लिया। उन्होंने महसूस किया कि मोशन डेटा की पुरानी लाइब्रेरी बहुत सरल, बहुत दोहराव वाली थी, और यह वास्तविक दुनिया में मनुष्य वास्तव में कैसे चलते हैं, इसकी विविधता और जटिलता को नहीं दर्शाती थी। इसलिए, उन्होंने MRBench नामक एक नई, विशाल लाइब्रेरी बनाई। केवल "चलने" के बजाय, उनकी लाइब्रेरी में इंडोर डांस मूव्स से लेकर वीडियो और यहाँ तक कि कंप्यूटर-जनरेटेड एनिमेशन से कैप्चर किए गए वास्तविक दुनिया के जंगली कार्यों तक 3,390 अलग-अलग गतिविधियाँ शामिल हैं। उन्होंने गति की 118 विभिन्न श्रेणियों को कवर किया, यह सुनिश्चित करते हुए कि कोई भी एक प्रकार की गति संग्रह पर हावी न हो। लेकिन वे केवल वीडियो तक ही नहीं रुके; उन्होंने विवरणों को भी फिर से लिखा। उन्होंने प्रत्येक मोशन के लिए विवरण के तीन स्तर बनाए: एक छोटा, प्रभावशाली सारांश (जैसे "व्यक्ति गिरता है"), एक मानक विवरण (जैसे "व्यक्ति पीछे की ओर फर्श पर गिरता है"), और एक अत्यंत विस्तृत, सूक्ष्म विवरण (जैसे "व्यक्ति खड़ा होता है, पीछे झुकता है, ढह जाता है, और स्थिर होकर गिर जाता है")। यह उन्हें यह परीक्षण करने की अनुमति देता है कि क्या एक कंप्यूटर एक सरल कमांड बनाम एक जटिल, विस्तृत कहानी को समझ सकता है।

जब उन्होंने अपनी नई लाइब्रेरी को परीक्षण में डाला, तो उन्होंने पाया कि पुराने, लोकप्रिय कंप्यूटर मॉडल के लिए एक कठोर वास्तविकता सामने आने वाली थी। ये मॉडल, जो पुरानी, सरल लाइब्रेरी पर परीक्षण किए जाने पर स्मार्ट लगते थे, MRBench की विविधता का सामना करने पर काफी संघर्ष करते दिखे। वे उस छात्र की तरह थे जिसने एक विशिष्ट अभ्यास टेस्ट के उत्तर रट लिए थे लेकिन जब प्रश्न अलग तरीके से पूछे गए या नए विषयों के बारे में पूछा गया, तो वह असफल हो गया। शोधकर्ताओं ने पाया कि ये मॉडल इस बात के प्रति बहुत संवेदनशील थे कि टेक्स्ट कितना विस्तृत है; वे अक्सर भ्रमित हो जाते थे जब विवरण ठीक वैसा नहीं होता था जैसा कि वे आदी थे। इसे ठीक करने के लिए, टीम ने एक नया, हल्का मॉडल डिजाइन किया जो एक लचीले अनुवादक की तरह कार्य करता है। यह मानक विवरणों को समझने के लिए एक ठोस आधार बनाए रखता है लेकिन इसमें विशेष "एडेप्टर" (adapters) जोड़े गए हैं जो संक्षिप्त सारांशों या लंबी, विस्तृत कहानियों को समझने के लिए तेज़ी से खुद को समायोजित कर सकते हैं बिना अपना रास्ता भटके। इस नए दृष्टिकोण का परीक्षण करके, उन्होंने दिखाया कि यह संभव है कि कंप्यूटर को मानव गति और भाषा के पूरे स्पेक्ट्रम को समझने में बेहतर बनाया जाए, एक त्वरित "जंप" से लेकर जिम्नास्टिक रूटीन के विस्तृत प्ले-बाय-प्ले विवरण तक, बिना बुनियादी बातों को भूले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →