← नवीनतम पेपर
💻 computer science

FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision

FineMoLA एक वीकली सुपरवाइज्ड फ्रेमवर्क है जो लंबे विवरणों को सेगमेंट करने और बिना किसी स्पष्ट मानवीय लेबलिंग के छद्म फ्रेम-स्तरीय पत्राचार (pseudo frame-level correspondences) को इन्फर करने के लिए एक ऑप्टिमल ट्रांसपोर्ट समस्या को हल करके, क्लिप-स्तरीय एनोटेशन से सूक्ष्म-स्तरीय मोशन-टेक्स्ट संरेखण प्राप्त करता है।

मूल लेखक: Tongyan Wang, Zhengyuan Li, Muhan Lin, Shengyang Luo, Yifan Shen, Aniket Bera, Baijian Yang, Yingjie Victor Chen

प्रकाशित 2026-08-04
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Tongyan Wang, Zhengyuan Li, Muhan Lin, Shengyang Luo, Yifan Shen, Aniket Bera, Baijian Yang, Yingjie Victor Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी पढ़कर एक रोबोट को नाचना सिखाने की कोशिश कर रहे हैं। आपके पास एक डांसर का वीडियो है और एक लंबा पैराग्राफ है जो हर घुमाव, मोड़ और उछाल का वर्णन करता है। लेकिन यहाँ पेचीदा बात यह है कि कहानी टेक्स्ट के एक बड़े ब्लॉक के रूप में लिखी गई है, और वीडियो केवल फ्रेम्स की एक धारा है। यदि आप बस रोबोट को कह देते हैं, "यह पूरी कहानी इस पूरे वीडियो से मेल खाती है," तो रोबोट भ्रमित हो जाता है। उसे समझ नहीं आता कि कब घूमना है या कब कूदना है। यह एक पूरे गाने को एक पूरी फिल्म से मिलाने की कोशिश करने जैसा है बिना यह जाने कि कौन सा दृश्य किस कोरस के साथ जाता है। यही वह समस्या है जिसे "टेक्स्ट-टू-मोशन" के क्षेत्र के वैज्ञानिक हल करने की कोशिश कर रहे हैं। वे चाहते हैं कि कंप्यूटर न केवल कहानी के सामान्य भाव को समझे, बल्कि यह भी समझे कि टेक्स्ट का एक विशिष्ट शब्द वीडियो के एक विशिष्ट फ्रेम से कब मेल खाता है। यह वीडियो गेम या फिल्मों में आभासी पात्रों (virtual characters) को स्वाभाविक रूप से चलाने के लिए बहुत महत्वपूर्ण है, ताकि वे केवल यह अनुमान न लगाने लगें कि आगे क्या करना है।

यहाँ FineMoLA आता है, एक नई विधि जो इस टाइमिंग के रहस्य को सुलझाने के लिए एक सुपर-स्मार्ट जासूस की तरह काम करती है। शोधकर्ताओं ने देखा कि हालांकि हमारे पास लंबे विवरणों वाले डांस वीडियो के विशाल पुस्तकालय हैं, लेकिन किसी ने भी मैन्युअल रूप से यह लेबल नहीं किया है कि कौन सा शब्द गति के किस सेकंड से मेल खाता है। इंसानों के लिए यह करना अनंत काल का काम होगा। इसलिए, मदद माँगने के बजाय, FineMoLA खुद को सिखाता है। यह लंबी कहानी को छोटी क्रिया वाक्यांशों (जैसे "बाएं झुकना" या "दरवाजे को थपथपाना") में तोड़ देता है, और फिर इन वाक्यांशों को वीडियो फ्रेम्स के साथ सबसे अच्छा मिलान करने के लिए "ऑप्टिमल ट्रांसपोर्ट" नामक एक गणितीय ट्रिक का उपयोग करता है। इसे संगीत की कुर्सियों (musical chairs) के खेल की तरह समझें जहाँ कुर्सियाँ वीडियो फ्रेम्स हैं और खिलाड़ी शब्द हैं। एल्गोरिदम केवल अनुमान नहीं लगाता; यह उन्हें आपस में जोड़ने का सबसे कुशल तरीका गणना करता है, यहाँ तक कि यह संभावना भी रखता है कि एक क्रिया में कई सेकंड लग सकते हैं या एक फ्रेम किसी विशिष्ट शब्द से मेल नहीं खा सकता है।

पेपर पाता है कि यह स्व-शिक्षित दृष्टिकोण आश्चर्यजनक रूप से अच्छा काम करता है। टेक्स्ट से वीडियो में "द्रव्यमान" (mass) को स्थानांतरित करने की समस्या को एक पहेली के रूप में मानकर, सिस्टम बिना किसी मानव द्वारा वीडियो के चारों ओर बॉक्स बनाने की आवश्यकता के, दोनों को संरेखित करना सीख जाता है। जब उन्होंने इसका परीक्षण SnapMoGen नामक एक डेटासेट पर किया, जिसमें उच्च-गुणवत्ता वाला मोशन कैप्चर डेटा है, तो FineMoLA ने उन पिछले तरीकों की तुलना में सही कनेक्शन खोजने में बहुत बेहतर काम किया जो केवल अनुमान लगाते थे या वीडियो को देखने के लिए विशाल AI मॉडल का उपयोग करते थे। परिणाम दिखाते हैं कि कंप्यूटर अब समझ सकता है कि "बेचैनी से झुकना" तभी होता है जब "आसपास का जायजा लेना" चल रहा हो, बजाय इसके कि पूरे वाक्य को एक अस्पष्ट ढेर के रूप में माना जाए। लेखक सुझाव देते हैं कि यह भविष्य में डिजिटल पात्रों पर बहुत अधिक सटीक नियंत्रण की ओर ले जा सकता है, जिससे रचनाकारों को केवल एक कहानी टाइप करके जटिल, बहु-चरणीय नृत्य उत्पन्न करने की अनुमति मिलेगी, वह भी मैन्युअल लेबलिंग के उबाऊ काम के बिना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →