← नवीनतम पेपर
💻 computer science

MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction

MotionForesight एक ऐसी विधि है जो मानव-वस्तु अंतःक्रियाओं (human-object interactions) के लिए भविष्य के 3D सीन फ्लो का पूर्वानुमान लगाने हेतु प्रीट्रेंड वीडियो प्रेडिक्शन मॉडल्स को पुन: उपयोग करती है, जो बिना किसी सहायक इनपुट के विविध वस्तुओं और वातावरणों में कुशल सामान्यीकरण (generalization) सक्षम करने के लिए स्यूडो-ग्राउंड-ट्रुथ ट्रैक्स पर एक लाइटवेट एडॉप्टर को प्रशिक्षित करती है।

मूल लेखक: Homanga Bharadhwaj, Yash Jangir

प्रकाशित 2026-07-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Homanga Bharadhwaj, Yash Jangir

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जादूगर के सहायक को ताश की गड्डी की ओर हाथ बढ़ाते हुए देख रहे हैं। आपको यह देखने की ज़रूरत नहीं है कि ताश के पत्ते हवा में कैसे उड़ते हैं; आपका मस्तिष्क तुरंत भौतिकी (physics) का अनुकरण कर लेता है। आप जानते हैं कि ताश के पत्ते ऊपर उठेंगे, शायद फैल जाएंगे, और शायद नीचे गिरेंगे। भविष्य की भविष्यवाणी करने की यह क्षमता, जो वर्तमान के आधार पर होती है, एक ऐसी शक्ति है जो मनुष्यों के पास है, लेकिन इसे रोबोटों को सिखाना अविश्वसनीय रूप से कठिन है। कंप्यूटर विज्ञान की दुनिया में, विशेष रूप से "एम्बोडीड इंटेलिजेंस" (embodied intelligence) नामक एक क्षेत्र में, शोधकर्ता ऐसी मशीनें बनाने की कोशिश कर रहे हैं जो ऐसा ही कर सकें: किसी मानव को किसी वस्तु के साथ बातचीत करते हुए देखते हुए यह अनुमान लगाना कि वह वस्तु 3D स्पेस में ठीक कैसे चलेगी।

इस चुनौती को समझने के लिए, एक फिल्म देखने और एक मानचित्र (मैप) पढ़ने के बीच के अंतर के बारे में सोचें। भविष्य की भविष्यवाणी करने वाले अधिकांश AI मॉडल फिल्म निर्देशकों की तरह होते हैं; वे दृश्य कैसा दिखेगा, यह देखने के लिए पिक्सेल दर पिक्सेल वीडियो के अगले कुछ सेकंड उत्पन्न करने की कोशिश करते हैं। लेकिन एक रोबोट को शर्ट के रंग या दीवार की बनावट की परवाह नहीं होती; उसे ज्यामिति (geometry) की परवाह होती है—एक कप मेज से फिसलते समय जो सटीक 3D पथ लेगा, उसकी। यह शोध पत्र AI को "मूवी जनरेशन" के चरण को छोड़कर सीधे भविष्य की गति के "मानचित्र" को खींचने के लिए सिखाने की समस्या पर काम करता है, और यह केवल एक इंसान द्वारा कुछ रोज़मर्रा के काम करने, जैसे कि दराज खोलने या डिब्बा उठाने के एक छोटे से क्लिप का उपयोग करके किया जाता है।

इस प्रोजेक्ट के पीछे के शोधकर्ताओं ने, जो जॉन्स हॉपकिन्स यूनिवर्सिटी से हैं, एक प्रणाली विकसित की है जिसे वे MotionForesight कहते हैं। उनका बड़ा विचार आश्चर्यजनक रूप से सरल है: रोबोट को भौतिकी समझने के लिए शुरुआत से प्रशिक्षित करने के बजाय, क्यों न उस "सामान्य समझ" (common sense) को उधार लिया जाए जो पहले से ही विशाल वीडियो मॉडलों में मौजूद है? उन्होंने एक शक्तिशाली AI लिया जो पहले से ही मौजूदा वीडियो में वस्तुओं के हिलने-डुलने के तरीके को ट्रैक करने के लिए प्रशिक्षित था (एक "रिट्रोस्पेक्टिव" ट्रैकर) और उसे एक "प्रोएक्टिव" प्रेडिक्टर बनने के लिए प्रेरित किया।

उन्होंने यह जादुई करतब कैसे दिखाया, यहाँ बताया गया है। कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान मित्र है जो एक पूरी हो चुकी पहेली (puzzle) को देखने और यह बताने में माहिर है कि उसका हर टुकड़ा कहाँ गया। मूल वीडियो मॉडल यही करता है; वह पूरे वीडियो को देखता है और एक वस्तु पर बिंदुओं को ट्रैक करता है। शोधकर्ताओं ने पूछा, "क्या होगा यदि हम इस मित्र को पहेली का केवल पहला आधा हिस्सा दिखाएं और उनसे अनुमान लगाने को कहें कि दूसरे हिस्से में टुकड़े कहाँ जाएंगे?" इसे करने के लिए, उन्होंने मनुष्यों द्वारा वस्तुओं के साथ बातचीत करने वाले 40,000 वीडियो लिए (मुख्य रूप से 'Something-Something V2' नामक डेटासेट से) और AI का उपयोग उन पूर्ण वीडियो में जो हुआ था, उसके "नकली" सटीक ट्रैक बनाने के लिए किया। फिर, उन्होंने अपने नए मॉडल, MotionForesight, को उन वीडियो के केवल पहले भाग का उपयोग करके प्रशिक्षित किया, जिससे उसे बाकी हिस्से का अनुमान लगाने के लिए मजबूर किया गया।

परिणाम एक ऐसी प्रणाली है जो एक छोटा सा क्लिप देख सकती है—जैसे कि एक हाथ मग की ओर बढ़ रहा हो—और अगले 15 स्टेप्स (लगभग 0.5 सेकंड का भविष्य का समय) के लिए मग द्वारा लिए जाने वाले सटीक 3D पथ की भविष्यवाणी कर सकती है, और यह सब बिना यह जाने कि उस वस्तु को क्या कहते हैं या मानव क्या कहना चाह रहा है। इसे "कप उठाओ" जैसे भाषा निर्देशों की आवश्यकता नहीं है; यह बस गति को देखता है और भौतिकी को समझ लेता है।

यह शोध पत्र सुझाव देता है कि यह दृष्टिकोण अविश्वसनीय रूप से कुशल है। जबकि अन्य विधियाँ लाखों वीडियो से सीखने की कोशिश करती हैं या काम करने के लिए जटिल भाषा विवरणों की आवश्यकता होती है, MotionForesight ने केवल 40,000 वीडियो का उपयोग करके और बिना किसी भाषा के बेहतर परिणाम प्राप्त किए। जब विभिन्न घरों और कार्यालयों में फोन कैमरों से लिए गए नए, अनदेखे वीडियो पर परीक्षण किया गया, तो मॉडल ने उठाने, फिसलने और वस्तुओं को घुमाने जैसी गतियों की सफलतापूर्वक भविष्यवाणी की। इसने उन बहुत बड़े मॉडलों को भी पीछे छोड़ दिया जिन्हें एक मिलियन से अधिक वीडियो पर प्रशिक्षित किया गया था और जिन्हें भाषा लेबल के साथ अतिरिक्त मदद दी गई थी।

लेखकों ने पाया कि एक वीडियो मॉडल की "स्मृति" को पुन: उपयोग करके, जो पहले से ही यह समझता है कि चीजें कैसे चलती हैं, वे एक हल्का उपकरण बना सकते हैं जो रोबोट को भविष्य का एक स्पष्ट, ज्यामितीय रोडमैप प्रदान करता है। उन्होंने दिखाया कि मॉडल जटिल स्थितियों को संभाल सकता है, जैसे कि ट्रैक पर फिसलती हुई दराज या बंद होने के लिए घूमता हुआ ढक्कन, और यह उन वस्तुओं पर भी काम करता है जिन्हें इसने पहले कभी नहीं देखा है। शोध पत्र निष्कर्ष निकालता है कि यह तरीका रोबोट को गति के बारे में उसी तरह की सहज "अंतर्ज्ञान" (gut feeling) देने की दिशा में एक आशाजनक कदम है जो मनुष्यों के पास होती है, जिससे वे अपने कार्यों के भौतिक परिणामों का होने से पहले ही अनुमान लगा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →