← नवीनतम पेपर
💻 computer science

WHOLE: World-Grounded Hand-Object Lifted from Egocentric Videos

WHOLE एक नवीन विधि है जो एक सीखे हुए जनरेटिव प्रायर (generative prior) का लाभ उठाकर हाथ और वस्तु की गति के बीच उनके अंतर्संबंधों के बारे में संयुक्त रूप से तर्क देती है, जिससे चुनौतीपूर्ण इगोसेंट्रिक (egocentric) वीडियो से वर्ल्ड स्पेस में हाथ और वस्तु की गति का समग्र रूप से पुनर्निर्माण करती है, और इस प्रकार अवरोधों (occlusions) को संभालने और सुसंगत हाथ-वस्तु संबंधों को सुनिश्चित करने में अत्याधुनिक प्रदर्शन प्राप्त करती है।

मूल लेखक: Yufei Ye, Jiaman Li, Ryan Rong, C. Karen Liu

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yufei Ye, Jiaman Li, Ryan Rong, C. Karen Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पूरे पेपर का विवरण दिया गया है, जिसे रोज़मर्रा की भाषा में कुछ रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

बड़ी समस्या: "आंखों पर पट्टी बंधा जादूगर"

कल्पना कीजिए कि आपने अपने सिर पर एक GoPro कैमरा पहना हुआ है। आप अपने किचन में घूमते हैं, एक कॉफी मग उठाते हैं, उसे नीचे रखते हैं, एक केला उठाते हैं और दरवाजे से बाहर निकल जाते हैं।

इस वीडियो को समझने की कोशिश कर रहे कंप्यूटर के लिए, यह एक बुरा सपना है।

  1. कैमरा हिल रहा है: दुनिया घूम रही है क्योंकि आपका सिर हिल रहा है, न कि केवल वस्तुएं।
  2. "ब्लाइंड स्पॉट्स" (अंधे धब्बे): आपके हाथ अक्सर वस्तुओं के दृश्य को रोक देते हैं। कभी-कभी वस्तु आपकी पीठ के पीछे गायब हो जाती है या कमरे से बाहर चली जाती है।
  3. तालमेल की कमी: अधिकांश वर्तमान AI प्रोग्राम या तो यह अनुमान लगाने की कोशिश करते हैं कि आपके हाथ कहाँ हैं या वस्तु कहाँ है, लेकिन वे इसे अलग-अलग करते हैं। यह एक पहेली को हल करने जैसा है जहाँ आप किनारे के टुकड़ों और बीच के टुकड़ों को अलग-अलग कमरों में देखकर हल करने की कोशिश कर रहे हैं और फिर उम्मीद कर रहे हैं कि वे फिट बैठ जाएंगे। अक्सर, AI सोचता है कि आपका हाथ हवा में तैर रहा है या कॉफी मग आपके हाथ के बीच से किसी भूत की तरह गुजर रहा है।

समाधान: WHOLE (एक "सहज कोरियोग्राफर")

लेखक WHOLE (वर्ल्ड-ग्राउंडेड हैंड-ऑब्जेक्ट लिफ्टेड फ्रॉम एगोसेंट्रिक वीडियो) पेश करते हैं। WHOLE को एक कैलकुलेटर के रूप में नहीं, बल्कि एक सहज कोरियोग्राफर के रूप में सोचें जिसने लोगों को वस्तुओं के साथ बातचीत करते हुए लाखों वीडियो देखे हैं।

हर मूवमेंट को गणितीय रूप से शून्य से कैलकुलेट करने के बजाय, WHOLE एक "जेनरेटिव प्रायर" (generative prior) का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक मूवी सीन का अंत अनुमान लगाने की कोशिश कर रहे हैं जहाँ एक व्यक्ति कप उठाता है। भले ही कैमरा हिल रहा हो या कप एक सेकंड के लिए छिप गया हो, आप (इंसान) जानते हैं कि कप हाथ में ही होना चाहिए, न कि तीन फीट दूर हवा में तैर रहा हो। आपके पास एक आंतरिक "मूवी स्क्रिप्ट" है कि भौतिकी (physics) और मानव हाथ कैसे काम करते हैं।
  • WHOLE की सुपरपावर: WHOLE ने विशेष रूप से हाथों और वस्तुओं के लिए इस "मूवी स्क्रिप्ट" (एक जेनरेटिव प्रायर) को सीखा है। वह जानता है कि यदि हाथ किसी बॉक्स के पास है, तो बॉक्स आमतौर पर हाथ के साथ ही चलता है। यदि हाथ छोड़ देता है, तो बॉक्स रुक जाता है या गिर जाता है। वह केवल उनकी व्यक्तिगत स्थितियों को नहीं, बल्कि उनके बीच के संबंध को समझता है।

यह कैसे काम करता है: "गाइडेड इम्प्रोव" (निर्देशित तात्कालिकता)

WHOLE केवल अनुमान नहीं लगाता; यह एक "गाइडेड इम्प्रोव" सत्र करता है।

  1. रफ ड्राफ्ट: यह एक बुनियादी, थोड़े बिखरे हुए अनुमान के साथ शुरू होता है कि हाथ और वस्तु कहाँ हो सकते हैं (जैसे एक रफ स्केच)।
  2. "डायरेक्टर के नोट्स" (मार्गदर्शन): यह आपके द्वारा दिए गए वास्तविक वीडियो को देखता है।
    • विजुअल संकेत: "हे, वीडियो दिखा रहा है कि हाथ अभी बॉक्स को ढंक रहा है।"
    • कॉन्टैक्ट संकेत: यह एक स्मार्ट AI असिस्टेंट (एक विजन-लैंग्वेज मॉडल) का उपयोग करता है जो वीडियो को देखता है और कहता है, "मुझे लगता है कि उंगलियां हैंडल को छू रही हैं।"
  3. रिफाइनमेंट (परिष्करण): WHOLE अपने रफ ड्राफ्ट को लेता है और उसे डायरेक्टर के नोट्स के अनुसार ठीक करता है, जबकि पहले से सीखे गए भौतिकी के नियमों का सख्ती से पालन करता है। यह सुनिश्चित करता है कि हाथ टेबल के आर-पार न जाए और वस्तु टेलीपोर्ट न हो जाए।

यह गेम चेंजर क्यों है

पिछले तरीके दो अलग-अलग अभिनेताओं की तरह थे जो एक-दूसरे से बात किए बिना अपनी लाइनें याद करने की कोशिश कर रहे थे।

  • पुराना तरीका: अभिनेता A (हाथ) कहता है, "मैं यहाँ हूँ!" अभिनेता B (वस्तु) कहता है, "मैं वहाँ हूँ!" उन्हें एहसास नहीं होता कि वे हाथ मिला रहे हैं, इसलिए वीडियो अजीब और ग्लिच वाला दिखता है।
  • WHOLE: डायरेक्टर (WHOLE) उनसे कहता है, "तुम बॉक्स पकड़े हुए हो। साथ में चलो।" परिणाम एक सहज, वास्तविक 3D मूवी है जहाँ हाथ और वस्तु एक एकल, तार्किक इकाई के रूप में चलते हैं, भले ही कैमरा हिल रहा हो या वस्तु कुछ क्षण के लिए ओझल हो जाए।

भविष्य का "जादुई करतब"

पेपर एक शानदार अनुप्रयोग भी दिखाता है: हैंड-गाइडेड प्लानिंग।
चूंकि WHOLE समझता है कि हाथ और वस्तुएं कैसे परस्पर क्रिया करती हैं, इसलिए आप इसे हाथ की गति का एक रफ विचार (जैसे, "शेल्फ की ओर हाथ बढ़ाना") और एक कॉन्टैक्ट निर्देश ("कैन उठाना") दे सकते हैं, और यह पूरी प्रक्रिया का एक वास्तविक 3D एनिमेशन बना सकता है।

यह रोबोटिक्स के लिए बहुत बड़ा है। रोबोट को हजारों कठोर नियमों के साथ प्रोग्राम करने के बजाय, हम उसे एक "वाइब" (हाथ का एक रफ रास्ता) दे सकते हैं, और WHOLE उन वास्तविक विवरणों को भर सकता है कि रोबोट को वास्तव में वस्तु को कैसे पकड़ना और हिलाना चाहिए।

सारांश

WHOLE एक ऐसा AI है जो हाथों और वस्तुओं को अलग-अलग चीजों के रूप में देखना बंद कर देता है। इसके बजाय, यह उन्हें एक टीम के रूप में मानता है। मानव संपर्क के "नृत्य" को सीखकर, यह अत्यधिक सटीकता के साथ शेकी (shaky), फर्स्ट-पर्सन कैमरा फुटेज से 3D वीडियो को पुनर्गठित कर सकता है, और जब चीजें दृष्टि से बाहर हो जाती हैं या ब्लॉक हो जाती हैं, तो खाली जगहों को भर सकता है। यह एक अराजक, धुंधले वीडियो को एक स्पष्ट, भौतिक रूप से संभव 3D कहानी में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →