← नवीनतम पेपर
💻 computer science

VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model

यह शोध पत्र **VideoAfford** को प्रस्तुत करता है, जो एक फ्रेमवर्क है जो मानव-वस्तु-परस्परक्रिया (human-object-interaction) वाले वीडियो से गतिशील परस्परक्रिया पूर्ववृत्त (dynamic interaction priors) निकालकर सूक्ष्म 3D अफोर्डेंस ग्राउंडिंग प्राप्त करने के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स और एक नए बड़े पैमाने के वीडियो-आधारित डेटासेट (**VIDA**) का लाभ उठाता है।

मूल लेखक: Hanqing Wang, Mingyu Liu, Xiaoyu Chen, Chengwei MA, Yiming Zhong, Wenti Yin, Yuhao Liu, Zhiqing Cui, Jiahao Yuan, Lu Dai, Zhiyuan Ma, Hui Xiong

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hanqing Wang, Mingyu Liu, Xiaoyu Chen, Chengwei MA, Yiming Zhong, Wenti Yin, Yuhao Liu, Zhiqing Cui, Jiahao Yuan, Lu Dai, Zhiyuan Ma, Hui Xiong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रसोई का उपयोग करना सिखा रहे हैं।

यदि आप रोबोट को एक मग की स्थिर फोटो (still photo) दिखाते हैं, तो वह उसका हैंडल तो देख सकता है, लेकिन वह उसे पकड़ने की प्रक्रिया को वास्तव में "समझ" नहीं पाता। यदि आप उसे एक टेक्स्ट निर्देश (text instruction) देते हैं जैसे "मग उठाओ," तो वह जानता है कि मग क्या है, लेकिन उसे यह नहीं पता कि उसकी मैकेनिकल उंगलियों के लिए "स्वीट स्पॉट" (सही जगह) कहाँ है।

VideoAfford के पीछे के शोधकर्ताओं ने महसूस किया कि रोबोट को वास्तव में स्मार्ट बनाने के लिए, हमें उन्हें केवल तस्वीरें या शब्द नहीं दिखाने चाहिए—हमें उन्हें इंसानों द्वारा वास्तव में काम करने के वीडियो दिखाने चाहिए।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर का विवरण दिया गया है:

1. समस्या: "मूर्ति" बनाम "नर्तक" (The "Statue" vs. The "Dancer")

अधिकांश वर्तमान AI मॉडल वस्तुओं के बारे में ऐसे सीखते हैं जैसे वे मूर्तियों को देख रहे हों। वे एक हथौड़े को देखते हैं और जानते हैं कि यह एक हथौड़ा है, लेकिन उनमें उस "लय" (rhythm) की कमी होती है कि हथौड़े का वास्तव में उपयोग कैसे किया जाता है। वे गति (motion), दबाव (pressure) और समय (timing) को नहीं समझ पाते।

शोधकर्ता तर्क देते हैं कि किसी वस्तु की अफोर्डेंस (affordance) (जो कि केवल एक भारी शब्द है जिसका अर्थ है "मैं इसके साथ क्या कर सकता हूँ?") को समझने के लिए, आपको नृत्य देखने की आवश्यकता है—एक मानव हाथ और एक वस्तु के बीच का गतिशील संवाद।

2. समाधान: VIDA ("रोबोट्स के लिए YouTube")

इस समस्या को हल करने के लिए, टीम ने VIDA बनाया, जो डेटा का एक विशाल नया पुस्तकालय है।

  • इसे ऐसे समझें: एक छात्र को पाठ्यपुस्तक (स्थिर चित्र/टेक्स्ट) देने के बजाय, उन्होंने छात्र को "कैसे करें" (How-To) वीडियो का एक विशाल संग्रह (38,000 क्लिप्स) दिया, जो वस्तुओं के 3D डिजिटल मॉडल के साथ जुड़े हुए हैं।
  • यह किसी को खाना बनाना सिखाने जैसा है, न कि केवल रेसिपी पढ़कर, बल्कि हजारों शेफ को वास्तव में सब्जियां काटते, मिलाते और डालते हुए देखकर।

3. मस्तिष्क: VideoAfford (द "सुपर-ऑब्जर्वर")

शोधकर्ताओं ने VideoAfford नामक एक सिस्टम बनाया। आप इस सिस्टम को तीन विशिष्ट "इंद्रियों" वाले हिस्से के रूप में देख सकते हैं:

  • एक्शन आई (The Action Encoder): यह हिस्सा केवल वस्तु को नहीं देखता; यह गति को देखता है। यह गति के "वाइब" (vibe) को पकड़ता है—क्या यह एक तेज़ चुभन है, एक धीमी खिंचाव है, या एक भारी पकड़ है?
  • दुनिया-जानने वाला दिमाग (The MLLM): यह एक लार्ज लैंग्वेज मॉडल (जैसे ChatGPT का स्मार्ट संस्करण) है जिसने इंटरनेट पर लगभग सब कुछ "पढ़ा" है। यह "कॉमन सेंस" (सामान्य ज्ञान) को मेज पर लाता है। यदि यह किसी हैंडल का उपयोग करने का वीडियो देखता है, तो इसका "कॉमन सेंस" इसे बताता है, "हे, यह पकड़ने के लिए बनाई गई जगह है!"
  • स्थानिक मानचित्र (The 3D Decoder): यह हिस्सा उस वीडियो ज्ञान को लेता है और उसे एक 3D मॉडल पर "पेंट" करता है। यह केवल यह नहीं कहता कि "मग पकड़ने योग्य है"; यह उन सटीक 3D निर्देशांकों (coordinates) को हाइलाइट करता है जहाँ रोबोट की उंगलियाँ जानी चाहिए।

4. सीक्रेट सॉस: "स्पेशियल लॉस" (The "Spatial Loss")

शोधकर्ताओं ने Spatial Loss नामक एक चतुर गणितीय ट्रिक जोड़ी।

  • उपमा: कल्पना कीजिए कि आप एक नक्शा रंग रहे हैं। यदि आप क्रेयॉन का उपयोग करते हैं और रेखाओं से बाहर रंग देते हैं या हर जगह छोटे-छोटे सफेद अंतराल छोड़ देते हैं, तो नक्शा बेकार है।
  • "Spatial Loss" एक स्थिर हाथ की तरह काम करता है जो AI को "एक्शन योग्य क्षेत्र" को एक सुचारू, निरंतर और तार्किक आकार में रंगने के लिए मजबूर करता है। यह AI को यह कहने से रोकता है कि, "हैंडल पकड़ने योग्य है... लेकिन केवल इन तीन छोटे, अलग-थलग बिंदुओं पर।" यह AI को हैंडल को एक ठोस, उपयोगी टुकड़े के रूप में देखना सिखाता है।

यह क्यों मायने रखता है?

अंत में, यह शोध एम्बोडीड AI (Embodied AI) की दिशा में एक बड़ा कदम है—ऐसे रोबोट जो केवल लैब में स्क्रीन देखते नहीं रहते, बल्कि ऐसे रोबोट जो आपकी रसोई में आ सकते हैं, आपको कॉफी बनाते हुए देख सकते हैं, और फिर आपकी मदद के लिए आगे बढ़ सकते हैं क्योंकि वे वास्तव में समझते हैं कि दुनिया कैसे चलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →