← नवीनतम पेपर
💻 computer science

Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation

यह शोध पत्र एगोसेंट्रिक मैनिपुलेशन (egocentric manipulation) के लिए स्पेशियली प्रॉम्प्टेड विजुअल ट्रैजेक्टरी प्रेडिक्शन (Spatially Prompted Visual Trajectory Prediction - SP-VTP) के नवीन कार्य को प्रस्तुत करता है, जो नए EgoSPT डेटासेट और SPOT मॉडल द्वारा समर्थित है, जो गतिशील और अव्यवस्थित वातावरण में भविष्य के एंड-इफेक्टर प्रक्षेप पथों (end-effector trajectories) का पूर्वानुमान लगाने के लिए प्रारंभिक स्थानिक प्रॉम्प्ट्स (spatial prompts) का लाभ उठाता है।

मूल लेखक: Yifan Li, Xinyu Zhou, Yunhao Ge, Yu Kong

प्रकाशित 2026-05-20
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yifan Li, Xinyu Zhou, Yunhao Ge, Yu Kong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक आर्म को एक मेज पर बिखरे हुए विशिष्ट कांटे (fork) को उठाने और उसे एक विशिष्ट कटोरे में रखने के लिए प्रशिक्षित कर रहे हैं।

समस्या: "कौन सा कांटा?" का भ्रम
आमतौर पर, हम रोबोट को बताने के लिए शब्दों का उपयोग करते हैं जैसे "कांटा उठाओ" या किसी कार्य के लिए कोड नंबर देते हैं। लेकिन एक अव्यवधित रसोई में जहाँ पाँच एक जैसे कांटे और तीन कटोरे हों, "वह कांटा" कहना भ्रमित करने वाला है। रोबोट को पता नहीं चलेगा कि आपका मतलब किस कांटे से है या आप उसे किस कटोरे में डालना चाहते हैं। यह बिल्कुल वैसा ही है जैसे लाखों किताबों वाली लाइब्रेरी में अपने दोस्त को कहना कि "वह किताब उठाओ"; उन्हें सटीक रूप से पता होना चाहिए कि आप किसकी बात कर रहे हैं।

समाधान: अपनी उंगली से इशारा करना
यह शोध पत्र रोबोट से बात करने का एक नया तरीका पेश करता है: स्पेशियल प्रॉम्प्टिंग (Spatial Prompting)। शब्दों के बजाय, आप बस उस वस्तु की ओर इशारा करते हैं जिसे आप हिलाना चाहते हैं और उस स्थान की ओर जहाँ आप उसे ले जाना चाहते हैं, जो पहले वीडियो फ्रेम में होता है। यह बिल्कुल वैसा ही है जैसे रोबोट शुरू होने से पहले एक फोटो पर कांटे के चारों ओर एक छोटा बॉक्स और कटोरे के चारों ओर एक बॉक्स बनाना।

नया खेल: SP-VTP
लेखक इस नए चैलेंज को SP-VTP (Spatially Prompted Visual Trajectory Prediction) कहते हैं।

  • सेटअप: आप रोबोट को अपने पॉइंट्स/बॉक्सेस (प्रॉम्प्ट) के साथ एक "स्नैपशॉट" देते हैं।
  • कार्य: रोबमाट फिर अपने दृष्टिकोण (egocentric view) से दृश्य का वीडियो देखता है और उसे यह अनुमान लगाना होता है कि काम पूरा करने के लिए उसके हाथ (end-effector) द्वारा लिया जाने वाला पूरा रास्ता क्या होगा।
  • ट्विस्ट: रोबोट को वह रास्ता समझना होता है जबकि कैमरा हिल रहा हो, हाथ दृश्य को बाधित कर रहा हो, और वस्तुएं खिसक रही हों। यह एक डांस रूटीन का अनुमान लगाने जैसा है जबकि संगीत बदल रहा हो और स्टेज घूम रहा हो।

डेटासेट: EgoSPT (अभ्यास का मैदान)
इस कौशल को सिखाने के लिए, शोधकर्ताओं ने EgoSPT नामक एक नया डेटासेट बनाया है।

  • उन्होंने एक विशेष हैंडहेल्ड डिवाइस (एक संशोधित "यूनिवर्सल मैनिपुलेशन इंटरफेस") का उपयोग किया जो एक रोबोटिक हाथ की तरह काम करता है लेकिन इसे एक इंसान द्वारा नियंत्रित किया जाता है।
  • उन्होंने लोगों द्वारा कांटे उठाने और उन्हें कप, कटोरे और प्लेटों में रखने के हजारों वीडियो रिकॉर्ड किए।
  • महत्वपूर्ण रूप से, उन्होंने हर वीडियो के पहले फ्रेम में "इशारा करने वाले" एनोटेशन (बॉक्सेस) जोड़े, जिससे इस "पॉइंट-एंड-प्रेडिक्ट" खेल के लिए एक आदर्श अभ्यास मैदान तैयार हुआ।

रोबोट का दिमाग: SPOT
उन्होंने एक नया रोबोट पॉलिसी (रोबोट का मस्तिष्क) बनाया जिसे SPOT (Spatially Prompted Object-Target Policy) कहा जाता है। SPOT को एक तीन-भागों वाली टीम के रूप में सोचें:

  1. टास्क रीडर (Task Reader): यह पहले फ्रेम को देखता है, आपके "पॉइंटिंग" बॉक्सेस को पढ़ता है, और लक्ष्य को समझता है। यह दृश्य को पहचानने के लिए एक शक्तिशाली विजुअल AI (DINOv2) का उपयोग करता है।
  2. ऑब्जर्वर (Observer): यह वर्तमान वीडियो फीड को देखता है और रोबोट द्वारा किए गए पिछले कुछ मूव्स को याद रखता है (जैसे डांस के पिछले कुछ स्टेप्स को याद रखना)।
  3. प्रेडिक्टर (Predictor): यह लक्ष्य (टास्क रीडर से) और वर्तमान स्थिति (ऑब्जर्वर से) को जोड़ता है ताकि भविष्य के उस पथ को बना सके जिसे रोबोट के हाथ को लेना चाहिए।

उन्होंने इसका परीक्षण कैसे किया
उन्होंने केवल एक आदर्श कमरे में परीक्षण नहीं किया। उन्होंने तीन अलग-अलग "दुनियाओं" में परीक्षण किया:

  1. दृश्य 1: एक साफ, व्यवस्थित मेज।
  2. दृश्य 2: एक अव्यवधित, बिखरी हुई मेज जिसमें अतिरिक्त चीजें रोबोट को विचलित कर रही थीं।
  3. दृश्य 3: विभिन्न अव्यवधित मेजों का एक जंगली मिश्रण।

उन्होंने पाया कि जब रोबोट को "पॉइंटिंग" बॉक्सेस दिए गए थे, तो वह शब्दों के आधार पर अनुमान लगाने या बिना किसी निर्देश के अनुमान लगाने की तुलना में सही पथ का अनुमान लगाने में बहुत बेहतर था। इमेज पर बने बॉक्सेस को "देखने" और बॉक्सेस के कोऑर्डिनेट्स को "पढ़ने" का संयोजन सबसे अच्छा काम करता था।

निष्कर्ष
यह शोध पत्र यह सिद्ध करता है कि यदि आप चाहते हैं कि रोबोट एक जैसी दिखने वाली वस्तुओं वाले अव्यवधित कार्यों को संभाल सके, तो बात करने से बेहतर इशारा करना है। पहले फ्रेम पर "यहाँ से शुरू करें, वहाँ जाएँ" का एक सरल विजुअल मैप देकर, यह सफलतापूर्वक उन जटिल गतिविधियों का अनुमान लगा सकता है जिन्हें काम पूरा करने के लिए आवश्यक है, भले ही दृश्य अपने चारों ओर बदल रहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →