← नवीनतम पेपर
💻 computer science

Integrating Affordances and Attention models for Short-Term Object Interaction Anticipation

यह शोध पत्र STAformer और STAformer++ को प्रस्तुत करता है, जो पर्यावरण सामर्थ्य मॉडलिंग (environment affordance modeling) और इंटरेक्शन हॉटस्पॉट भविष्यवाणी के साथ उन्नत नवीन अटेंशन-आधारित आर्किटेक्चर हैं, जो Ego4D और EPIC-Kitchens डेटासेट पर अल्पकालिक वस्तु-इंटरेक्शन प्रत्याशा प्रदर्शन में महत्वपूर्ण सुधार करते हैं।

मूल लेखक: Lorenzo Mur Labadia, Ruben Martinez-Cantin, Jose J. Guerrero, Giovanni M. Farinella, Antonino Furnari

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lorenzo Mur Labadia, Ruben Martinez-Cantin, Jose J. Guerrero, Giovanni M. Farinella, Antonino Furnari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपने चश्मे पर एक स्मार्ट कैमरा पहना हुआ है, जैसे कि भविष्य के चश्मे। आपका लक्ष्य एक रोबोट या डिजिटल असिस्टेंट को यह समझने में मदद करना है कि आप वास्तव में कुछ करने से पहले ही आप क्या करने वाले हैं। यदि आप कॉफी के मग की ओर हाथ बढ़ाते हैं, तो असिस्टेंट को पता होना चाहिए कि कॉफी गिरने से पहले आपको कोस्टर (coaster) थमा देना चाहिए। यदि आप चाकू की ओर हाथ बढ़ाते हैं, तो उसे पता होना चाहिए कि प्लेट को रास्ते से हटा देना चाहिए।

यह पेपर कंप्यूटर को आपके दैनिक जीवन के लिए भविष्यवक्ता (psychics) बनाना सिखाने के बारे में है। विशेष रूप से, यह "शॉर्ट-टर्म ऑब्जेक्ट इंटरैक्शन एन्टिसिपेशन" (STA) पर केंद्रित है। सरल भाषा में: आप अगली बार किस वस्तु को छुएंगे, आप उसके साथ क्या करेंगे, और आप उसे ठीक कब छुएंगे, इसका पूर्वानुमान लगाना।

यहाँ बताया गया है कि लेखकों ने तीन विशेष तरकीबों का उपयोग करके उनका "सुपर-रोबोट ब्रेन" कैसे बनाया, जिसे रोजमर्रा के उदाहरणों के माध्यम से समझाया गया है।

1. "दोहरे-मस्तिष्क" वाला आर्किटेक्चर (STAformer और STAformer++)

अधिकांश पिछले रोबोट वीडियो देखते थे और भविष्य का अनुमान लगाने की कोशिश करते थे, लेकिन वे उस व्यक्ति की तरह थे जो किसी के चिल्लाने के बीच किताब पढ़ने की कोशिश कर रहा हो। उन्हें यह समझने में संघर्ष करना पड़ता था कि उन्होंने अभी क्या देखा (एक स्थिर चित्र) और एक क्षण पहले क्या हुआ था (वीडियो की गति)।

लेखकों ने एक नया सिस्टम बनाया जिसे STAformer (और इसका अपग्रेड संस्करण STAformer++) कहा जाता है, जो दो विशेष मस्तिष्क वाले व्यक्ति की तरह काम करता है:

  • "फ्रीज-फ्रेम" मस्तिष्क: यह आपके द्वारा ली गई आखिरी तस्वीर को देखता है। यह विवरण पहचानने में माहिर है: "वह एक लाल मग है, वह एक लकड़ी की मेज है।"
  • "मूवी-गोअर" मस्तिष्क: यह उस तस्वीर से पहले के कुछ सेकंड के वीडियो को देखता है। यह गति को समझता है: "हाथ मग की ओर तेजी से बढ़ रहा है।"

जादुई गोंद (The Magic Glue): पेपर में एक विशेष "अटेंशन" मैकेनिज्म पेश किया गया है। कल्पना कीजिए कि ये दो मस्तिष्क एक मेज पर बैठे हैं। एक-दूसरे को अनदेखा करने के बजाय, वे लगातार एक-दूसरे की ओर इशारा करते हैं और कहते हैं, "हे, फोटो में उस विवरण को देखो!" या "हे, वीडियो में उस गति पर ध्यान दो!" यह सिस्टम स्थिर विवरणों को गतिशील गति के साथ पूरी तरह से मिलाने की अनुमति देता है।

अपग्रेड (STAformer++): पहले संस्करण ने एक मानक "डिटेक्शन" विधि का उपयोग किया (जैसे एक पारंपरिक सुरक्षा गार्ड जो सूची की जाँच करता है)। नया संस्करण, STAformer++, एक आधुनिक "ट्रांसफॉर्मर" डिटेक्टर का उपयोग करता है (जैसे एक अत्यधिक प्रशिक्षित जासूस जो पूरे दृश्य को एक साथ देखता है और तुरंत कड़ियों को जोड़ता है)। इसने रोबोट को उन वस्तुओं के चारों ओर बॉक्स बनाने में बहुत बेहतर बना दिया जिनका वह पूर्वानुमान लगा रहा है।

2. "कमरे की याददाश्त" (एनवायरनमेंट अफोर्डेंस)

यह इस पेपर का सबसे रचनात्मक हिस्सा है। लेखकों ने महसूस किया कि रोबोट अक्सर भूल जाते हैं कि आप कहाँ हैं, यह मायने रखता है।

  • अवधारणा: मनोविज्ञान में, "अफोर्डेंस" (affordance) का अर्थ है कि एक वातावरण आपको क्या प्रदान करता है। एक कुर्सी बैठने का अवसर देती है; एक दरवाजे का हैंडल घुमाने का अवसर देता है।
  • समस्या: यदि एक रोबोट एक हाथ को आगे बढ़ते हुए देखता है, तो वह अनुमान लगा सकता है कि आप "केला" पकड़ रहे हैं क्योंकि उसने पहले केले देखे थे। लेकिन यदि आप रसोई में हैं, तो रोबोट को पता होना चाहिए कि आप संभवतः एक चम्मच या कप पकड़ रहे हैं, न कि केला।
  • समाधान: टीम ने कमरों की एक विशाल "मेमोरी लाइब्रेरी" बनाई। उन्होंने हजारों वीडियो का विश्लेषण किया ताकि यह सीखा जा सके: "रसोई में, लोग आमतौर पर इन चीजों को छूते हैं। बाथरूम में, वे उन्हें छूते हैं।"
    • विधि A (लाइब्रेरियन): जब रोबोट एक नया वीडियो देखता है, तो वह जल्दी से अपनी लाइब्रेरी चेक करता है: "यह रसोई जैसा लग रहा है। रसोई में लोग आमतौर पर क्या करते हैं?" फिर वह अपने अनुमान को रसोई से संबंधित होने की अधिक संभावना के अनुसार समायोजित करता है।
    • विधि B (लचीला शिक्षार्थी): केवल एक सूची की जाँच करने के बजाय, रोबोट प्रशिक्षण के दौरान अपनी स्मृति से पूछना सीखता है। वह यह सीखता है कि, "यह वीडियो उस समय के बहुत करीब है जब मैंने किसी को दीवार पेंट करते हुए देखा था, इसलिए मुझे 'पेंटब्रश' का पूर्वानुमान लगाना चाहिए।"

यह एक इंसान के नए ऑफिस में जाने जैसा है। भले ही उन्होंने वह विशिष्ट ऑफिस न देखा हो, फिर भी वे जानते हैं कि यदि वे डेस्क देखते हैं, तो वे शायद टूथब्रश नहीं पकड़ेंगे। वे "ऑफिस" के सामान्य ज्ञान का उपयोग करके एक स्मार्ट अनुमान लगाते हैं।

3. "हॉटस्पॉट" मैप (इंटरैक्शन हॉटस्पॉट्स)

कभी-कभी रोबोट सही वस्तु का अनुमान लगा लेता है लेकिन गलत स्थान का। वह सोच सकता है कि आप कप पकड़ रहे हैं, लेकिन उसे लगता है कि आप उसे छत से पकड़ रहे हैं।

  • ट्रिक: लेखकों ने "इंटरैक्शन हॉटस्पॉट्स" का पूर्वानुमान लगाने वाला एक मॉड्यूल जोड़ा है। यह आपके हाथों और वे जहाँ जा रहे हैं, उसे देखता है और स्क्रीन पर एक चमकता हुआ नक्शा बनाता है जो दिखाता है कि अगला स्पर्श कहाँ होने की सबसे अधिक संभावना है।
  • परिणाम: यदि रोबोट भविष्यवाणी करता है कि आप एक कप पकड़ेंगे, लेकिन "हॉटस्पॉट मैप" कहता है कि आपका हाथ कप के पास कहीं भी नहीं है, तो रोबोट अपने आत्मविश्वास को कम कर देता है। यह एक मौसम पूर्वानुमानकर्ता की तरह है जो कहता है, "बारिश हो सकती है, लेकिन चूंकि बादल दूर जा रहे हैं, इसलिए मैं 100% निश्चित नहीं हूँ।" यह खराब अनुमानों को फ़िल्टर करता है।

परिणाम: यह क्यों मायने रखता है?

टीम ने दैनिक कार्यों (जैसे Ego4D और EPIC-Kitchens डेटासेट में खाना पकाने) को करने वाले लोगों के विशाल डेटासेट पर अपने सिस्टम का परीक्षण किया।

  • स्कोर: उनके नए सिस्टम ने सभी पिछले रिकॉर्ड तोड़ दिए। कुछ परीक्षणों में, इसने सटीकता में 30% तक सुधार किया।
  • प्रभाव: इसका मतलब है कि पहनने योग्य उपकरण (जैसे स्मार्ट चश्मा) और घरेलू रोबोट जल्द ही आपकी जरूरतों का बेहतर अनुमान लगा पाएंगे।
    • पहले: आप कॉफी पॉट की ओर हाथ बढ़ाते हैं, और रोबोट आपको चम्मच थमा देता है।
    • बाद में: रोबोट आपके हाथ की गति देखता है, "किचन मेमोरी" की जाँच करता है, आपके हाथ के प्रक्षेपवक्र (trajectory) को देखता है, और आपके पूछने से पहले ही आपको कॉफी पॉट थमा देता है।

सारांश

यह पेपर कंप्यूटर को केवल "देखना" ही नहीं बल्कि "समझना" सिखाने के बारे में है। तेज आँखों (इमेज विश्लेषण), अच्छी याददाश्त (वीडियो मोशन), संदर्भ संबंधी बुद्धिमत्ता (जानना कि किचन बनाम बाथरूम में क्या होता है), और स्थानिक जागरूकता (आपका हाथ कहाँ जा रहा है) को मिलाकर, उन्होंने एक ऐसा सिस्टम बनाया है जो वास्तव में आपके अगले कदम का पूर्वानुमान लगा सकता है।

यह एक सुरक्षा कैमरे के बीच का अंतर है जो केवल अपराध को रिकॉर्ड करता है और एक बॉडीगार्ड के बीच का अंतर है जो अपराध होने से पहले ही उसे रोक देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →