← नवीनतम पेपर
💻 computer science

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

यह शोध पत्र EgoAfford को प्रस्तुत करता है, जो एगोसेंट्रिक (egocentric) दृश्यों में कार्य-उन्मुख एफॉर्डेंस ग्राउंडिंग (task-oriented affordance grounding) के लिए एक बेंचमार्क और डेटासेट है, साथ ही इसमें EgoLens भी शामिल है, जो एक विशेष मल्टीमॉडल मॉडल है जो मल्टी-स्टेप टेबलटॉप कार्यों के लिए नेक्स्ट-स्टेप प्लानिंग (next-step planning) और रोल-विशिष्ट सेगमेंटेशन (role-specific segmentation) को संयुक्त रूप से निष्पादित करता है।

मूल लेखक: Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

प्रकाशित 2026-08-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। आप केवल रोबोट को यह नहीं चाहते कि वह जानता हो कि "चाकू" कैसा दिखता है; आप चाहते हैं कि वह यह भी समझे कि मक्खन फैलाने के लिए उस चाकू का उपयोग कैसे करना है, उसे किस पर फैलाना है, और तैयार स्लाइस को कहाँ रखना है। यह अफोर्डेंस (affordance) की दुनिया है, जो एक फैंसी शब्द है जिसका अर्थ है "कोई वस्तु आपको क्या करने की अनुमति देती है।" एक दरवाजे के हैंडल के बारे में सोचें: उसका आकार घुमाने की अनुमति (affords) देता है। एक कप तरल पदार्थ रखने की अनुमति देता है। लंबे समय तक, रोबोट "हैंडल पकड़ें" जैसे सरल, एक-बार के कार्यों को पहचानने में काफी अच्छे रहे हैं। लेकिन वास्तविक जीवन अव्यवस्थित और बहु-चरणीय (multi-step) होता है। सैंडविच बनाना केवल एक बार पकड़ने जैसा नहीं है; यह योजना बनाने, सही उपकरण उठाने और चीजों को अगली बार कहाँ रखना है, यह जानने से जुड़ी एक पूरी कहानी है। बड़ा सवाल यह है कि वैज्ञानिक क्या पूछ रहे हैं: क्या हम रोबकों को न केवल वस्तुओं को देखना, बल्कि कार्य की कहानी को समझना, अगला कदम तय करना और किसी वस्तु के उन छोटे, विशिष्ट हिस्सों की पहचान करना सिखा सकते हैं जिनकी उस कदम के लिए आवश्यकता है?

यहाँ EgoAfford आता है, एक नया प्रोजेक्ट जो इस पहेली को सुलझाने की कोशिश करता है। यह रोबोट को दुनिया का "प्रथम-व्यक्ति" (first-person) दृश्य देकर इसे हल करता है, ठीक वैसे ही जैसे हम देखते हैं। शोधकर्ताओं ने लगभग 15,500 टेबलटॉप दृश्यों वाली एक विशाल डिजिटल दुनिया बनाई, जिसमें 2,000 अलग-अलग बहु-चरणीय कार्य शामिल हैं। उन्होंने यह देखने के लिए एक "वास्तविक दुनिया" का टेस्ट सेट भी बनाया, जिसमें मनुष्यों द्वारा ली गई 102 तस्वीरें शामिल थीं, ताकि यह देखा जा सके कि क्या रोबोट वास्तविक रसोई की अव्यवस्था को संभाल सकता है। लक्ष्य क्या है? यह देखना कि क्या एक कंप्यूटर एक तस्वीर देख सकता है, "चाय बनाओ" जैसा लक्ष्य पढ़ सकता है, और फिर एक साथ दो काम कर सकता है: 1) बाकी की रेसिपी (योजना) लिख सकता है, और 2) उस चायदानी के सटीक हिस्से पर एक मास्क बना सकता है जिससे आपको चाय डालनी है, उस चम्मच पर जिससे आपको हिलाना है, और उस कप पर जिसमें आपको चाय डालनी है।

इस काम को करने के लिए, टीम ने EgoLens पेश किया, जो विशेष रूप से इस काम के लिए डिज़ाइन किया गया एक स्मार्ट AI मॉडल है। EgoLens को एक रोबोट शेफ के प्रशिक्षु (apprentice) के रूप में समझें जो दृश्य को "पढ़ना" सीख रहा है। अन्य मॉडलों के विपरीत, जो शायद पूरे ऑब्जेक्ट का अनुमान लगा लें या जटिल निर्देशों से भ्रमित हो जाएं, EgoLens को कार्य को उसके सबसे छोटे कार्यात्मक टुकड़ों में तोड़ने के लिए प्रशिक्षित किया गया है। यह केवल यह नहीं कहता कि "वह एक बर्तन है"; यह कहता है, "मुझे चाय डालने के लिए उस बर्तन के मुंह (spout) को पकड़ने की आवश्यकता है, और मुझे हिलाने के लिए चम्मच के हैंडल को पकड़ने की आवश्यकता है।" पेपर दिखाता है कि EgoLens वर्तमान में इस विशिष्ट प्रकार की सोच में सर्वश्रेष्ठ है, जो अन्य बड़े AI मॉडलों और यहाँ तक कि उन व्यावसायिक उपकरणों से भी बेहतर प्रदर्शन करता है जो योजना और दृष्टि (vision) को मिलाने का प्रयास करते हैं।

हालाँकि, शोधकर्ता सावधानीपूर्वक यह नोट करते हैं कि यह अभी कोई जादुई समाधान नहीं है। जबकि EgoLens उनके द्वारा बनाई गई "डिजिटल" छवियों के लिए बेहतरीन है, वास्तविक दुनिया की तस्वीरों के मामले में अभी भी एक अंतर है, जो यह सुझाव देता है कि रोबोट को वास्तविक जीवन की अप्रत्याशित प्रकृति के साथ अभी और अभ्यास करने की आवश्यकता है। अध्ययन बताता है कि अगले चरणों की योजना बनाने की क्षमता को वस्तुओं के सटीक कार्यात्मक हिस्से को पहचानने की क्षमता के साथ जोड़कर, हम रोबोटों को हमारे दैनिक जीवन में सहायक मददगार बनने के बहुत करीब ला सकते हैं। यह मशीनों को न केवल यह समझने में मदद करने की दिशा में एक महत्वपूर्ण कदम है कि चीजें क्या हैं, बल्कि यह भी कि काम पूरा करने के लिए उनका उपयोग कैसे करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →