← नवीनतम पेपर
💻 computer science

Affogato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale

यह शोधपत्र अफ़ोगैटो (Affogato) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जिसमें एक बड़े पैमाने के, ओपन-वोकैबुलरी 3D अफोर्डेंस डेटासेट (Affogato-750K) को उत्पन्न करने के लिए एक पूर्णतः स्वचालित पाइपलाइन और सरल एकीकृत मॉडल (Espresso) शामिल हैं, जो अनदेखी वस्तु और अफोर्डेंस श्रेणियों में सामान्यीकरण (generalization) में महत्वपूर्ण सुधार करते हैं।

मूल लेखक: Junha Lee, Eunha Park, Chunghyun Park, Dahyun Kang, Minsu Cho

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junha Lee, Eunha Park, Chunghyun Park, Dahyun Kang, Minsu Cho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बिल्कुल नया, अजीब दिखने वाला गैजेट है। आप नहीं जानते कि यह क्या करता है, लेकिन आपको यह पता लगाने की ज़रूरत है कि इसे चलाने के लिए आपको इसे कहाँ छूना है। शायद आपको कोई बटन दबाना हो, कोई हैंडल पकड़ना हो, या कोई स्विच खिसकाना हो। रोबोटिक्स और AI की दुनिया में, यह समझने की क्षमता कि "कहाँ छूना है", को अफोर्डेंस ग्राउंडिंग (affordance grounding) कहा जाता है।

लंबे समय तक, कंप्यूटरों को यह कौशल सिखाना किसी बच्चे को केवल उबलते पानी की तस्वीरें दिखाकर खाना बनाना सिखाने जैसा था। यह बहुत सीमित था। मौजूदा डेटासेट्स में केवल कुछ विशिष्ट वस्तुएं (जैसे कुर्सी या कप) और कुछ विशिष्ट क्रियाएं (जैसे बैठना या पीना) थीं। यदि कंप्यूटर को कोई अजीब नई वस्तु दिखाई देती, तो वह खो जाता था।

यह पेपर Affogato पेश करता है, जो एक नया सिस्टम है जिसे कंप्यूटर को यह सिखाने के लिए डिज़ाइन किया गया है कि कैसे किसी भी वस्तु को और उसे किसी भी तरह से कैसे इंटरैक्ट करना है, बिना हर एक चीज़ के लिए मानव द्वारा मैप बनाने की आवश्यकता के।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ रचनात्मक उपमाओं का उपयोग करते हुए:

1. समस्या: "मैनुअल मैप" की बाधा

कल्पना कीजिए कि आप दुनिया की हर वस्तु के लिए सटीक मैप दिखाने वाले विशाल पुस्तकालय का निर्माण करना चाहते हैं।

  • पुराना तरीका: आप एक टीम को काम पर रखते हैं जो वस्तुओं के 3D मॉडल को देखती है और हैंडल, बटन या सीट के चारों ओर एक घेरा बनाती है। यह धीमा, महंगा है, और आप इसे केवल कुछ हज़ार वस्तुओं के लिए ही कर सकते हैं।
  • परिणाम: कंप्यूटर केवल उन कुछ हज़ार चीजों के बारे में सीखता है। यदि आप उसे एक नए प्रकार का टोस्टर दिखाते हैं जिसे उसने पहले कभी नहीं देखा है, तो उसे नहीं पता होता कि कहाँ दबाना है।

2. समाधान: "AI असेंबली लाइन" (Affogato)

लेखकों ने एक पूरी तरह से स्वचालित फैक्ट्री (एक पाइपलाइन) बनाई है जो अपने आप ये मैप बनाती है। उन्होंने इन मैपों को बनाने के लिए इंसानों को काम पर नहीं रखा; उन्होंने काम करने के लिए AI "विशेषज्ञों" की एक टीम को काम पर लगाया।

इसे एक घर बनाने वाली तीन लोगों की निर्माण टीम की तरह समझें:

  • कार्यकर्ता 1 (विचार जनरेटर - Gemma): यह AI एक 3D वस्तु (जैसे कुर्सी की रेंडर की गई छवि) को देखता है और इसका उपयोग करने के रचनात्मक विचार देता है। केवल "बैठें" कहने के बजाय, यह कह सकता है, "पीछे झुकने के लिए इस लीवर को धकेलें" या "इसे उठाने के लिए इस आर्मरेस्ट को पकड़ें।" यह इन अनूठे इंटरैक्शन विचारों के 750,000 उत्पन्न करता है।
  • कार्यकर्ता 2 (संकेत देने वाली उंगली - Molmo): एक बार जब कार्यकर्ता 1 कहता है "इस आर्मरेस्ट को पकड़ें," तो कार्यकर्ता 2 छवि को देखता है और ठीक आर्मरेस्ट पर एक डिजिटल उंगली से इशारा करता है। यह स्थान खोजने में बहुत अच्छा है, लेकिन कभी-कभी यह थोड़ा गलत भी इशारा कर सकता है।
  • कार्यकर्ता 3 (पेंटर - MobileSAM): कार्यकर्ता 2 का बिंदु केवल एक डॉट है। कार्यकर्ता 3 उस डॉट को लेता है और पूरे आर्मरेस्ट के ऊपर एक "हीट मैप" (एक चमकता हुआ लाल क्षेत्र) पेंट करता है ताकि यह दिखाया जा सके कि हैंडल कितना बड़ा है।

जादुई ट्रिक (मल्टी-व्यू वोटिंग):
चूंकि वस्तु 3D है, इसलिए टीम इसे 25 अलग-अलग कोणों से देखती है। यदि कार्यकर्ता 2 20 कोणों से आर्मरेस्ट की ओर इशारा करता है लेकिन 5 में चूक जाता है, तो सिस्टम वोट लेता है। 20 सही वोट जीत जाते हैं, और अंतिम मैप आर्मरेस्ट के ऊपर एक परफेक्ट, चमकता हुआ लाल क्षेत्र होता है।

इस प्रक्रिया ने Affogato-750K बनाया: एक विशाल डेटासेट जिसमें 150,000 अलग-अलग 3D वस्तुओं के लिए 750,000 इंटरैक्शन मैप्स हैं। यह किसी भी पिछले डेटासेट की तुलना में बहुत अधिक प्रकार की वस्तुओं और क्रियाओं को कवर करता है।

3. परीक्षण: "एस्प्रेसो" मॉडल

यह साबित करने के लिए कि यह विशाल डेटासेट वास्तव में मदद करता है, लेखकों ने दो सरल, कुशल मॉडल बनाए जिन्हें Espresso-3D (3D वस्तुओं के लिए) और Espresso-2D (2D छवियों के लिए) नाम दिया गया।

इन मॉडलों को छात्रों के रूप में सोचें।

  • पुराने छात्र: उन्होंने छोटे, पुराने टेक्स्टबुक (पुराने डेटासेट्स) से पढ़ाई की। वे कुर्सी को पहचानने में ठीक थे लेकिन एक अजीब नई वस्तु दिखाए जाने पर विफल रहे।
  • एस्प्रेसो छात्र: उन्हें Affogato-750K डेटासेट को उनके टेक्स्टबुक के रूप में दिया गया।

परिणाम:
जब एस्प्रेसो छात्रों का परीक्षण उन वस्तुओं पर किया गया जिन्हें उन्होंने कभी नहीं देखा था (जैसे कि एक अजीब नया लैंप या एक जटिल मशीन का हिस्सा), तो उन्होंने पुराने छात्रों की तुलना में काफी बेहतर प्रदर्शन किया।

  • वे सामान्यीकरण (generalize) कर सके: क्योंकि उन्होंने इतने अलग-अलग उदाहरण देखे थे, उन्होंने केवल विशिष्ट आकृतियों को याद करने के बजाय "पकड़ने" या "दबाने" की अवधारणा को सीखा।
  • वे वास्तविक दुनिया में काम कर सके: भले ही उनका प्रशिक्षण डेटा साफ, कंप्यूटर-जेनरेटेड 3D मॉडल से बना था, एस्प्रेसो मॉडल वास्तविक दुनिया के, अव्यवस्थित रोबोट वर्कस्पेस की तस्वीरों को देखकर भी सही जगह ढूंढ सकते थे।

4. यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि सबसे बड़ी सफलता केवल नए मॉडल नहीं है, बल्कि डेटासेट स्वयं है।

  • पैमाना (Scale): उन्होंने डेटा को उस पैमाने पर उत्पन्न किया जिसे इंसान मैच नहीं कर सकते थे (750k एनोटेशन)।
  • ओपन-वोकेबुलरी (Open-Vocabulary): सिस्टम 20 शब्दों की सूची तक सीमित नहीं है। यह "इसमें तरल पदार्थ डालें," "नीचे फिसलें," या "सिर पर पहनें" को स्वाभाविक रूप से समझ सकता है क्योंकि AI ये विवरण स्वाभाविक रूप से उत्पन्न करता है।
  • ट्रांसफ़रेबिलिटी (Transferability): इस विशाल डेटासेट पर प्री-ट्रेनिंग करने से अन्य मौजूदा AI मॉडल भी बेहतर हो गए, न कि केवल लेखकों के नए मॉडल।

सारांश

Affogato एक ऐसा सिस्टम है जो सैकड़ों हजारों 3D वस्तुओं के लिए स्वचालित रूप से "टच मैप्स" बनाने के लिए AI मॉडल्स की एक श्रृंखला का उपयोग करता है। इस विशाल, विविध डेटा को सरल AI मॉडल्स (Espresso) में फीड करके, लेखकों ने दिखाया कि कंप्यूटर अंततः यह समझ सकते हैं कि लगभग किसी भी वस्तु के साथ कैसे इंटरैक्ट करना है, यहाँ तक कि उन वस्तुओं के साथ भी जिन्हें उन्होंने पहले कभी नहीं देखा है, और इसके लिए किसी इंसान को एक भी मैप बनाने की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →