Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation
यह शोध पत्र Afford-X को प्रस्तुत करता है, जो बड़े पैमाने के LVIS-Aff डेटासेट द्वारा संवर्धित एक संक्षिप्त और कुशल एंड-टू-एंड ट्रेन करने योग्य मॉडल है, जो कार्य-उन्मुख रोबोटिक हेरफेर (manipulation) के लिए बेहतर सामान्यीकरण योग्य अफोर्डेंस तर्क (affordance reasoning) प्राप्त करता है और साथ ही गैर-LLM विधियों से काफी बेहतर प्रदर्शन करता है और GPT-4V की तुलना में तेज़ इन्फरेंस (inference) प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप वस्तुओं से भरे एक कमरे में टहल रहे हैं: एक शिमला मिर्च, एक जूता, एक लैंप और एक खोखला पत्थर। एक इंसान केवल "लाल चीज़" या "चमकदार चीज़" नहीं देखता। वह तुरंत समझ जाता है कि शिमला मिर्च में पानी हो सकता है, जूता एक हथौड़े का काम कर सकता है, और पत्थर एक बैठने की जगह हो सकता है। यह सुपरपावर जिसे अफोर्डेंस रीजनिंग (affordance reasoning) कहा जाता है। यह किसी वस्तु को देखने और यह समझने की क्षमता है कि उसके रूप और अहसास के आधार पर आप उसके साथ क्या कर सकते हैं। रोबोटों के लिए हमारे अस्त-व्यस्त, वास्तविक संसार में कुछ भी उपयोगी करने के लिए—जैसे सैंडविच बनाने या कमरा साफ करने के लिए—उन्हें इसी सुपरपावर की आवश्यकता है। वे केवल यह सुनकर नहीं रुक सकते कि "कप उठाओ।" उन्हें यह समझना होगा, "ओह, वह चीज़ जो वहाँ है वह एक कप है, इसलिए मैं इसका उपयोग पानी पीने के लिए कर सकता हूँ," भले ही कप आधा छिपा हुआ हो या थोड़ा अजीब दिखता हो।
बड़ी समस्या यह है कि वर्तमान रोबोट दिमाग या तो इसे खुद समझने में बहुत मंद होते हैं, या वे इतने विशाल और जटिल (विशाल AI मॉडल की तरह) होते हैं कि वे एक रोबोट के सिर के अंदर तेज़ी से चलने के लिए फिट नहीं हो पाते। वे या तो शब्दों से भ्रमित हो जाते हैं या सोचने में बहुत अधिक समय लेते हैं। यह पेपर एक नया समाधान पेश करता है जिसे Afford-X कहा जाता है। इसे एक "स्मार्ट, स्लिम रोबोट ब्रेन" के रूप में सोचें जो विशेष रूप से एक तस्वीर और एक कार्य (जैसे "अपने शरीर को सुखाएं") को देखने और तुरंत सबसे अच्छे उपकरण (एक तौलिया) की ओर इशारा करने के लिए प्रशिक्षित किया गया है, जिससे वह ध्यान भटकाने वाली चीज़ों को अनदेखा कर सके। इसे एक स्थानीय कंप्यूटर पर चलाने के लिए पर्याप्त छोटा, वास्तविक समय में काम करने के लिए पर्याप्त तेज़, और नई स्थितियों को संभालने के लिए पर्याप्त स्मार्ट बनाया गया है जिन्हें इसने पहले कभी नहीं देखा है।
समस्या: संज्ञाओं (Nouns) से विचलित होते रोबोट
यह समझने के लिए कि यह पेपर क्यों महत्वपूर्ण है, कल्पना करें कि आप एक रोबोट के साथ "साइमन कहता है" (Simon Says) खेल खेल रहे हैं। आप कहते हैं, "किसी चीज़ से बोतल को साफ करो।" एक मानक रोबोट चित्र को देख सकता है, एक चमकदार बोतल देख सकता है, और तुरंत बोतल को पकड़ लेगा। यह विफल हो जाता है क्योंकि वह "साफ करने" की क्रिया को समझने के बजाय "बोतल" संज्ञा पर अटक गया। वह समझता है कि बोतल ही वह उपकरण है, न कि वह वस्तु जिसे साफ किया जाना है। यह एक ऐसे छात्र की तरह है जो फल सलाद के बारे में गणित के सवाल में "सेब" शब्द पढ़ता है और वास्तव में गणित हल करना भूल जाता है।
वर्तमान AI मॉडल अक्सर एक रोबोट के स्थानीय कंप्यूटर पर चलाने के लिए बहुत बड़े होते हैं (उन्हें विशाल सर्वरों की आवश्यकता होती है), और छोटे मॉडल अक्सर उपकरण और लक्ष्य के बीच अंतर समझने में बहुत मूर्ख होते हैं। उनमें यह "सामान्य ज्ञान" की कमी होती है कि नैपकिन एक बोतल को साफ करता है, लेकिन एक बोतल खुद को साफ नहीं कर सकती।
समाधान: Afford-X और "टीचर-स्टूडेंट" ट्रिक
लेखकों ने एक नया सिस्टम बनाया है जिसे Afford-X कहा जाता है। यह एक "स्लिम" AI मॉडल की तरह है जो एक स्थानीय डिवाइस पर फिट हो जाता है लेकिन आश्चर्यजनक रूप से स्मार्ट है। इसे विशाल बनाए बिना स्मार्ट बनाने के लिए, उन्होंने नॉलेज डिस्टिलेशन (knowledge distillation) नामक एक चतुर प्रशिक्षण ट्रिक का उपयोग किया।
कल्पना कीजिए कि एक मास्टर शेफ (टीचर) है जो जानता है कि एक आदर्श भोजन कैसे पकाया जाता है। शेफ हर सामग्री के नाम (जैसे "सोफा" या "कप") को जानता है। अब, कल्पना कीजिए कि एक छात्र शेफ (स्टूडेंट) है जो सीखने की कोशिश कर रहा है लेकिन उसे अभी तक सामग्रियों के विशिष्ट नाम जानने की अनुमति नहीं है; वह केवल निर्देशों को जानता है जैसे "किसी चीज़ पर आराम से बैठें।"
पेपर की विधि इस प्रकार काम करती है:
- टीचर विशिष्ट नामों (जैसे "सोफे पर बैठें") का उपयोग करके सीखता है।
- स्टूडेंट अस्पष्ट शब्दों (जैसे "किसी चीज़ पर बैठें") का उपयोग करके सीखता है।
- टीचर केवल स्टूडेंट को उत्तर नहीं बताता; वह स्टूडेंट को सोचना सिखाता है। वह कहता है, "जब तुम इस आकार को देखो और 'बैठें' सुनो, तो 'सोफा' के बारे में सोचो, भले ही तुम अभी शब्द न जानते हो।"
यह स्टूडेंट (अंतिम रोबोट मॉडल) को हर वस्तु के नाम के विशाल डेटाबेस की आवश्यकता के बिना, उपकरण की अवधारणा को समझने की अनुमति देता है। वह सही वस्तु के "एहसास" को सीखता है।
गुप्त मंत्र: वर्ब अटेंशन और बाई-फ्यूजन
यह सुनिश्चित करने के लिए कि रोबोट वस्तु के बजाय क्रिया पर ध्यान केंद्रित करे, लेखकों ने AI के दिमाग में दो विशेष उपकरण जोड़े हैं:
- वर्ब अटेंशन (VA): यह क्रिया शब्दों के लिए एक हाइलाइटर पेन की तरह है। जब रोबोट "बोतल को साफ करें" पढ़ता है, तो VA मॉड्यूल "साफ करें" शब्द पर एक तेज़ रोशनी डालता है। यह रोबोट को बताता है, "हे, सिर्फ बोतल को मत देखो! उस चीज़ को खोजो जो साफ करती है!" यह रोबोट को चित्र में सबसे स्पष्ट वस्तु से विचलित होने से रोकता है।
- बाई-फ्यूजन (BF): यह रोबोट की आँखों (दृष्टि) और उसके दिमाग (भाषा) के बीच एक दो-तरफा बातचीत है। केवल चित्र और शब्दों को आपस में जोड़ने के बजाय, यह मॉड्यूल उन्हें आपस में बात करने देता है। आँखें कहती हैं, "मैं एक नरम, आयताकार चीज़ देख रही हूँ," और दिमाग कहता है, "यह सुखाने के लिए तौलिये जैसा लगता है।" वे एक सटीक निर्णय लेने के लिए अपने नोट्स को मिलाते हैं।
प्रशिक्षण मैदान: LVIS-Aff और COCO-Aff
आप रोबोट को स्मार्ट बनाने के लिए उसे उदाहरणों की एक विशाल लाइब्रेरी दिए बिना नहीं सिखा सकते। लेखकों ने डेटा के दो विशाल नए पुस्तकालय बनाए हैं जिन्हें COCO-Aff और LVIS-Aff कहा जाता है।
इन्हें रोबोटों के लिए विशाल "अभ्यास परीक्षा" के रूप में सोचें। केवल एक कप की तस्वीर दिखाने और "यह क्या है?" पूछने के बजाय, ये डेटासेट एक तस्वीर और एक कार्य दिखाते हैं जैसे "पानी पीने के लिए," और रोबोट को कप को खोजना होता है।
- COCO-Aff में लगभग 112,000 चित्र और 1,144 अलग-अलग कार्य हैं।
- LVIS-Aff इससे भी बड़ा है, जिसमें 119,000 चित्र और 1,496 कार्य हैं, जो 1,000 से अधिक विभिन्न प्रकार की वस्तुओं को कवर करता है।
उन्होंने इन अभ्यास प्रश्नों को स्वचालित रूप से लिखने के लिए एक विशाल AI (GPT-4) का उपयोग किया, यह सुनिश्चित करने के लिए कि उनके उत्तर तर्कसंगत हों। इसने रोबोट को सीखने के लिए बहुत व्यापक रेंज दी, जिससे यह पहले की तुलना में नई, अजीब स्थितियों को बेहतर ढंग से संभाल सका।
परिणाम: तेज़, छोटा और सटीक
लेखकों ने सिम्युलेटेड रोबोट दुनिया (एक वर्चुअल वातावरण का उपयोग करके जो एक वास्तविक कमरे जैसा दिखता है) में Afford-X का परीक्षण किया। यहाँ उन्होंने क्या पाया:
- गति: Afford-X अविश्वसनीय रूप से तेज़ है। यह 2.38 फ्रेम प्रति सेकंड (FPS) की दर से छवियों को प्रोसेस कर सकता है। इसे समझने के लिए, यह एक विशाल क्लाउड-आधारित AI (जैसे GPT-4V) से वही काम करने के लिए पूछने की तुलना में लगभग 50 गुना तेज़ है।
- आकार: मॉडल बहुत छोटा है, जिसमें केवल 187 मिलियन पैरामीटर हैं। इसका मतलब है कि यह बिना किसी विशाल सर्वर फार्म की आवश्यकता के एक स्थानीय कंप्यूटर पर चल सकता है।
- सटीकता: परीक्षणों में, Afford-X ने उन सर्वोत्तम पिछले तरीकों की तुलना में 12.1% सुधार किया जो विशाल AI मॉडल का उपयोग नहीं करते थे। इसने अपने स्वयं के पिछले कार्य से भी 1.2% बेहतर प्रदर्शन किया।
- सामान्यीकरण (Generalization): जब रोबोट को उन कार्यों का सामना करना पड़ा जो उसने पहले कभी नहीं देखे थे (उन वस्तुओं का उपयोग करते हुए जिन्हें वह नहीं जानता था), तब भी उसने अच्छा प्रदर्शन किया। उदाहरण के लिए, नए कार्यों पर, इसने छोटे डेटासेट पर प्रशिक्षित मॉडलों की तुलना में अपनी सटीकता में लगभग 24% का सुधार किया।
रोबोट का एक दिन
यह साबित करने के लिए कि यह काम करता है, लेखकों ने एक सिम्युलेटेड रोबोटिक आर्म पर Afford-X लगाया। उन्होंने इसे "पानी पीने के लिए" जैसा कार्य दिया।
- रोबोट ने एक मेज को देखा जिस पर एक बोतल, एक गिलास, एक कप और एक चम्मच था।
- Afford-X ने तुरंत कप को सबसे अच्छे उपकरण के रूप में पहचाना, बोतल (जो रखने के लिए है, सीधे पीने के लिए नहीं) और चम्मच को अनदेखा करते हुए।
- रोबोट ने फिर अपनी गति की योजना बनाई और सफलतापूर्वक कप को पकड़ लिया।
एक जटिल परीक्षण में जहाँ रोबोट को "वर्कस्पेस बनाना" था, सिस्टम ने बड़े कार्य को छोटे चरणों में तोड़ दिया (मेज ढूँढना, कुर्सी ढूँढना, लैंप ढूँढना) और उन्हें एक-एक करके निष्पादित किया। इन सिमुलेशन में, रोबोट सही वस्तु खोजने में 86% बार सफल रहा, और उसे सफलतापूर्वक पकड़ने में 45% बार सफल रहा। (विफलताएं आमतौर पर इसलिए हुईं क्योंकि रोबोट के हाथ को चम्मच जैसी पतली, सपाट चीज़ों को पकड़ने में कठिनाई हुई, न कि इसलिए कि उसने गलत वस्तु चुनी थी)।
यह क्यों मायने रखता है
यह पेपर दिखाता है कि रोबोट को सामान्य ज्ञान देने के लिए आपको एक विशाल, धीमे, क्लाउड-आधारित AI की आवश्यकता नहीं है। एक स्मार्ट, स्लिम मॉडल का उपयोग करके जिसे सही प्रकार के डेटा पर प्रशिक्षित किया गया है, रोबोट वास्तविक दुनिया में तेज़ी से और कुशलता से उपकरणों का उपयोग करना सीख सकते हैं। यह उन रोबोटों की ओर एक महत्वपूर्ण कदम है जो वास्तव में हमारे घरों और कार्यस्थलों में हमारी मदद कर सकते हैं, न कि केवल एक लैब में फंसे रह सकते हैं जब तक कि कोई सुपरकंप्यूटर उन्हें कुछ बताने के लिए इंतज़ार न करे।
लेखक स्वीकार करते हैं कि रोबोट अभी भी बहुत कठिन स्थितियों में संघर्ष करता है, जैसे कि एक कप और टूथब्रश होल्डर के बीच अंतर करना यदि वे बिल्कुल एक जैसे दिखते हों, या अन्य वस्तुओं के पीछे छिपी वस्तुओं के साथ निपटना। लेकिन फिलहाल के लिए, Afford-X साबित करता है कि एक छोटा, तेज़ और स्मार्ट रोबोट दिमाग संभव है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।