Counterfactual Reasoning and Environment Design for Active Preference Learning
यह शोध पत्र CRED को प्रस्तुत करता है, जो एक नवीन सक्रिय प्राथमिकता शिक्षण (active preference learning) ढांचा है जो मानव प्राथमिकता रैंकिंग के लिए विविध और सूचनात्मक प्रश्नों को उत्पन्न करने हेतु प्रतितथ्यात्मक तर्क (counterfactual reasoning) के माध्यम से पर्यावरण डिजाइन और प्रक्षेपवक्र चयन को संयुक्त रूप से अनुकूलित करके दीर्घ-क्षितिज रोबोटिक कार्यों में पुरस्कार अनुमान को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को दुनिया में नेविगेट करना सिखा रहे हैं, लेकिन आप उसे केवल एक नियम पुस्तिका थमा नहीं सकते। आप यह नहीं कह सकते, "हमेशा सबसे तेज़ रास्ता चुनें" या "कभी घास पर न चलें," क्योंकि वास्तविक जीवन अव्यवस्थित है। कभी-कभी आप गति चाहते हैं, भले ही इसका मतलब ऊबड़-खाबड़ सवारी हो; अन्य समय में, आप सुरक्षा चाहते हैं, भले ही इसमें अधिक समय लगे। यह प्रेफरेंस लर्निंग (Preference Learning) का मूल है: एक ऐसा क्षेत्र जहाँ रोबोट यह नहीं सीखते कि इंसान क्या चाहते हैं बल्कि उन्हें बताया जाता है, बल्कि वे विभिन्न विकल्पों के बीच मानव द्वारा किए गए चुनाव को देखकर सीखते हैं। इसे एक रेस्तरां में स्वाद-परीक्षक की तरह समझें। रोबोट को यह नहीं पता होता कि आप तीखा पसंद करते हैं या मीठा, जब तक कि वह आपको दो व्यंजन न दिखाए और पूछे, "इनमें से कौन सा बेहतर लग रहा है?"
हालाँकि, इसमें एक पेंच है। यदि रोबोट बस बेतरतीब ढंग से आपको दो रास्ते दिखाता है, तो वह उन रास्तों के बारे में पूछकर आपका समय बर्बाद कर सकता है जो स्पष्ट रूप से बहुत खराब या बिल्कुल एक जैसे हैं। इसे एक्टिव प्रेफरेंस लर्निंग (Active Preference Learning) कहा जाता है। लक्ष्य एक स्मार्ट इंटरव्यूअर बनना है: सही सवाल पूछना ताकि आपकी वास्तविक पसंद को यथाशीघ्र समझा जा सके। लेकिन जटिल, लंबी यात्राओं में, यह समझना कि कौन से सवाल पूछने हैं, बेहद कठिन है। रोबोट अक्सर अनुमान लगाने में फंस जाता है, आपके निर्णय लेने की अनूठी शैली को सीखने में विफल रहता है, खासकर जब वह उन नए, अजीब वातावरणों का सामना करता है जिन्हें उसने पहले नहीं देखा है।
यहीं पर यह शोध पत्र CRED पेश करता है, जो एक चतुर नया तरीका है जो रोबनों के लिए एक सुपर-पावर्ड इमेजिनेशन इंजन (कल्पना इंजन) की तरह काम करता है। शोधकर्ता, यी-शियुआन टंग, ब्रैडली हेज़ और एलेसांद्रो रोनकोन का प्रस्ताव है कि केवल वर्तमान दुनिया के बारे में पूछने के बजाय, रोबोट को नई दुनिया की कल्पना करनी चाहिए और "क्या होगा अगर?" वाले सवाल पूछने चाहिए।
CRED कैसे काम करता है, इसे एक सरल उपमा से समझते हैं: कल्पना कीजिए कि आप अपने दोस्त के पसंदीदा आइसक्रीम फ्लेवर का अनुमान लगाने की कोशिश कर रहे हैं। एक सामान्य रोबोट बस बार-बार पूछ सकता है, "क्या आपको वनीला पसंद है या चॉकलेट?" CRED, हालांकि, अलग है। सबसे पहले, यह काउंटरफैक्चुअल रीजनिंग (Counterfactual Reasoning) का उपयोग करता है। यह खुद से पूछता है, "क्या होगा अगर मेरे दोस्त को मिंट बहुत पसंद है लेकिन चॉकलेट से नफरत है? फिर वे क्या चुनेंगे?" यह अपने दिमाग में इन "क्या होगा अगर" वाले परिदृश्यों का अनुकरण करता है, जिससे विकल्पों का एक विविध सेट बनता है जो उन सभी संभावित तरीकों को कवर करता है जिनसे उसका दोस्त सोच सकता है। यह रोबोट को उबाऊ, दोहराव वाले सवालों के बजाय बहुत अधिक दिलचस्प सवाल बनाने में मदद करता है।
दूसरा, CRED एनवायरनमेंट डिज़ाइन (Environment Design) का उपयोग करता है। कल्पना कीजिए कि आपके दोस्त को चॉकलेट केवल तभी पसंद आती है जब उसे एक फैंसी बाउल में परोसा जाता है, लेकिन वनीला एक साधारण कप में। यदि आप उन्हें हमेशा साधारण कप में ही परोसते हैं, तो आप उनकी वास्तविक पसंद को कभी नहीं जान पाएंगे। CRED को एहसास होता है कि सेटिंग मायने रखती है। यह वातावरण को बदलने की कल्पना करता है—शायद एक घास के मैदान को बजरी वाली सड़क में बदलना या सिमुलेशन में मौसम को बदलना—यह देखने के लिए कि इससे चुनाव कैसे बदलता है। दुनिया को खुद बदलकर, रोबोट उस सटीक परिदृश्य को ढूंढ सकता है जो आपकी पसंद के बारे में सबसे अधिक जानकारी प्रकट करने वाला सवाल पूछने के लिए सही हो।
शोधकर्ताओं ने इस विचार का दो तरीकों से परीक्षण किया। पहले, उन्होंने रेत, घास और बजरी जैसे विभिन्न इलाकों वाले एक डिजिटल ग्रिड वर्ल्ड का उपयोग किया। दूसरे, उन्होंने डिलीवरी रूट को सिम्युलेट करने के लिए OpenStreetMaps से वास्तविक दुनिया के मैप डेटा का उपयोग किया। उन्होंने इसकी तुलना अन्य शीर्ष विधियों से की जो या तो यादृच्छिक (random) पथ चुनते हैं या वर्तमान वातावरण तक ही सीमित रहते हैं।
परिणाम उत्साहजनक थे। अपने सिमुलेशन में, CRED अन्य तरीकों की तुलना में बहुत तेज़ी से "वास्तविक" पसंद को सीख गया। जबकि अन्य रोबोटों को पैटर्न समझने में लगभग 25 प्रयास लगे, CRED अक्सर केवल 15 इटरेशन में अभिसरित (converge) हो गया। इससे भी महत्वपूर्ण बात यह है कि जब रोबोट को एक पूरी तरह से नए वातावरण में छोड़ दिया गया जिसे उसने पहले कभी नहीं देखा था, तो CRED के सीखे हुए नियम बहुत बेहतर काम कर रहे थे। इसने केवल उन विशिष्ट सड़कों को याद नहीं किया जिन पर इसने अभ्यास किया था; इसने पसंद के तर्क को सीखा, जिससे यह सामान्यीकरण (generalize) करने में सक्षम हुआ। उदाहरण के लिए, मैप टेस्ट में, CRED ने सर्वश्रेष्ठ पिछले तरीके की तुलना में रिवॉर्ड प्रेडिक्शन (इनाम की भविष्यवाणी) में त्रुटि को बहुत बड़े अंतर से कम किया, कुछ मामलों में लगभग पूर्ण सटीकता प्राप्त की।
यह शोध पत्र सुझाव देता है कि "क्या होगा अगर" वाली सोच और दुनिया को फिर से डिजाइन करने की क्षमता को जोड़कर, रोबोट हमें बेहतर ढंग से समझ सकते हैं। उन्हें हर नियम बताने की आवश्यकता नहीं है; वे हमारे विकल्पों और हमारे जीवन की दुनिया, दोनों के संभावनाओं के दायरे को खोजकर हमारे मूल्यों को सीख सकते हैं। हालांकि वर्तमान विधि को इन सिमुलेशन को चलाने के लिए भारी कंप्यूटिंग शक्ति की आवश्यकता है, लेखकों का मानना है कि यह दृष्टिकोण उन रोबोटों को बनाने की कुंजी हो सकता है जो वास्तव में वास्तविक दुनिया में मानवीय आवश्यकताओं के अनुकूल हो सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।