Preemptive Solving of Future Problems: Multitask Preplay in Humans and Machines
यह शोध पत्र "मल्टीटास्क प्रीप्ले" (Multitask Preplay) को प्रस्तुत करता है, जो एक नवीन एल्गोरिदम है जो भविष्य कहनेवाला प्रतिनिधित्व (predictive representations) सीखने के लिए न किए गए लेकिन सुलभ कार्यों के प्रति-तथ्यात्मक सिमुलेशन (counterfactual simulations) का लाभ उठाता है, जिससे जटिल वातावरणों में मानव सामान्यीकरण की व्याख्या होती है और नवीन मल्टीटास्क परिदृश्यों में कौशल स्थानांतरित करने की कृत्रिम एजेंटों की क्षमता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नए मोहल्ले में कॉफी शॉप की तलाश में घूम रहे हैं। चलते समय, आप एक जिम, एक किराने की दुकान और एक पार्क के पास से गुजरते हैं। भले ही आप केवल कॉफी की तलाश में हैं, आपका मस्तिष्क चुपचाप यह नोट कर लेता है कि जिम और किराने की दुकान कहाँ हैं। बाद में, यदि आपको अचानक दूध की आवश्यकता होती है, तो आपको शून्य से शुरुआत करने की आवश्यकता नहीं होती; आप तुरंत याद कर सकते हैं कि किराने की दुकान बस दो ब्लॉक दूर है।
यह शोध पत्र प्रस्तावित करता है कि मनुष्य हमेशा इस तरह के "मानसिक अभ्यास" (mental rehearsal) करते हैं, और यह एक नया कंप्यूटर एल्गोरिदम पेश करता है जिसे Multitask Preplay कहा जाता है, जो इस मानवीय सुपरपावर की नकल करने की कोशिश करता है।
यहाँ इस विचार, प्रयोगों और परिणामों का विवरण दिया गया, जिसे सरल उपमाओं का उपयोग करके समझाया गया है।
समस्या: "चीट शीट" बनाम "मानचित्र" (The "Cheat Sheet" vs. The "Map")
इस शोध पत्र को समझने के लिए, कल्पना कीजिए कि आप दो तरीकों से एक वीडियो गेम सीख रहे हैं:
- "चीट शीट" (Model-Free): आप गेम को दस लाख बार खेलते हैं। आप याद कर लेते हैं कि "यदि मैं ऊपर, फिर दाएं, फिर जंप दबाता हूँ, तो मुझे एक पॉइंट मिलता है।" यह तेज़ और आसान है जब तक कि आप पैटर्न जान लें, लेकिन यदि गेम बदल जाता है (जैसे, लक्ष्य हिल जाता है), तो आपको फिर से शुरुआत करनी पड़ती है। आप अनुकूलित (adapt) नहीं हो सकते।
- "मानचित्र" (Model-Based): आप पूरी दुनिया का एक सटीक मानसिक मानचित्र बनाते हैं। आप कहीं भी जाने का रास्ता तुरंत निकाल सकते हैं। लेकिन इस मानचित्र को बनाने में हर बार बहुत अधिक मानसिक शक्ति और समय लगता है।
अधिकांश वर्तमान AI या तो एक होता है या दूसरा। हालाँकि, मनुष्य इनके बीच का कुछ करते हैं। वे एक मानचित्र बनाते हैं, लेकिन वे आराम करते समय या अन्य काम करते समय अपने दिमाग में परिदृश्यों का "प्री-प्ले" (पूर्व-अभ्यास) भी करते हैं, ताकि वे भविष्य के लिए तैयार रहें।
बड़ा विचार: "मल्टीटास्क प्रीप्ले" (Multitask Preplay)
लेखकों का सुझाव है कि जब आप कॉफी शॉप की ओर जा रहे होते हैं (कार्य A), तो आपका मस्तिष्क केवल वहीं नहीं रुकता। यह बैकग्राउंड में सिम्युलेट (अनुकरण) करता है कि किराने की दुकान (कार्य B) या जिम (कार्य C) तक जाने के लिए क्या करना होगा, भले ही आप वहाँ नहीं जा रहे हों।
- रूपक (Metaphor): कल्पना कीजिए कि आप एक बड़े स्टू (stew) को पका रहे हैं (आपका मुख्य कार्य)। जबकि स्टू पक रहा है, आप केवल बैठे नहीं रहते। आप मानसिक रूप से उस सलाद के लिए सब्जियां काटने का अभ्यास करते हैं जो आप शायद बाद में बनाएंगे। जब आपको वास्तव में सलाद की आवश्यकता होती है, तो आपको काटने का तरीका सीखने के लिए संघर्ष नहीं करना पड़ता; आपने पहले ही अपने दिमाग में उस गति का "प्री-प्ले" कर लिया है।
- एल्गोरिदम: कंप्यूटर प्रोग्राम उस रास्ते को लेता है जिस पर वह अभी चला है (जैसे, कॉफी शॉप तक) और बैकग्राउंड में एक सिमुलेशन चलाता है: "ठीक है, यदि मैं किराने की दुकान जाने के बजाय वहां जा रहा होता, तो मैं क्या करता?" यह इस "नकली" अनुभव को अपनी मेमोरी में सहेज लेता है। बाद में, जब किराने की दुकान वास्तविक लक्ष्य बन जाती है, तो कंप्यूटर को पहले से ही रास्ता पता होता है क्योंकि उसने पहले ही इसका अभ्यास किया था।
उन्होंने इसका परीक्षण कैसे किया (प्रयोग)
शोधकर्ताओं ने इस विचार का परीक्षण मनुष्यों और कंप्यूटरों दोनों के साथ दो अलग-अलग "दुनियाओं" में किया:
1. ग्रिड-वर्ल्ड (एक सरल भूलभुलैया)
- सेटअप: मनुष्यों ने एक नीले बॉक्स (प्रशिक्षण कार्य) को खोजने के लिए एक भूलभुलैया में लाल त्रिकोण को नियंत्रित किया। बाद में, उन्हें एक लाल बॉक्स खोजना था (नया कार्य)।
- परीक्षण: कभी-कभी, लाल बॉक्स ऐसी जगह स्थित था जहाँ जाने का सबसे अच्छा रास्ता उसी रास्ते से होकर गुजरता था जो उन्होंने अभी-अभी नीले बॉक्स के लिए लिया था।
- परिणाम: वे केवल गणितीय रूप से सबसे छोटे रास्ते का पालन नहीं करते थे। इसके बजाय, वे अक्सर थोड़ा लंबा रास्ता लेते थे जो उसी मार्ग का पुन: उपयोग करता था जिसका उन्होंने अभी अभ्यास किया था।
- महत्व: वे पुराने रास्ते का पुन: उपयोग करने में तेज़ थे, भले ही वह सबसे छोटा रास्ता न हो। यह बताता है कि उन्होंने पहले कार्य के दौरान मार्ग को अपने मस्तिष्क में "कैश" (cache) कर लिया था, ठीक वैसे ही जैसे Multitask Preplay एल्गोरिदम करता है। अन्य AI मॉडल या तो भूलभुलैया को हल करने में विफल रहे या उन्हें बहुत अधिक समय लगा क्योंकि उन्होंने वैकल्पिक रास्तों का "प्री-प्ले" नहीं किया था।
2. माइनक्राफ्ट की दुनिया (एक जटिल, 3D गेम)
- सेटअप: वे "Craftax" (माइनक्राफ्ट जैसा) नामक एक अधिक जटिल गेम में चले गए, जहाँ खिलाड़ियों को एक विशाल, आंशिक रूप से छिपी हुई दुनिया में विशिष्ट पत्थर (हीरे, माणिक) खोजने होते हैं।
- ट्विस्ट: कभी-कभी खिलाड़ियों को यह भी पता नहीं होता था कि बाद में उनका परीक्षण किस पत्थर के लिए किया जाएगा।
- परिणाम: भले ही उन्हें भविष्य के लक्ष्य का पता नहीं था, फिर भी मनुष्यों ने अपने प्रशिक्षण के रास्तों का पुन: उपयोग किया। वे नए पत्थर को खोजने में तेज़ थे यदि वे प्रशिक्षण के दौरान उसके पास से गुजरे थे।
- AI तुलना: मानक AI मॉडल यहाँ बुरी तरह विफल रहे। वे सामान्यीकरण (generalize) नहीं कर सके। लेकिन Multitask Preplay AI सफल रहा, जिसने मानव प्रदर्शन का मिलान किया क्योंकि इसने ज्ञात लक्ष्यों को सीखते समय अज्ञात पत्थरों के पीछा करने का सिमुलेशन किया था।
AI सिमुलेशन: "10,000 नई दुनिया" का परीक्षण
अंत में, शोधकर्ताओं ने इस एल्गोरिदम का एक विशाल सिमुलेशन में परीक्षण किया जहाँ AI को 10,000 अलग-अलग अद्वितीय दुनिया में नेविगेट करना था।
- चुनौती: वास्तविक दुनिया के कार्यों में अक्सर चीजें साझा होती हैं। हीरा पाने के लिए, आपको कुल्हाड़ी (pickaxe) चाहिए। कुल्हाड़ी पाने के लिए, आपको लकड़ी चाहिए। ये "उप-कार्य" (subtasks) अक्सर एक साथ होते हैं।
- जीत: Multitask Preplay AI ने इन पैटर्न को पहचानना सीख लिया। मुख्य लक्ष्य पर काम करते समय "उप-कार्यों" (जैसे कुल्हाड़ी बनाना) का सिमुलेशन करके, इसने एक लचीला मस्तिष्क बनाया। जब इसे एक बिल्कुल नई दुनिया में छोड़ा गया जिसे इसने पहले कभी नहीं देखा था, तो यह अन्य AI विधियों की तुलना में जटिल कार्यों को बहुत तेज़ी से हल करने में सक्षम था।
निष्कर्ष
शोध पत्र का दावा है कि मनुष्य स्वाभाविक रूप से भविष्य की संभावनाओं का "प्री-प्ले" करने में अच्छे होते हैं जो वे अभी कर रहे हैं। हम केवल वर्तमान कार्य के लिए नहीं सीखते; हम उन कार्यों के लिए भी सीखते जिनकी हमें आगे आवश्यकता हो सकती है।
कंप्यूटरों को ऐसा करने के लिए सिखाकर—यानी वर्तमान कार्य पर काम करते समय वैकल्पिक लक्ष्यों का सिमुलेशन करना—हम ऐसा AI बना सकते हैं जो बिना सब कुछ दोबारा सीखे, नई स्थितियों के अनुकूल होने में बहुत बेहतर हो। यह पता चला है कि स्मार्ट होने का रहस्य केवल वर्तमान पर कड़ी मेहनत करना नहीं है; बल्कि भविष्य के बारे में दिवास्वप्न देखना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।