Quantum Algorithm for Apprenticeship Learning
यह शोध पत्र इनवर्स रीइन्फोर्समेंट लर्निंग के माध्यम से अप्रेंटिसशिप लर्निंग के लिए एक क्वांटम एल्गोरिदम प्रस्तुत करता है जो फीचर वेक्टर आयाम और एक्शन स्पेस आकार के संदर्भ में अपने शास्त्रीय समकक्ष की तुलना में प्रति-इटरेशन समय जटिलता में द्विघातीय (quadratic) गति वृद्धि प्राप्त करता है, जिसे सिद्ध अभिसरण गारंटी (convergence guarantees) द्वारा समर्थित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "क्वांटम एल्गोरिदम फॉर अपेंटिसशिप लर्निंग" (Apprenticeship Learning के लिए क्वांटम एल्गोरिदम) के पेपर का सरल, रोजमर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।
बड़ी तस्वीर: देखकर सीखना, न कि निर्देश सुनकर सीखना
कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाना चाहते हैं।
- पुराना तरीका (पारंपरिक सुदृढीकरण सीखना - Traditional Reinforcement Learning): आपको एक विशाल नियम पुस्तिका लिखनी होगी। "यदि आप लाल बत्ती देखें, तो रुकें। यदि आप पैदल यात्री देखें, तो ब्रेक लगाएं।" यह कठिन है क्योंकि वास्तविक जीवन बहुत उलझा हुआ होता है, और हो सकता है कि आप कोई नियम लिखना भूल जाएं।
- "अपेंटिसशिप" (Apprenticeship) का तरीका: नियम लिखने के बजाय, आप रोबोट को कुछ समय के लिए एक मानव विशेषज्ञ ड्राइवर को देखते रहने देते हैं। रोबोट विशेषज्ञ को देखता है, उनकी नकल करने की कोशिश करता है, और अंततः इंसान की तरह ही अच्छी तरह से गाड़ी चलाना सीख जाता है। इसे अपेंटिसशिप लर्निंग कहा जाता है।
समस्या यह है: रोबोट यह कैसे पता लगाएगा कि इंसान वास्तव में क्या करने की कोशिश कर रहा है?
हो सकता है कि इंसान एयरपोर्ट पहुँचने के लिए तेज़ गाड़ी चला रहा हो, या शायद वह नज़ारों का आनंद लेने के लिए धीरे गाड़ी चला रहा हो। रोबोट अभी तक "लक्ष्य" (रिवॉर्ड फंक्शन) को नहीं जानता; वह केवल कार्यों (actions) को देख पाता है।
यह पेपर पेश करता है कि कैसे क्वांटम कंप्यूटरों का उपयोग करके रोबोट इस काम को अधिक तेज़ी से सीख सकता है।
मुख्य समस्या: "ब्लैक बॉक्स" रिवॉर्ड
AI की दुनिया में, "रिवॉर्ड" (इनाम) एक स्कोर की तरह होता है। रोबोट अपने स्कोर को अधिकतम करना चाहता है।
- क्लासिकल AI (Classical AI): यह विशेषज्ञ को देखता है, स्कोर का अनुमान लगाता है, उसे अधिकतम करने की कोशिश करता है, थोड़ा असफल होता है, फिर से अनुमान लगाता है, और धीरे-धीरे सुधार करता है। यह एक शहर के हर रास्ते पर एक-एक करके चलकर सबसे अच्छा रास्ता खोजने जैसा है।
- लेखकों का लक्ष्य: वे एक क्वांटम अपेंटिस बनाना चाहते थे। एक ऐसा रोबोट जो विशेषज्ञ के छिपे हुए लक्ष्यों को बहुत तेज़ी से समझने के लिए क्वांटम भौतिकी की अजीब और सुपर-फास्ट शक्तियों का उपयोग करता है।
उपमा: "फीचर" मेनू
इसे काम करने योग्य बनाने के लिए, लेखक यह मान लेते हैं कि रोबलेट दुनिया को "फीचर्स" (जैसे सामग्रियों का एक मेनू) के एक विशिष्ट सेट के माध्यम से देखता है।
- फीचर 1: गति (Speed)।
- फीचर 2: निकटतम कार से दूरी।
- फीचर 3: मोड़ कितना स्मूथ था।
रोबोट का काम उस रेसिपी (वजन/weights) को खोजना है जो इन सामग्रियों को मिलाकर "परफेक्ट ड्राइव" बनाती है।
- यदि विशेषज्ञ तेज़ गाड़ी चलाता है, तो "गति" वाले घटक का वजन अधिक होगा।
- यदि विशेषज्ञ सुरक्षित रूप से गाड़ी चलाता है, तो "दूरी" वाले घटक का वजन अधिक होगा।
रोबोट को इस रेसिपी को खोजने की आवश्यकता है।
क्वांटम जादू: "सुपर-स्कैनर"
पेपर में दो एल्गोरिदम दिए गए हैं: एक क्लासिकल (सामान्य कंप्यूटरों के लिए) और एक क्वांटम (क्वांटम कंप्यूटरों के लिए)।
1. क्लासिकल अपेंटिस (धीमा चलने वाला)
क्लासिकल एल्गोरिदम एक लाइब्रेरी में टहलते हुए जासूस की तरह काम करता है।
- यह विशेषज्ञ को देखता है।
- यह एक रेसिपी का अनुमान लगाता है।
- यह रेसिपी का परीक्षण करता है।
- इसे एहसास होता है, "ओह, मैं कुछ भूल गया।"
- यह रेसिपी को एडजस्ट करता है और फिर से कोशिश करता है।
यह इसे बार-बार करता है। यह अंततः काम पूरा कर देता है, लेकिन इसमें बहुत समय लगता है, खासकर यदि "मेनू" (फीचर्स की संख्या) बहुत बड़ा हो या "शहर" (संभावित कार्यों का स्थान) बहुत विशाल हो।
2. क्वांटम अपेंटिस (टेलीपोर्ट होने वाला जासूस)
क्वांटम एल्गोरिदम क्वांटम स्पीडअप का उपयोग करता है। कल्पना कीजिए कि जासूस लाइब्रेरी में टहल नहीं रहा है; इसके बजाय, वह तुरंत किसी भी किताब तक टेलीपोर्ट कर सकता है, या एक ही समय में 1,000 किताबें चेक कर सकता है।
पेपर दिखाता है कि क्वांटम अपेंटिस दो विशिष्ट चीजों में क्वाड्रेटिक रूप से (quadratically) तेज़ है:
- मेनू का आकार (फीचर डायमेंशन ): यदि रोबोट को 1,000 अलग-अलग ड्राइविंग फीचर्स को ट्रैक करना है, तो क्वांटम कंप्यूटर इसे सामान्य कंप्यूटर की तुलना में बहुत तेज़ी से संभालता है।
- शहर का आकार (एक्शन स्पेस ): यदि रोबोट को हर सेकंड 1,000 अलग-अलग संभावित चालों में से चुनना है, तो क्वांटम कंप्यूटर बहुत तेज़ी से सबसे अच्छी चाल खोज लेता है।
कैच (सावधानी):
ठीक किसी फिल्म की तरह, यहाँ एक ट्रेड-ऑफ (समझौता) है। जबकि क्वांटम कंप्यूटर मेनू और शहर को स्कैन करने में सुपर फास्ट है, यह "शोर" (noise/त्रुटियों) के प्रति थोड़ा संवेदनशील है। यह सुनिश्चित करने के लिए बहुत सटीक ट्यूनिंग की आवश्यकता होती है कि यह छोटी गलतियों से भ्रमित न हो जाए। यह एक फॉर्मूला 1 कार की तरह है: एक परफेक्ट ट्रैक पर अविश्वसनीय रूप से तेज़, लेकिन अगर ट्रैक ऊबड़-खाबड़ है (हाई एरर), तो यह एक मज़बूत ट्रक की तुलना में संघर्ष कर सकता है।
यह चरण-दर-चरण कैसे काम करता है (रेसिपी की खोज)
- विशेषज्ञ को देखना: रोबोट विशेषज्ञ की ड्राइविंग को रिकॉर्ड करता है। यह विशेषज्ञ ने जो किया उसके "औसत" (फीचर एक्सपेक्टेशन्स) की गणना करता है।
- "SVM" सॉल्वर (न्यायाधीश): रोबोट पूछता है, "सबसे सरल रेसिपी क्या है जो विशेषज्ञ की ड्राइविंग को मेरे वर्तमान प्रयासों से बेहतर दिखाती है?"
- क्लासिकल: न्यायाधीश प्रयासों की सूची को एक-एक करके पढ़ता है।
- क्वांटम: न्यायाधीश सबसे अच्छी रेसिपी खोजने के लिए "क्वांटम सर्च" का उपयोग करता है।
- सुदृढीकरण सीखना (अभ्यास): रोबोट एक सिमुलेशन में इस नई रेसिपी को आज़माता है।
- क्लासिकल: यह स्टेप-बाय-स्टेप ड्राइव का सिमुलेशन करता है।
- क्वांटम: यह "क्वांटम एम्प्लीट्यूड एस्टीमेशन" का उपयोग करके ड्राइव का सिमुलेशन करता है, जो एक मिलियन सिमुलेशन के समय में एक सिमुलेशन के बराबर सांख्यिकीय उत्तर प्राप्त करने जैसा है।
- दोहराना: रोबोट अपने नए प्रदर्शन की विशेषज्ञ के साथ तुलना करता है। यदि यह पर्याप्त करीब है, तो यह रुक जाता है। यदि नहीं, तो यह वापस स्टेप 2 पर जाता है।
निष्कर्ष: क्या यह सार्थक है?
पेपर साबित करता है कि हाँ, यह सार्थक है, लेकिन कुछ शर्तों के साथ।
- अच्छी खबर: यदि आपके पास बहुत सारे वेरिएबल्स वाला एक विशाल समस्या (जैसे एक बड़े शहर में जटिल नियमों के साथ सेल्फ-ड्राइविंग कार) है, तो क्वांटम एल्गोरिदम किसी भी क्लासिकल कंप्यूटर की तुलना में काफी तेज़ी से काम पूरा कर देगा। यह समय को वर्गमूल (square root) कारक से कम कर देता है (उदाहरण के लिए, यदि एक क्लासिकल कंप्यूटर को 10,000 साल लगते हैं, तो क्वांटम वाला शायद 100 साल लेगा)।
- बुरी खबर: यदि आप चाहते हैं कि उत्तर पूरी तरह से सटीक हो, तो गणित जटिल हो जाता है। क्वांटम विधि जल्दी से एक "काफी अच्छा" उत्तर पाने के लिए बेहतरीन है, लेकिन यदि आपको 100% पूर्णता चाहिए, तो क्लासिकल विधि अधिक स्थिर हो सकती है।
एक वाक्य में सारांश
लेखकों ने एक क्वांटम अपेंटिस बनाया है जो लाखों संभावित रणनीतियों को तुरंत स्कैन करने के लिए क्वांटम शक्तियों का उपयोग करके विशेषज्ञों की नकल करना सीखता है, जिससे यह जटिल कार्यों के लिए पारंपरिक कंप्यूटरों की तुलना में बहुत तेज़ हो जाता है, बशर्ते वातावरण बहुत अधिक शोर (noisy) वाला न हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।