Modeling quantum neural network gradient with reinforcement learning
यह शोध पत्र RLQ-Grad को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) आधारित ऑप्टिमाइज़र है जो पैरामीटर अपडेट का प्रस्ताव देने के लिए एक क्लासिकल पॉलिसी का उपयोग करके क्वांटम न्यूरल नेटवर्क को प्रशिक्षित करता है, जिससे बैरन प्लेटो (barren plateau) की समस्या से बचा जा सके और 20 क्विबिट्स तक के निकट-अवधि हार्डवेयर (near-term hardware) पर कुशल प्रशिक्षण सक्षम करने के लिए कम्प्यूटेशनल लागत को कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
क्वांटम कंप्यूटिंग के उभरते क्षेत्र में, वैज्ञानिक ऐसी मशीनें बनाने की कोशिश कर रहे हैं जो आज के सुपरकंप्यूटरों की पहुंच से कहीं परे समस्याओं को हल कर सकें। इस प्रयास में एक केंद्रीय उपकरण क्वांटम न्यूरल नेटवर्क है, जो एक हाइब्रिड सिस्टम है जो उपपरमाणु कणों के विचित्र भौतिकी को आर्टिफिशियल इंटेलिजेंस की सीखने की क्षमताओं के साथ जोड़ता है। ये नेटवर्क डेटा में पैटर्न खोजने के लिए डिज़ाइन किए गए हैं, ठीक वैसे ही जैसे वह सॉफ्टवेयर जो फोटो में चेहरों को पहचानता है या भाषाओं का अनुवाद करता है। हालांकि, इन क्वांटम प्रणालियों को प्रशिक्षित करना एक कठिन बाधा से टकरा गया है। जैसे-जैसे शोधकर्ता कठिन समस्याओं को संभालने के लिए अपने सर्किट में अधिक क्वांटम बिट्स, या क्यूबिट्स (qubits) जोड़ते हैं, मशीन को सिखाने के लिए उपयोग किए जाने वाले संकेत अक्सर शून्य में विलीन हो जाते हैं। यह घटना, जिसे 'बैरन प्लेटो' (barren plateau) के रूप में जाना जाता है, नेटवर्क को यह समझने में अंधा कर देती है कि सुधार कैसे किया जाए, जबकि आवश्यक अपडेट की गणना करने के लिए आवश्यक कम्प्यूटेशनल शक्ति इतनी बढ़ जाती है कि इसे वर्तमान हार्डवेयर पर चलाना असंभव हो जाता है।
इस बाधा को तोड़ने के लिए, शोधकर्ताओं की एक टीम ने एक नया दृष्टिकोण विकसित किया है जो इन मशीनों को सिखाने के पारंपरिक तरीके को दरकिनार करता है। क्वांटम सर्किट के माध्यम से सीखने के पथ के सटीक गणितीय ढलान (slope) की गणना करने के बजाय—एक ऐसी प्रक्रिया जो सिस्टम बढ़ने के साथ तेजी से कठिन और मेमोरी-गहन होती जाती है—उन्होंने एक अलग, क्लासिकल कंप्यूटर प्रोग्राम को अगला कदम अनुमान लगाने के लिए प्रशिक्षित किया। यह प्रोग्राम, जिसे 'रीइन्फोर्समेंट लर्निंग' नामक तकनीक का उपयोग करके बनाया गया है, एक अनुभवी कोच की तरह कार्य करता है। यह क्वांटम नेटवर्क के प्रदर्शन पर नज़र रखता है, इसकी वर्तमान त्रुटियों और पिछले कदमों को नोट करता है, और फिर नेटवर्क की सेटिंग्स में एक सीधा अपडेट प्रस्तावित करता है। शोधकर्ताओं ने पाया कि यह विधि न केवल लुप्त होते संकेतों (vanishing signal) की समस्या से बचती है, बल्कि यह मानक तकनीकों की तुलना में हजारों गुना तेजी से चलती है और बहुत कम मेमोरी का उपयोग करती है।
वियतनाम और जापान के शोधकर्ताओं के नेतृत्व वाली टीम ने अपने नए ऑप्टिमाइज़र का परीक्षण किया, जिसे उन्होंने RLQ-Grad नाम दिया, और इसे दो क्यूबिट से लेकर बीस क्यूबिट तक के विभिन्न सिम्युलेटेड क्वांटम सर्किटों पर परखा। क्वांटम कंप्यूटिंग की दुनिया में, बीस क्यूबिट एक महत्वपूर्ण पैमाना है, जो एक ऐसे सिस्टम का प्रतिनिधित्व करता है जो वास्तविक दुनिया के अनुप्रयोगों के लिए प्रासंगिक है लेकिन शक्तिशाली क्लासिकल कंप्यूटरों पर सिम्युलेट करने के लिए पर्याप्त छोटा है। परिणाम चौंकाने वाले थे। जब शोधकर्ताओं ने अपने तरीके की तुलना अपडेट की गणना करने के तीन मानक तरीकों—बैकप्रोपैगेशन (backpropagation), पैरामीटर-शिफ्ट (parameter-shift), और एडजॉइंट डिफरेंशिएशन (adjoint differentiation)—से की, तो RLQ-Grad ने सर्किट के आकार के बावजूद सीखने के एक स्थिर और मजबूत संकेत को बनाए रखा। इसके विपरीत, पारंपरिक तरीकों में क्यूबिट की संख्या बढ़ने के साथ सीखने के संकेत कई गुना गिर गए, जिससे प्रभावी रूप से प्रशिक्षण रुक गया।
दक्षता में वृद्धि भी उतनी ही नाटकीय थी। एक मानक कंप्यूटर प्रोसेसर पर, नए तरीके ने सबसे बड़े बीस-क्यूबिट सर्किटों के लिए भी प्रत्येक प्रशिक्षण चरण को एक सेकंड के दसवें हिस्से से भी कम समय में पूरा किया। तुलनात्मक रूप से, पारंपरिक बैकप्रोपैगेशन विधि को उसी कार्य के लिए लगभग दो सौ सेकंड लगे। मेमोरी उपयोग के मामले में, अंतर और भी गहरा था। जबकि मानक बैकप्रोपैगेशन दृष्टिकोण को बीस-क्यूबिट सर्किट को संभालने के लिए छह हजार मेगाबाइट से अधिक मेमोरी की आवश्यकता थी, नए तरीके को दो मेगाबाइट से भी कम की आवश्यकता थी। संसाधन मांग में यह कमी का अर्थ है कि शोधकर्ता इन जटिल मॉडलों को बहुत ही साधारण हार्डवेयर पर भी प्रशिक्षित कर सकते हैं, जिससे क्वांटम मशीन लर्निंग अनुसंधान तक पहुंच का लोकतंत्रीकरण होगा।
शोधकर्ताओं ने यह भी जांचा कि उनका सिस्टम वास्तव में डेटा को वर्गीकृत करने में कितना सक्षम है। उन्होंने हस्तलिखित अंकों की छवियों और स्तन कैंसर से संबंधित चिकित्सा डेटा सहित चार अलग-अलग डेटासेट पर इस पद्धति का परीक्षण किया। हर मामले में, RLQ-Grad ऑप्टिमाइज़र ने पारंपरिक ग्रेडिएंट-आधारित तरीकों को पछाड़ दिया। सरल डेटासेट पर, इसने क्वांटम नेटवर्क की सटीकता में दस प्रतिशत तक सुधार किया। अधिक जटिल इमेज डेटासेट पर, जहाँ पारंपरिक तरीके सर्किट बड़ा होने पर संघर्ष करने लगे थे, नए तरीके ने सुधार जारी रखा और उन विशिष्ट तकनीकों के प्रदर्शन से मेल खाया जो विशेष रूप से बैरन प्लेटो की समस्या को ठीक करने के लिए डिज़ाइन की गई हैं। महत्वपूर्ण रूप से, इसने उस भारी कम्प्यूटेशनल ओवरहेड के बिना यह उपलब्धि हासिल की जो आमतौर पर उन विशिष्ट तकनीकों की आवश्यकता होती है।
इस कार्य का एक सबसे महत्वपूर्ण पहलू वह है जिसे यह खारिज करता है। शोधकर्ताओं ने स्पष्ट रूप से परीक्षण किया कि क्या अन्य प्रकार के ऑप्टिमाइजेशन, जैसे कि प्राकृतिक चयन की नकल करने वाले इवोल्यूशनरी एल्गोरिदम या अनुमान और जांच (guess and check) करने वाले ग्रेडिएंट-फ्री तरीके, इस समस्या को हल कर सकते हैं। उन्होंने पाया कि जब इन वैकल्पिक दृष्टिकोणों का सामना बीस-क्यूबिट सर्किटों से हुआ, तो वे रैंडम चांस (random chance) पर गिर गए और कुछ भी उपयोगी नहीं सीख सके। यह सुझाव देता है कि समाधान केवल ग्रेडिएंट की गणना से बचना नहीं है, बल्कि अपडेट को निर्देशित करने के लिए एक स्मार्ट, सीखे हुए नीति (policy) का उपयोग करना है। अध्ययन यह भी स्पष्ट करता है कि हालांकि यह विधि लुप्त होते संकेतों और उच्च मेमोरी लागत की समस्या को हल करती है, लेकिन यह क्वांटम लर्निंग की हर समस्या को जादुई रूप से ठीक नहीं करती है। यदि क्वांटम सर्किट बहुत छोटा है या समस्या बहुत सरल है, तो नेटवर्क अभी भी खराब समाधानों में फंस सकता है, और यह विधि अभी तक वास्तविक भौतिक क्वांटम हार्डवेयर पर काम नहीं करती है, जो शोर (noise) और त्रुटियों के अधीन है।
टीम ने गणितीय रूप से सिद्ध किया कि उनका दृष्टिकोण काम करता है क्योंकि "कोच" प्रोग्राम पूरी तरह से क्लासिकल कंप्यूटरों पर संचालित होता है, जो स्वयं क्वांटम सर्किट से अलग है। चूंकि यह कोच जटिल क्वांटम समीकरणों के माध्यम से विभेदन (differentiation) करने की आवश्यकता नहीं रखता है, इसलिए यह उसी घातीय क्षय (exponential decay) के अधीन नहीं है जिससे पारंपरिक तरीके ग्रस्त हैं। शोधकर्ताओं ने यह सत्यापित किया कि जैसे-जैसे उन्होंने अधिक क्यूबिट जोड़े, सीखने के संकेत का विचरण (variance) स्थिर और सपाट रहा, जबकि अन्य तरीकों के लिए संकेत तेजी से गिरा। यह संरचनात्मक लाभ इस पद्धति को कुशलतापूर्वक स्केल करने की अनुमति देता है, जो क्वांटम सिस्टम के आकार के साथ घातीय (exponentially) के बजाय केवल रैखिक (lineally) रूप से बढ़ता है।
हालांकि यह अध्ययन पूरी तरह से सिमुलेशन पर आधारित था, इसके निहितार्थ भविष्य के क्वांटम कंप्यूटिंग के लिए महत्वपूर्ण हैं। प्रशिक्षण की कम्प्यूटेशनल लागत को हजारों गुना कम करके, यह विधि वैज्ञानिकों को पहले से सोचे गए संभव स्तरों की तुलना में बहुत बड़े और अधिक जटिल क्वांटम न्यूरल नेटवर्क का पता लगाने की अनुमति दे सकती है। यह एक नए मार्ग की पेशकश करता है जिसके साथ यह क्षेत्र इन प्रणालियों को प्रशिक्षित करने की व्यावहारिक सीमाओं से जूझ रहा है। शोधकर्ता कहते हैं कि अगला कदम इस दृष्टिकोण को वास्तविक क्वांटम हार्डवेयर पर परखना होगा और यह देखना होगा कि क्या सीखी गई नीतियां विभिन्न प्रकार की समस्याओं में स्थानांतरित की जा सकती हैं, जो संभावित रूप से कल के क्वांटम मशीनों को प्रशिक्षित करने के लिए एक सार्वभौमिक उपकरण बना सकती हैं। फिलहाल, यह कार्य इस बात का प्रमाण है कि इन मशीनों को सिखाने के तरीके को बदलकर, हम उन ऊँची चट्टानों को पार कर सकते हैं जिन्होंने उनकी प्रगति को बाधित कर दिया था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।