MQSS-Selector: RL-Guided Pass Selection for an MLIR Compilation Pipeline
यह शोध पत्र MQSS-Selector प्रस्तुत करता है, जो एक एकीकृत, लर्निंग-आधारित फ्रेमवर्क है जो NISQ युग में फिडेलिटी (fidelity) को अधिकतम करने के साथ-साथ संकलन समय (compilation time) और विलंबता (latency) को न्यूनतम करने के उद्देश्य से, HPC-क्वांटम कंप्यूटिंग वर्कफ़्लो के लिए डिवाइस चयन, कंपाइलर पास ऑर्डरिंग और जॉब शेड्यूलिंग को गतिशील रूप से अनुकूलित करने के लिए सुदृढीकरण (reinforcement) और डीप लर्निंग का लाभ उठाता है।
मूल लेखक: Andre Youssefi (Leibniz Supercomputing Centre), Ercüment Kaya (Leibniz Supercomputing Centre, Technical University of Munich), Minh Chung (Leibniz Supercomputing Centre), Jorge Echavarria (Munich Quantum Valley), Laura B. Schulz (Argonne National Laboratory), Martin Schulz (Leibniz Supercomputing Centre, Technical University of Munich)
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: MQSS-Selector
समस्या विवरण और प्रेरणा
हाई परफॉर्मेंस कंप्यूटिंग (HPC) और क्वांटम कंप्यूटिंग (QC) का एक एकीकृत HPCQC इंफ्रास्ट्रक्चर में विलय, ऐसे सॉफ्टवेयर स्टैक की आवश्यकता को जन्म देता है जो क्लासिकल और क्वांटम वर्कफ़्लो के बीच सेतु का कार्य कर सकें। हालाँकि, वर्तमान नॉयज़ी इंटरमीडिएट-स्केल क्वांटम (NISQ) उपकरण त्रुटिपूर्ण, संसाधन-सीमित और कैलिब्रेशन एवं टोपोलॉजी के प्रति अत्यधिक संवेदनशील हैं। फलस्वरूप, प्रभावी निष्पादन के लिए विशेष संकलन (compilation) और अनुकूलन की आवश्यकता होती है।
मौजूदा सॉफ्टवेयर स्टैक अक्सर विखंडन से ग्रस्त होते हैं, जहाँ वे डिवाइस चयन, कंपाइलर पास ऑप्टिमाइज़ेशन और जॉब शेड्यूलिंग को अलग-अलग चरणों के रूप में देखते हैं। शोधपत्र दो महत्वपूर्ण, परस्पर निर्भर चुनौतियों की पहचान करता है:
- डिवाइस चयन (Device Selection): उपलब्ध बैकएंड्स के सेट में से एक लक्षित क्वांटम डिवाइस चुनना, जिसमें टोपोलॉजी, गेट फिडेलिटी (gate fidelity), कतार विलंब (queue delays) और रखरखाव विंडो का ध्यान रखा गया हो।
- फेज़ ऑर्डरिंग (Phase Ordering): एक क्वांटम प्रोग्राम को रूपांतरित करने के लिए कंपाइलर पासेस (compiler passes) के एक इष्टतम अनुक्रम को निर्धारित करना, जिससे जस्ट-इन-टाइम (JIT) संकलन समय और निष्पादन रनटाइम को कम किया जा सके और डिवाइस अनुपालन सुनिश्चित किया जा सके।
लेखक औपचारिक रूप से सिद्ध करते हैं (प्रमेय 1) कि डिवाइस चयन और फेज़ ऑर्डरिंग दोनों ही NP-hard समस्याएँ हैं, हालांकि वे अलग-अलग हार्डनेस बेस में अपचयित (reduce) होती हैं: डिवाइस चयन 'पार्टिशन समस्या' (Partition problem) में अपचयित होता है, जबकि फेज़ ऑर्डरिंग 'हाल्टिंग समस्या' (halting problem) में अपचयित होती है (जो अनडिसाइडेबिलिटी को सिद्ध करती है)। इसके अलावा, उनकी परस्पर निर्भरता एक "बूटस्ट्रैपिंग डिलेमा" (bootstrapping dilemma) पैदा करती है, जहाँ एक चरण को अलग से अनुकूलित करने से दूसरा उप-इष्टतम (suboptimal) हो सकता है। वर्तमान समाधान अक्सर स्थिर ह्यूरिस्टिक्स या अलग-अलग लर्निंग टास्क (जैसे, डिवाइसेस के लिए सुपरवाइज्ड लर्निंग, पासेस के लिए RL) पर निर्भर करते हैं जो डायनेमिक बैकएंड स्थितियों या अनुकूलन स्थान की संयुक्त प्रकृति को समझने में विफल रहते हैं।
कार्यप्रणाली (Methodology)
यह शोधपत्र MQSS-Selector का प्रस्ताव करता है, जो एक एकीकृत, लर्निंग-आधारित फ्रेमवर्क है जिसे डिवाइस चयन और पास ऑर्डरिंग को एक सुसंगत निर्णय लेने वाली प्रक्रिया में एकीकृत करने के लिए डिज़ाइन किया गया है। यह दृष्टिकोण MLIR (Multi-Level Intermediate Representation) संकलन फ्रेमवर्क के भीतर, विशेष रूप से 'क्वेक डायलेक्ट' (Quake dialect) का उपयोग करते हुए, रीइन्फोर्समेंट लर्निंग (RL) और डीप लर्निंग का लाभ उठाता है।
कार्यप्रणाली एक एकीकृत शेड्यूलर के लिए दो वैचारिक योजनाओं के इर्द-गिर्द संरचित है, जिन्हें वर्तमान में भविष्य के एकीकरण के लिए नियोजित अलग-अलग घटकों के रूप में लागू किया गया है:
- दृष्टिकोण 1 (हाइब्रिड): एक मॉड्यूलर डिज़ाइन जहाँ एक सुपरवाइज्ड लर्निंग मॉड्यूल डिवाइस चयन को संभालता है, और इसका आउटपुट एक अलग RL-आधारित मॉड्यूल को फेज़ ऑर्डरिंग के लिए सूचित करता है।
- दृष्टिकोण 2 (पूर्णतः RL-आधारित): एक मोनोलिथिक डिज़ाइन जहाँ डिवाइस चयन और फेज़ ऑर्डरिंग को एक एकल, बड़े एक्शन स्पेस में एक एकीकृत RL एजेंट के लिए संयोजित किया जाता है।
मुख्य घटक:
- डिवाइस चयन मॉड्यूल: विभिन्न डिवाइसेस पर एक प्रोग्राम की हेलिंगर फिडेलिटी (Hellinger fidelity) की भविष्यवाणी करने के लिए सुपरवाइज्ड लर्निंग मॉडल्स (MLP, Random Forest, SVM, KNN) का उपयोग करता है। सिस्टम निष्पादन समय और फिडेलिटी को रैंक करने के लिए सामान्यीकृत करता है, जिससे पूर्ण मान की सटीकता के बजाय सापेक्ष रैंकिंग सटीकता को प्राथमिकता दी जाती है।
- पास चयन मॉड्यूल: एक एक्टर-क्रिटिक (Actor-Critic) RL एल्गोरिदम को लागू करता है।
- स्टेट (State): इसमें प्रोग्राम फीचर्स (qubit count, depth), बैकएंड स्टेटस और मध्यवर्ती संकलन परिणाम शामिल हैं।
- एक्शन (Action): एक विस्तारित MQSS पास सूट (92+ पासेस), एक मैपिंग पास, या एक "फिनिश" (Finish) एक्शन से संकलन पासेस का चयन।
- रिवॉर्ड फंक्शन (Reward Function): इसे निष्पादन क्षमता (नेटिव गेट अनुपालन), अर्ली स्टॉपिंग (समान परिणामों के लिए छोटे पथों को प्राथमिकता देना), और स्ट्रक्चरल ऑप्टिमाइज़ेशन (डेप्थ और ऑपरेशन काउंट को कम करना) को संतुष्ट करने के लिए डिज़ाइन किया गया है।
- डुअल-एनेल्ड एक्सप्लोरेशन प्राइमिंग (DAEP): सफल संकलन रोलआउट्स की विरलता (sparsity) को संबोधित करने के लिए पेश की गई एक नवीन प्रशिक्षण रणनीति। DAEP लॉस फंक्शन में एक गाइडेंस टर्म पेश करता है जो एक पूर्व-निर्धारित पॉलिसी के साथ एक्टर के चयन को एक घटती हुई प्रायिकता (pDAEP) और परिमाण (αDAEP) के साथ ओवरराइट करता है। यह एजेंट द्वारा स्वतंत्र रूप से क्रिटिक के अनुमानों का लाभ उठाने से पहले संरचना प्रदान करके अभिसरण (convergence) को तेज करता है।
प्रायोगिक परिणाम
लेखकों ने दो डेटासेट्स का उपयोग करके घटकों का मूल्यांकन किया:
- डिवाइस चयन: 12 IBM मॉक बैकएंड्स पर 128 MQT-Bench प्रोग्राम्स और दो वास्तविक स्थानीय डिवाइसेस पर 2,880 रैंडम बेंचमार्क्स पर परीक्षण किया गया।
- निष्कर्ष: रैंडम फॉरेस्ट (RF) सबसे उपयुक्त उम्मीदवार के रूप में उभरा, जिसने MLPs को पछाड़ दिया जो अपात्र (infeasible) प्रोग्राम भविष्यवाणियों के साथ संघर्ष कर रहे थे। वास्तविक डिवाइसेस पर, जहाँ सभी प्रोग्राम निष्पादन योग्य थे, सभी मॉडल्स उच्च R2 स्कोर के साथ समान प्रदर्शन करते दिखे। लेखक नोट करते हैं कि जबकि SVM और KNN ने सीमित डेटा पर अच्छी फिडेलिटी भविष्यवाणी दिखाई, वे विविध, बड़े पैमाने के प्रोग्राम सेट्स के लिए RF की तरह स्केल नहीं हो पाएंगे।
- पास चयन: 1,548 केमिकल हैमिल्टोनियन प्रोग्राम्स के डेटासेट पर मूल्यांकन किया गया।
- निष्कर्ष: DAEP के साथ प्रशिक्षित RL एजेंट ने बिना गाइडेंस वाले बेसलाइन की तुलना में काफी बेहतर प्रदर्शन किया।
- निष्पादन क्षमता (Executability): गाइडेड मॉडल ने समाप्ति पर 95.5% निष्पादन योग्य प्रोग्राम प्राप्त किए, जबकि अनगाइडेड मॉडल ने केवल 42.1% प्राप्त किए।
- ऑप्टिमाइज़ेशन: गाइडेड मॉडल ने 87/154 नमूनों में प्रोग्राम डेप्थ और 93/154 नमूनों में ऑपरेशन काउंट को कम किया, जबकि अनगाइडेड मॉडल ने क्रमशः केवल 8 और 15 नमूनों में ये कमी हासिल की।
- समाप्ति (Termination): गाइडेड एजेंट ने प्रभावी ढंग से "फिनिश" एक्शन कॉल करना सीखा (153/154 बार), जबकि अनगाइड मॉडल शायद ही कभी जल्दी समाप्त हुआ।
- आलोचना: लेखक नोट करते हैं कि क्रिटिक नेटवर्क को और अधिक प्रशिक्षण की आवश्यकता है, क्योंकि गाइडेड मॉडल में इसकी वर्गीकरण प्रदर्शन (True/False Positives) रूढ़िवादी थी, जो संभवतः इसलिए है क्योंकि एक्टर ने कम स्टेप्स के साथ कुशलतापूर्वक समाप्त करना सीखा, जिससे क्रिटिक को कम ट्रेनिंग सैंपल मिले। महत्वपूर्ण रूप से, प्रायोगिक डेटा सुझाव देता है कि अतिरिक्त विधियों (जैसे DAEP) के बिना RL, विचार किए गए संसाधनों के तहत संकलन के लिए नेटवर्क को प्रशिक्षित करने का एक व्यवहार्य दृष्टिकोण नहीं है।
- निष्कर्ष: DAEP के साथ प्रशिक्षित RL एजेंट ने बिना गाइडेंस वाले बेसलाइन की तुलना में काफी बेहतर प्रदर्शन किया।
महत्व और दावे
शोधपत्र एक डेटा-ड्रिवन, MLIR-नेटिव क्वांटम संकलन के लिए आधारभूत बिल्डिंग ब्लॉक्स (सुपरवाइज्ड डिवाइस सिलेक्शन और RL-आधारित पास ऑर्डरिंग) की व्यवहार्यता प्रदर्शित करने का दावा करता है। मुख्य योगदान हैं:
- एकीकृत फ्रेमवर्क अवधारणा: शोधपत्र डिवाइस और पास चयन की एनपी-हार्ड, परस्पर निर्भर प्रकृति को संबोधित करने के लिए एक संयुक्त अनुकूलन ढांचे का प्रस्ताव करता है, जो खंडित, चरण-विशिष्ट ह्यूरिस्टिक्स से दूर जाता है। हालाँकि, एकीकृत शेड्यूलर स्वयं एक वैचारिक डिज़ाइन है जिसमें भविष्य के एकीकरण के लिए दो अलग-अलग घटक नियोजित हैं, न कि एक पूरी तरह से प्रदर्शित, एकीकृत प्रणाली।
- MLIR-नेटिव कार्यान्वयन: पिछले कार्यों (जैसे TuniQ) के विपरीत जो Qiskit को लक्षित करते हैं, यह कार्य MQSS एक्स कॉम्पाइलेशन पास सूट को एक बड़े MLIR-आधारित पासेस के साथ विस्तारित करता है, जिससे आधुनिक कंपाइलर इंफ्रास्ट्रक्चर के साथ एकीकरण सक्षम होता है।
- DAEP रणनीति: डुअल-एनेल्ड एक्सप्लोरेशन प्राइमिंग (DAEP) संकलन कार्यों में स्पार्स रिवॉर्ड्स की चुनौती को संबोधित करती है, जिससे RL एजेंट को प्रभावी नीतियां सीखने में मदद मिलती है जहाँ रैंडम एक्सप्लोरेशन विफल हो जाता।
- संयमित दृष्टिकोण: लेखक निष्कर्ष निकालते हैं कि जबकि एकीकृत दृष्टिकोण अंतर-निर्भरताओं का लाभ उठाकर स्वतंत्र अनुकूलन पाइपलाइनों से बेहतर प्रदर्शन करने की क्षमता रखता है, पास चयन घटक को वर्तमान में अधिक व्यापक प्रशिक्षण और मार्गदर्शन की आवश्यकता है। वे इस बात पर जोर देते हैं कि वर्तमान कार्य एक पूर्ण रूप से एकीकृत, अनुकूलन योग्य शेड्यूलर के लिए आधारभूत बिल्डिंग ब्लॉक्स स्थापित करने के बारे में है, न कि यह दावा करने के लिए कि एकीकृत प्रणाली पूरी तरह से साकार हो गई है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।
हर हफ़्ते quantum physics के बेहतरीन पेपर पाएँ।
Stanford, Cambridge और French Academy of Sciences के रिसर्चर हम पर भरोसा करते हैं।
अपना सब्सक्रिप्शन पक्का करने के लिए इनबॉक्स देखें।
कुछ गड़बड़ हो गई। फिर से कोशिश करें?
कोई स्पैम नहीं, कभी भी अनसब्सक्राइब करें।