Reinforcement Learning for Adaptive Composition of Quantum Circuit Optimisation Passes
यह शोध पत्र एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एजेंट का प्रस्ताव और प्रदर्शन करता है जो मानक डिफ़ॉल्ट अनुक्रमों की तुलना में बेहतर टू-क्यूबिट गेट कमी प्राप्त करने के लिए क्वांटम सर्किट अनुकूलन पास को गतिशील रूप से संयोजित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही जटिल क्वांटम व्यंजन (quantum dish) की रेसिपी है। यह रेसिपी एक "क्वांटम सर्किट" के रूप में लिखी गई है, जो वास्तव में कणों (particles) को नियंत्रित करने के निर्देशों (गेट्स) की एक सूची है। समस्या यह है कि ये रेसिपी अक्सर बिखरी हुई, अनावश्यक चरणों से भरी और बहुत लंबी होती हैं। क्वांटम दुनिया में, हर अतिरिक्त चरण "शोर" (noise/त्रुटियां) जोड़ता है, जिससे अंतिम व्यंजन का स्वाद बिगड़ जाता है।
लक्ष्य रेसिपी को साफ करना है: अनावश्यक चरणों को हटाना और अंतिम स्वाद बदले बिना निर्देशों को छोटा करना।
समस्या: बहुत सारे विकल्प, क्रम तय करना कठिन है
क्वांटम सॉफ्टवेयर के पास पहले से ही "ऑप्टिमाइज़ेशन पासेस" (optimization passes) का एक टूलबॉक्स है। इसे अलग-अलग रसोई के औजारों के रूप में समझें:
- एक औजार बड़े सामग्री के ब्लॉक को छोटे, प्रबंधनीय टुकड़ों में काट सकता है।
- दूसरा यह महसूस कर सकता है कि दो चरण एक-दूसरे को रद्द करते हैं और उन्हें हटा सकता है।
- तीसरा काटने के क्रम को बदलने के लिए हो सकता है ताकि यह तेज़ हो सके।
समस्या यह है कि ये औजार अकेले काम करते समय बहुत अच्छे होते हैं, लेकिन इनका उपयोग करने का क्रम अत्यंत महत्वपूर्ण है।
- यदि आप "रीअरेंजिंग" (क्रम बदलने वाले) टूल से पहले "चॉपिंग" (काटने वाले) टूल का उपयोग करते हैं, तो आपको एक बेहतरीन परिणाम मिल सकता है।
- यदि आप इसके विपरीत करते हैं, तो आपको गड़बड़ी मिल सकती है।
वर्तमान में, उपयोगकर्ताओं को सबसे अच्छा क्रम अनुमान लगाना पड़ता है, या वे बस एक "डिफ़ॉल्ट" क्रम का उपयोग करते हैं जो सॉफ्टवेयर निर्माताओं द्वारा तय किया गया है। लेकिन एक डिफ़ॉल्ट क्रम एक सामान्य रेसिपी की तरह है जो सभी के लिए काम करने की कोशिश करती है; यह आपके विशिष्ट व्यंजन के लिए काम करने वाले विशेष शॉर्टकट को मिस कर देती है। एक कस्टम क्रम डिजाइन करने के लिए एक मास्टर शेफ की आवश्यकता होती है जिसके पास वर्षों का अनुभव हो, जो अधिकांश लोगों के पास नहीं होता।
समाधान: एक स्मार्ट एआई शेफ (Smart AI Chef)
लेखकों ने रीइन्फोर्समेंट लर्निंग (RL) नामक तकनीक का उपयोग करके एक "स्मंत एआई शेफ" बनाया है।
प्रशिक्षण (The Training): उन्होंने एआई को केवल नियम नहीं बताए। इसके बजाय, उन्होंने एआई को हजारों अलग-अलग क्वांटम रेसिपी पर अभ्यास करने दिया।
- एआई एक बिखरी हुई रेसिपी को देखता है।
- यह एक टूल (एक ऑप्टिमाइज़ेशन पास) चुनता है जिसे आज़माना है।
- यह टूल लागू करता है।
- यदि रेसिपी छोटी और साफ हो जाती है, तो एआई को एक "रिवॉर्ड" (जैसे गोल्ड स्टार) मिलता है। यदि यह चीज़ों को बदतर बनाता है या कोई बदलाव नहीं करता है, तो इसे कोई रिवॉर्ड नहीं मिलता।
- समय के साथ, एआई न केवल यह सीखता है कि कौन से टूल्स अच्छे हैं, बल्कि किसी भी विशिष्ट रेसिपी के लिए टूल्स का सही क्रम भी सीख जाता है।
"दिमाग" (The Brain): रेसिपी को समझने के लिए, एआई इसे शब्दों की सूची के रूप में नहीं देखता है। यह रेसिपी को एक मैप (ग्राफ) के रूप में देखता है, जहाँ सामग्रियां बिंदु (dots) हैं और निर्देश उन्हें जोड़ने वाली रेखाएं हैं। यह एआई को क्वांटम सर्किट की जटिल संरचना को समझने में मदद करता है, चाहे वह कितना भी बड़ा या अजीब क्यों न हो।
परिणाम: स्मार्ट और तेज़
टीम ने अपने एआई शेफ का परीक्षण सॉफ्टवेयर (PyTKET) द्वारा प्रदान किए गए मानक "डिफ़ॉल्ट" रेसिपी के विरुद्ध किया।
- बेहतर परिणाम: औसतन, एआई शेफ ने रेसिपी से 57.7% अनावश्यक चरणों (two-qubit gates) को हटा दिया। सबसे अच्छा मानक डिफ़ॉल्ट रेसिपी केवल 41.8% ही हटा पाई।
- अनुकूलन क्षमता (Adaptability): एआई ने केवल एक ही ट्रिक का उपयोग नहीं किया। कुछ सरल रेसिपी के लिए, इसने केवल एक टूल का उपयोग किया। बहुत जटिल, बिखरी हुई रेसिपी के लिए, इसने सर्वोत्तम परिणाम प्राप्त करने के लिए टूल्स की एक लंबी, विशिष्ट श्रृंखला का उपयोग किया। इसने एक शक्तिशाली टूल का उपयोग करने में "देरी" करना सीखा यदि इसे पता था कि पहले एक सरल टूल का उपयोग करने से शक्तिशाली टूल और भी बेहतर काम करेगा।
- गति: उन्होंने एआई की तुलना अन्य तरीकों से भी की जो ब्रूट-फोर्स सर्चिंग (हर संभव संयोजन को आज़माना) के माध्यम से सबसे अच्छा क्रम खोजने की कोशिश करते हैं। सर्च विधियों ने अच्छे परिणाम खोजे लेकिन उनमें बहुत अधिक समय लगा। एआई काफी तेज़ था क्योंकि इसे खोजने की आवश्यकता नहीं थी; प्रशिक्षण के आधार पर वह बस "जानता" था कि सबसे अच्छा रास्ता क्या है।
यह क्यों मायने रखता है
यह कार्य दिखाता है कि हमें हर एक क्वांटम सर्किट को साफ करने का सबसे अच्छा तरीका मैन्युअल रूप से पता लगाने के लिए मानव विशेषज्ञ की आवश्यकता नहीं है। हम एक एआई को यह स्वचालित रूप से करने के लिए प्रशिक्षित कर सकते हैं।
एआई एक व्यक्तिगत संपादक की तरह कार्य करता है जो आपके विशिष्ट क्वांटम कोड को देखता है और कहता है, "हे, इस विशिष्ट समस्या के लिए, यदि आप चरण A, फिर चरण C, फिर चरण B करते हैं, तो आपको सबसे साफ परिणाम मिलेगा।" यह वर्तमान में उपयोग किए जाने वाले सामान्य "वन-साइज़-फिट्स-ऑल" सेटिंग्स से बेहतर प्रदर्शन करता है, जिससे क्वांटम कंप्यूटर अधिक कुशल और त्रुटियों के प्रति कम संवेदनशील हो जाते हैं।
संक्षेप में: यह पेपर कंप्यूटर को क्वांटम कोड के लिए एक मास्टर एडिटर बनने की शिक्षा देता है, जो किसी भी विशिष्ट समस्या के लिए सफाई के चरणों के सटीक क्रम को ढूंढ लेता है, और आज उपलब्ध मानक उपकरणों की तुलना में अधिक तेज़ी से और बेहतर तरीके से ऐसा करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।