Qupertino: Pure MLX Array Kernels versus Hand-Tuned Metal Shaders for Quantum Circuit Simulation on Apple Silicon
यह शोध पत्र Qupertino को पेश करता है, जो Apple Silicon के लिए एक ओपन-सोर्स क्वांटम सर्किट सिम्युलेटर है, जो यह प्रदर्शित करता है कि कैसे हैंड-ट्यून्ड (hand-tuned) मेटल शेडर्स (Metal shaders) शुद्ध MLX ऐरे ऑपरेशन्स (MLX array operations) की तुलना में काफी बेहतर प्रदर्शन करते हैं, जिससे विविध क्वांटम वर्कलोड्स पर मौजूदा CPU और GPU-आधारित सिम्युलेटर्स की तुलना में 95 गुना तक की गति वृद्धि प्राप्त होती है और साथ ही सटीक शुद्धता भी बनी रहती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ प्रस्तुत कार्य को समझने के लिए, व्यक्ति को सबसे पहले आधुनिक क्वांटम कंप्यूटिंग के सामने खड़ी चुनौती की प्रकृति को समझना होगा। क्वांटम कंप्यूटर केवल आज के मशीनों के तेज़ संस्करण नहीं हैं; वे मौलिक रूप से अलग भौतिक नियमों के सेट पर काम करते हैं, जो सूचना को इस तरह से संचालित करते हैं जिससे वे एक साथ कई संभावनाओं को तलाश सकें। चूंकि ये मशीनें अभी अपने शुरुआती चरणों में हैं, त्रुटियों के प्रति संवेदनशील हैं और आकार में सीमित हैं, इसलिए वैज्ञानिक यह देखने के लिए कि वे कैसे व्यवहार करना चाहिए, क्लासिकल कंप्यूटरों पर बहुत अधिक भरोसा करते हैं। यह सिमुलेशन एल्गोरिदम का परीक्षण करने और वास्तविक हार्डवेयर को कैलिब्रेट करने के लिए एक महत्वपूर्ण उपकरण है। हालाँकि, एक क्वांटम सिस्टम का सिमुलेशन करना अत्यंत कठिन है क्योंकि हर अतिरिक्त कण के साथ इसे वर्णित करने के लिए आवश्यक सूचना की मात्रा विस्फोटक रूप से बढ़ती है। केवल पच्चीस कणों के सिस्टम को सिम्युलेट करने के लिए, एक कंप्यूटर को संख्याओं की एक विशाल श्रृंखला को ट्रैक करना होगा, जो एक ऐसा कार्य है जो सबसे शक्तिशाली सुपरकंप्यूटरों को भी उनकी सीमाओं तक धकेल देता है। प्रश्न लंबे समय से यह रहा है कि क्या नवीनतम पीढ़ी के उपभोक्ता कंप्यूटर, विशेष रूप से एप्पल के कस्टम चिप्स का उपयोग करने वाले, इस बोझ को कुशलतापूर्वक संभाल सकते हैं, और यदि ऐसा है, तो उस शक्ति का कितना हिस्सा चतुर सॉफ्टवेयर बनाम कच्चे हार्डवेयर इंजीनियरिंग से आता है।
एक शोधकर्ता ने एप्पल सिलिकॉन प्रोसेसर के लिए विशेष रूप से डिज़ाइन किए गए 'क्विपर्टिनो' (Qupertino) नामक एक नया सिमुलेशन टूल बनाकर इसे संबोधित किया है। ये प्रोसेसर अद्वितीय हैं क्योंकि वे एक यूनिफाइड मेमोरी आर्किटेक्चर का उपयोग करते हैं, जिसका अर्थ है कि सेंट्रल प्रोसेसर और ग्राफिक्स प्रोसेसर एक ही मेमोरी पूल को साझा करते हैं, जिससे उन्हें डेटा को एक से दूसरे में कॉपी करने की आवश्यकता नहीं होती। यह डिज़ाइन पारंपरिक कंप्यूटरों में पाए जाने वाले एक महत्वपूर्ण बाधा को दूर करता है, जहाँ अलग-अलग मेमोरी बैंकों के बीच बड़ी मात्रा में डेटा स्थानांतरित करने से सब कुछ धीमा हो जाता है। शोधकर्ता जानना चाहते थे कि वे इन चिप्स पर उपलब्ध मानक, उच्च-स्तरीय प्रोग्रामिंग टूल्स का उपयोग करके वास्तव में कितनी दूर तक जा सकते हैं, और ग्राफिक्स प्रोसेसर के लिए विशेष रूप से ट्यून किए गए कस्टम, लो-लेवल कोड का उपयोग करके कितनी अतिरिक्त प्रदर्शन क्षमता प्राप्त की जा सकती है। उन्होंने दो दृष्टिकोणों की तुलना करने का लक्ष्य रखा: एक जो पूरी तरह से मानक ऐरे ऑपरेशंस (array operations) पर निर्भर था, और दूसरा जिसने हार्डवेयर से हर बूंद गति निकालने के लिए हाथ से तैयार किए गए निर्देशों को शामिल किया था।
अध्ययन से पता चला कि मानक दृष्टिकोण, प्रभावशाली होने के बावजूद, प्रदर्शन का एक बड़ा हिस्सा पीछे छोड़ देता है। जब शोधकर्ता ने केवल मानक ऐरे ऑपरेशंस का उपयोग करके अपने सिमुलेशन चलाए, तो सॉफ्टवेयर पहले से ही सेंट्रल प्रोसेसर्स पर चलने वाले मौजूदा टूल्स से तेज़ था। हालाँकि, जब उन्होंने अपने सिस्टम के दूसरे स्तर को सक्षम किया—ग्राफिक्स प्रोसेसर के लिए कस्टम, हैंड-ट्यून्ड निर्देशों का उपयोग करके—तो गति नाटकीय रूप से बढ़ गई। कुछ जटिल कार्यों के लिए, जैसे कि कई क्वांटम एल्गोरिदम में उपयोग किए जाने वाले फूरियर ट्रांसफॉर्म का सिमुलेशन, कस्टम-ट्यून्ड संस्करण मानक प्रोसेसर-आधारित टूल्स की तुलना में लगभग पचानवे गुना तेज़ था और पेनीलेन (PennyLane) सिमुलेशन सॉफ्टवेयर की तुलना में लगभग सौ गुना तेज़ था। चुंबकीय प्रणालियों के विकास के सिमुलेशन जैसे अन्य परिदृश्यों में, कस्टम दृष्टिकोण अभी भी तीस गुना से अधिक तेज़ था। शोधकर्ता ने इन परिणामों को सावधानीपूर्वक मापा, यह सुनिश्चित करने के लिए कि अंतर वास्तविक हैं और केवल यादृच्छिक उतार-चढ़ाव नहीं हैं, उन्होंने एक ही मशीन पर बार-बार समान परीक्षण किए। उन्होंने पाया कि कस्टम-ट्यून वाला दृष्टिकोण सभी अठारह तुलना सेल में औसत रनटाइम द्वारा सबसे तेज़ था, हालांकि 25 क्यूबिट्स पर ग्रोवर सर्च जैसे विशिष्ट स्पार्स सर्किट पर, यह सीपीयू बेसलाइन के साथ सांख्यिकीय रूप से बराबरी पर था, और 15 क्यूबिट्स पर सबसे छोटे गेट-स्पार्स सर्किट पर, सीपीयू बेसलाइन अधिक तेज़ बनी रही।
प्रदर्शन के इस अंतर का मुख्य कारण यह है कि सॉफ्टवेयर क्वांटम सर्किट की संरचना को कैसे संभालता है। मानक दृष्टिकोण प्रत्येक गेट, या ऑपरेशन को एक सामान्य तरीके से मानता है, भले ही उनमें से कई गेट एक अनुमानित पैटर्न का पालन करते हों। हालाँकि, कस्टम-ट्यून्ड दृष्टिकोण इन पैटर्न को पहचानता है। उदाहरण के लिए, जब संचालन की एक श्रृंखला केवल क्वांटम स्टेट के फेज को घुमाती है, तो कस्टम कोड प्रत्येक चरण को व्यक्तिगत रूप से संसाधित करने के बजाय इसे एक ही, सुव्यवस्थित पास में गणना करता है। इसी तरह, जब सिमुलेशन में कणों की स्थिति बदलना या एक विशिष्ट प्रकार का गणितीय रूपांतरण लागू करना शामिल होता है, तो कस्टम कोड इन क्रियाओं को एक एकीकृत ब्लॉक के रूप में निष्पादित करने के लिए एक साथ समूहबद्ध करता है। यह एक डिलीवरी ड्राइवर के समान है जो, सड़क पर हर घर पर एक एकल पैकेज छोड़ने के बजाय, उस सड़क के लिए सभी पैकेज लोड करता है और उन्हें एक कुशल यात्रा में छोड़ देता है। इन पैटर्न को पहचानकर और उनका लाभ उठाकर, कस्टम कोड मेमोरी तक कंप्यूटर के पहुँचने की संख्या को कम करता है, जो कि प्रक्रिया का सबसे समय लेने वाला हिस्सा है।
इन भारी गति लाभों के बावजूद, शोधकर्ता ने यह सुनिश्चित करने के लिए सावधानी बरती कि कस्टम कोड परिणामों को न बदले। उन्होंने एक ऐसा सिस्टम बनाया जो स्वचालित रूप से पता लगाता है कि कब कोई सर्किट ऐसे पैटर्न में फिट बैठता है जिसे अनुकूलित किया जा सकता है और उसे कस्टम कोड की ओर निर्देशित करता है, जबकि बाकी सब कुछ मानक पथ पर चलने के लिए छोड़ देता है। उन्होंने सत्यापित किया कि कस्टम कोड के परिणाम मानक कोड से दशमलव के सबसे छोटे स्थान तक पूरी तरह मेल खाते हैं। इसका अर्थ है कि उपयोगकर्ता सटीकता से समझौता किए बिना कस्टम कोड की गति प्राप्त कर सकते हैं। यह टूल अनुकूलन, खोज और रासायनिक प्रतिक्रियाओं के सिमुलेशन सहित विभिन्न प्रकार के क्वांटम एल्गोरिदम का समर्थन करता है। इसमें एक सौ पचास कणों तक के सिस्टम को सिम्युलेट करने की विधि भी शामिल है, बशर्ते वे सिस्टम बहुत अधिक एंटैंगल्ड (entangled) न हों, जो कि उसी हार्डवेयर पर मानक दृष्टिकोण के साथ असंभव कार्य है।
निष्कर्ष बताते हैं कि जबकि आधुनिक उपभोक्ता हार्डवेयर परिष्कृत क्वांटम सिमुलेशन चलाने के लिए पर्याप्त शक्तिशाली है, लेकिन उस पर चलने वाले सॉफ्टवेयर को इसकी पूरी क्षमता को अनलॉक करने के लिए समान रूप से परिष्कृत होना चाहिए। एप्पल सिलिकॉन की यूनिफाइड मेमोरी एक ठोस आधार प्रदान करती है, जिससे डेटा कॉपी करने की आवश्यकता समाप्त हो जाती है, लेकिन वास्तविक गति उस कोड को लिखने से आती है जो समस्या की विशिष्ट संरचना को समझता है। शोधकर्ता ने प्रदर्शित किया कि शुद्ध मानक ऑपरेशंस में लिखा गया सिम्युलेटर एक व्यवहार्य उपकरण है, लेकिन यह उस संस्करण की तुलना में पच्चीस से तैंतीस गुना प्रदर्शन अंतराल छोड़ देता है जो हैंड-ट्यून्ड निर्देशों का उपयोग करता है। यह अंतर हार्डवेयर की विफलता नहीं है, बल्कि एक अनुस्मारक है कि उच्च-प्रदर्शन कंप्यूटिंग की दुनिया में, सबसे कुशल पथ के लिए अक्सर मशीन के आर्किटेक्चर की गहरी समझ की आवश्यकता होती है। यह कार्य इस बात का स्पष्ट रोडमैप प्रदान करता है कि अगली पीढ़ी के क्वांटम प्रयोगों के लिए तेज़ सिम्युलेटर कैसे बनाए जाएं, यह दिखाते हुए कि यूनिफाइड मेमोरी और सावधानीपूर्वक तैयार किए गए कोड का संयोजन एक एकल डेस्कटॉप कंप्यूटर पर संभव की सीमाओं को आगे बढ़ा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।