Portable Acceleration of Learning With Errors KEMs for Post-Quantum Cryptography
यह शोध पत्र OpenMP Target offloading का उपयोग करके एक लर्निंग विद एरर्स (LWE) आधारित की एनकैप्सुलेशन मैकेनिज्म (KEM) के पोर्टेबल GPU कार्यान्वयन को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एक एकल सोर्स कोडबेस NVIDIA और AMD दोनों एक्सेलेरेटर्स पर पर्याप्त प्रदर्शन त्वरण और ऊर्जा दक्षता प्राप्त कर सकता है और साथ ही वेंडर लॉक-इन से भी बच सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अत्यंत सुरक्षित डिजिटल तिजोरी बनाने की कोशिश कर रहे हैं जिसे भविष्य के "क्वांटम" सुपरकंप्यूटर द्वारा भी तोड़ा न जा सके। इसे करने के लिए, आपको "लर्निंग विद एरर्स" (LWE) नामक एक विशाल, उलझे हुए गणितीय पहेली को हल करने की आवश्यकता है। यह एक घास के ढेर में एक विशिष्ट सुई खोजने जैसा है, लेकिन वह घास का ढेर लाखों छोटे, शोर मचाने वाले चुंबकों से बना है, और आप जितना अधिक खोजते हैं, चुंबक उतना ही अधिक हिलते-डुलते रहते हैं।
समस्या क्या है? इन पहेलियों को हल करने में बहुत समय लगता है। यह एक छोटी चम्मच से रेत का पहाड़ एक-एक दाना करके हटाने जैसा है। इस शोध पत्र के लेखकों ने पूछा: "क्या होगा अगर हम एक विशाल, सुपर-फास्ट निर्माण दल (एक GPU) का उपयोग करें ताकि उस रेत को हटाया जा सके?"
बड़ी खोज: एक कोड, दो दल
आमतौर पर, यदि आप एक निर्माण दल का उपयोग करना चाहते हैं, तो आपको एक विशिष्ट टीम (जैसे NVIDIA का CUDA) को काम पर रखना होगा और केवल उनके द्वारा समझ जाने वाले निर्देश लिखने होंगे। यदि आप एक अलग टीम (जैसे AMD) को काम पर रखना चाहते हैं, तो आपको पूरा निर्देश मैनुअल फिर से लिखना होगा। यह महंगा और कष्टदायक है।
यह शोध पत्र दिखाता है कि आप एक ही सेट के निर्देश (OpenMP Target का उपयोग करके) लिख सकते हैं जो NVIDIA और AMD दोनों टीमों के लिए पूरी तरह से काम करते हैं। यह एक रेसिपी लिखने जैसा है जो काम करती है चाहे आप गैस स्टोव या इलेक्ट्रिक चूल्हे वाली रसोई में खाना बना रहे हों, बिना एक भी सामग्री बदले।
जादु적인 ट्रिक: रसोई के अंदर रहना
सबसे बड़ा समय बर्बाद करने वाला काम इन गणितीय पहेलियों के दौरान मुख्य कंप्यूटर (CPU) और सुपर-फास्ट GPU के बीच आना-जाना है। यह एक शेफ के बार-बार मसालों की एक चुटकी के लिए पेंट्री (भंडार कक्ष) की ओर दौड़ने जैसा है।
लेखकों ने यह पता लगाया कि कैसे "नमक" (गणित के लिए आवश्यक यादृच्छिक संख्याएं/random numbers) को सीधे GPU की रसोई के अंदर ही रखा जाए। उन्होंने RNGonGPU नामक एक टूल को अपग्रेड किया ताकि यह NVIDIA और AMD दोनों टीमों के साथ काम कर सके। अब, GPU अपनी सीट छोड़े बिना ही अपने लिए आवश्यक सभी यादृच्छिक संख्याएं उत्पन्न कर सकता है। यह कार्यप्रवाह को सुचारू और तेज़ रखता है।
दौड़: कौन जीतता है?
टीम ने चार अलग-अलग सुपर-फास्ट कंप्यूटरों पर अपने नए तरीके का परीक्षण किया:
- NVIDIA A100: एक शक्तिशाली, मानक सुपर-कंप्यूटर।
- NVIDIA GH200: एक विशाल "सुपरचिप" जहाँ मस्तिष्क (CPU) और मांसपेशी (GPU) एक सुपर-फास्ट हाईवे (NVLink) के साथ आपस में जुड़े हुए हैं।
- AMD MI300X: एक शक्तिशाली, मानक सुपर-कंप्यूटर जिसमें एक विशाल मेमोरी बैंक है।
- AMD MI300A: एक चिप जहाँ मस्तिष्क और मांसपेशी बिल्कुल एक ही मेमोरी बैंक साझा करते हैं।
यहाँ उन्हें यह मिला:
- गति में उछाल: जब गणितीय पहेलियाँ बहुत बड़ी (4,096 आकार की) हो गईं, तो GPU संस्करण नियमित कंप्यूटर संस्करण की तुलना में 120 गुना तेज़ था। यहाँ तक कि और भी बड़ी पहेलियों (16,384 आकार) के लिए, GPU अभी भी बिजली की तरह तेज़ था, जबकि नियमित कंप्यूटर लगभग सो रहा था।
- विजेता: NVIDIA GH200 सबसे तेज़ था, जिसने काम को लगभग 60 सेकंड में पूरा किया। AMD MI300X दूसरे स्थान पर था, जिसने 85 सेकंड का समय लिया। इन दोनों मशीनों में विशाल, तेज़ मेमोरी बैंक (HBM3) हैं जो डेटा को तेज़ी से बाहर निकाल सकते हैं।
- चौंकाने वाला हारने वाला: आप सोच सकते हैं कि AMD MI300A बेहतरीन होगा क्योंकि यह मस्तिष्क और मांसपेशी के बीच मेमोरी साझा करता है। लेकिन यह वास्तव में सबसे धीमा था, जिसने 114 सेकंड का समय लिया। क्यों? क्योंकि मस्तिष्क और मांसपेशी एक ही पानी के पाइप (hose) के लिए लड़ रहे थे। जबकि GPU डेटा स्थानांतरित करने की कोशिश कर रहा था, CPU भी अपना गणित करने की कोशिश कर रहा था, और वे एक-दूसरे के रास्ते में आ रहे थे। यह एक ही स्ट्रॉ (नली) से एक साथ पीने की कोशिश करने वाले दो लोगों जैसा है; किसी को भी पूरा घूँट नहीं मिल पाता।
ऊर्जा और गर्मी
टीम ने यह भी जाँच की कि इन मशीनों ने कितनी बिजली का उपयोग किया। NVIDIA GH200 ने न केवल काम तेजी से पूरा किया; इसने कम ऊर्जा का उपयोग किया। इसने पहेली को हल करने के लिए लगभग 9.7 kJ ऊर्जा का उपयोग किया, जबकि AMD MI300X को लगभग 26.2 kJ की आवश्यकता थी। इसका मतलब है कि NVIDIA मशीन लगभग 2.5 गुना अधिक ऊर्जा-कुशल थी।
इसका क्या अर्थ है
यह शोध पत्र साबित करता है कि सुपर-फास्ट सुरक्षा प्राप्त करने के लिए आपको NVIDIA और AMD के बीच किसी एक को चुनने की आवश्यकता नहीं है। आप दोनों पर चलने के लिए एक ही कोड बेस का उपयोग कर सकते हैं। हालाँकि, उन्होंने यह भी दिखाया कि केवल एक तेज़ चिप होना ही काफी नहीं है; मेमोरी कैसे व्यवस्थित है, यह भी उतना ही मायने रखता है। यदि मस्तिष्क और मांसपेशी एक ही मेमोरी के लिए लड़ते हैं, तो पूरा सिस्टम धीमा हो जाता है।
संक्षेप में, लेखकों ने मापा कि पोर्टेबल, GPU-त्वरित सुरक्षा केवल एक सपना नहीं है—यह एक वास्तविकता है जो क्वांटम-प्रूफ तालों को बहुत तेज़ और अधिक कुशल बना सकती है, बशर्ते आप मेमोरी लेन में ट्रैफिक जाम से बचने के लिए सही हार्डवेयर सेटअप चुनें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।