← नवीनतम पेपर
💻 computer science

Portable Acceleration of Learning With Errors KEMs for Post-Quantum Cryptography

यह शोध पत्र OpenMP Target offloading का उपयोग करके एक लर्निंग विद एरर्स (LWE) आधारित की एनकैप्सुलेशन मैकेनिज्म (KEM) के पोर्टेबल GPU कार्यान्वयन को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एक एकल सोर्स कोडबेस NVIDIA और AMD दोनों एक्सेलेरेटर्स पर पर्याप्त प्रदर्शन त्वरण और ऊर्जा दक्षता प्राप्त कर सकता है और साथ ही वेंडर लॉक-इन से भी बच सकता है।

मूल लेखक: Tiziana Liberati, Nitin Shukla, Simone Rizzo, Elisabetta Boella, Matteo Barbieri, Gabriella Bettonte, Daniele Gregori, Marco Pedicini

प्रकाशित 2026-07-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tiziana Liberati, Nitin Shukla, Simone Rizzo, Elisabetta Boella, Matteo Barbieri, Gabriella Bettonte, Daniele Gregori, Marco Pedicini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यंत सुरक्षित डिजिटल तिजोरी बनाने की कोशिश कर रहे हैं जिसे भविष्य के "क्वांटम" सुपरकंप्यूटर द्वारा भी तोड़ा न जा सके। इसे करने के लिए, आपको "लर्निंग विद एरर्स" (LWE) नामक एक विशाल, उलझे हुए गणितीय पहेली को हल करने की आवश्यकता है। यह एक घास के ढेर में एक विशिष्ट सुई खोजने जैसा है, लेकिन वह घास का ढेर लाखों छोटे, शोर मचाने वाले चुंबकों से बना है, और आप जितना अधिक खोजते हैं, चुंबक उतना ही अधिक हिलते-डुलते रहते हैं।

समस्या क्या है? इन पहेलियों को हल करने में बहुत समय लगता है। यह एक छोटी चम्मच से रेत का पहाड़ एक-एक दाना करके हटाने जैसा है। इस शोध पत्र के लेखकों ने पूछा: "क्या होगा अगर हम एक विशाल, सुपर-फास्ट निर्माण दल (एक GPU) का उपयोग करें ताकि उस रेत को हटाया जा सके?"

बड़ी खोज: एक कोड, दो दल
आमतौर पर, यदि आप एक निर्माण दल का उपयोग करना चाहते हैं, तो आपको एक विशिष्ट टीम (जैसे NVIDIA का CUDA) को काम पर रखना होगा और केवल उनके द्वारा समझ जाने वाले निर्देश लिखने होंगे। यदि आप एक अलग टीम (जैसे AMD) को काम पर रखना चाहते हैं, तो आपको पूरा निर्देश मैनुअल फिर से लिखना होगा। यह महंगा और कष्टदायक है।

यह शोध पत्र दिखाता है कि आप एक ही सेट के निर्देश (OpenMP Target का उपयोग करके) लिख सकते हैं जो NVIDIA और AMD दोनों टीमों के लिए पूरी तरह से काम करते हैं। यह एक रेसिपी लिखने जैसा है जो काम करती है चाहे आप गैस स्टोव या इलेक्ट्रिक चूल्हे वाली रसोई में खाना बना रहे हों, बिना एक भी सामग्री बदले।

जादु적인 ट्रिक: रसोई के अंदर रहना
सबसे बड़ा समय बर्बाद करने वाला काम इन गणितीय पहेलियों के दौरान मुख्य कंप्यूटर (CPU) और सुपर-फास्ट GPU के बीच आना-जाना है। यह एक शेफ के बार-बार मसालों की एक चुटकी के लिए पेंट्री (भंडार कक्ष) की ओर दौड़ने जैसा है।

लेखकों ने यह पता लगाया कि कैसे "नमक" (गणित के लिए आवश्यक यादृच्छिक संख्याएं/random numbers) को सीधे GPU की रसोई के अंदर ही रखा जाए। उन्होंने RNGonGPU नामक एक टूल को अपग्रेड किया ताकि यह NVIDIA और AMD दोनों टीमों के साथ काम कर सके। अब, GPU अपनी सीट छोड़े बिना ही अपने लिए आवश्यक सभी यादृच्छिक संख्याएं उत्पन्न कर सकता है। यह कार्यप्रवाह को सुचारू और तेज़ रखता है।

दौड़: कौन जीतता है?
टीम ने चार अलग-अलग सुपर-फास्ट कंप्यूटरों पर अपने नए तरीके का परीक्षण किया:

  1. NVIDIA A100: एक शक्तिशाली, मानक सुपर-कंप्यूटर।
  2. NVIDIA GH200: एक विशाल "सुपरचिप" जहाँ मस्तिष्क (CPU) और मांसपेशी (GPU) एक सुपर-फास्ट हाईवे (NVLink) के साथ आपस में जुड़े हुए हैं।
  3. AMD MI300X: एक शक्तिशाली, मानक सुपर-कंप्यूटर जिसमें एक विशाल मेमोरी बैंक है।
  4. AMD MI300A: एक चिप जहाँ मस्तिष्क और मांसपेशी बिल्कुल एक ही मेमोरी बैंक साझा करते हैं।

यहाँ उन्हें यह मिला:

  • गति में उछाल: जब गणितीय पहेलियाँ बहुत बड़ी (4,096 आकार की) हो गईं, तो GPU संस्करण नियमित कंप्यूटर संस्करण की तुलना में 120 गुना तेज़ था। यहाँ तक कि और भी बड़ी पहेलियों (16,384 आकार) के लिए, GPU अभी भी बिजली की तरह तेज़ था, जबकि नियमित कंप्यूटर लगभग सो रहा था।
  • विजेता: NVIDIA GH200 सबसे तेज़ था, जिसने काम को लगभग 60 सेकंड में पूरा किया। AMD MI300X दूसरे स्थान पर था, जिसने 85 सेकंड का समय लिया। इन दोनों मशीनों में विशाल, तेज़ मेमोरी बैंक (HBM3) हैं जो डेटा को तेज़ी से बाहर निकाल सकते हैं।
  • चौंकाने वाला हारने वाला: आप सोच सकते हैं कि AMD MI300A बेहतरीन होगा क्योंकि यह मस्तिष्क और मांसपेशी के बीच मेमोरी साझा करता है। लेकिन यह वास्तव में सबसे धीमा था, जिसने 114 सेकंड का समय लिया। क्यों? क्योंकि मस्तिष्क और मांसपेशी एक ही पानी के पाइप (hose) के लिए लड़ रहे थे। जबकि GPU डेटा स्थानांतरित करने की कोशिश कर रहा था, CPU भी अपना गणित करने की कोशिश कर रहा था, और वे एक-दूसरे के रास्ते में आ रहे थे। यह एक ही स्ट्रॉ (नली) से एक साथ पीने की कोशिश करने वाले दो लोगों जैसा है; किसी को भी पूरा घूँट नहीं मिल पाता।

ऊर्जा और गर्मी
टीम ने यह भी जाँच की कि इन मशीनों ने कितनी बिजली का उपयोग किया। NVIDIA GH200 ने न केवल काम तेजी से पूरा किया; इसने कम ऊर्जा का उपयोग किया। इसने पहेली को हल करने के लिए लगभग 9.7 kJ ऊर्जा का उपयोग किया, जबकि AMD MI300X को लगभग 26.2 kJ की आवश्यकता थी। इसका मतलब है कि NVIDIA मशीन लगभग 2.5 गुना अधिक ऊर्जा-कुशल थी।

इसका क्या अर्थ है
यह शोध पत्र साबित करता है कि सुपर-फास्ट सुरक्षा प्राप्त करने के लिए आपको NVIDIA और AMD के बीच किसी एक को चुनने की आवश्यकता नहीं है। आप दोनों पर चलने के लिए एक ही कोड बेस का उपयोग कर सकते हैं। हालाँकि, उन्होंने यह भी दिखाया कि केवल एक तेज़ चिप होना ही काफी नहीं है; मेमोरी कैसे व्यवस्थित है, यह भी उतना ही मायने रखता है। यदि मस्तिष्क और मांसपेशी एक ही मेमोरी के लिए लड़ते हैं, तो पूरा सिस्टम धीमा हो जाता है।

संक्षेप में, लेखकों ने मापा कि पोर्टेबल, GPU-त्वरित सुरक्षा केवल एक सपना नहीं है—यह एक वास्तविकता है जो क्वांटम-प्रूफ तालों को बहुत तेज़ और अधिक कुशल बना सकती है, बशर्ते आप मेमोरी लेन में ट्रैफिक जाम से बचने के लिए सही हार्डवेयर सेटअप चुनें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →