← नवीनतम पेपर
🤖 machine learning

LGNNIC: Acceleration of Large-Scale GNN Training using SmartNICs

यह शोध पत्र LGNNIC का प्रस्ताव करता है, जो एक नवीन वितरित GNN प्रशिक्षण आर्किटेक्चर है जो रिमोट मेमोरी नोड्स के साथ सह-स्थित (co-located) SmartNICs का लाभ उठाकर नेबर सैंपलिंग और क्वांटाइजेशन कार्यों को ऑफलोड करता है, जिससे डेटा ट्रांसफर की मात्रा में महत्वपूर्ण कमी आती है और पारंपरिक CPU-GPU सिस्टम की तुलना में पर्याप्त प्रशिक्षण गति प्राप्त होती है।

मूल लेखक: Liad Gerstman, Aditya Dhakal, Dejan Milojicic, Avi Mendelson

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liad Gerstman, Aditya Dhakal, Dejan Milojicic, Avi Mendelson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझने के लिए सिखाने की कोशिश कर रहे हैं, और इसके लिए आप उसे ऊन का एक विशाल, उलझा हुआ गोला दिखा रहे हैं। ऊन का प्रत्येक गांठ एक व्यक्ति, एक स्थान या एक वस्तु है, और उन्हें जोड़ने वाली डोरियाँ उनके संबंधों को दर्शाती हैं। कंप्यूटर इसी तरह सोशल मीडिया दोस्तों, वैज्ञानिक उद्धरणों (scientific citations) या सिफारिश प्रणालियों (recommendation systems) जैसे जटिल नेटवर्क के बारे में सीखते हैं। यह क्षेत्र ग्राफ न्यूरल नेटवर्क्स (GNNs) कहलाता है। रोबोट को एक गांठ को देखना होगा, यह देखना होगा कि वह किससे जुड़ी है, फिर उन गांठों के कनेक्शन को देखना होगा, और इसी तरह, ताकि वह पूरी तस्वीर को समझ सके।

समस्या यह है कि जैसे-जैसे ऊन का गोला बड़ा होता जाता है, उसे रोबोट की मेज पर फिट करना असंभव हो जाता है। यदि रोबोट पूरे गोले को अपने हाथों में (अपनी मेमोरी में) पकड़कर उसका अध्ययन करने की कोशिश करता है, तो उसके पास जगह खत्म हो जाती है। इसलिए, वैज्ञानिक आमतौर पर ऊन को छोटे, प्रबंधनीय टुकड़ों में काट देते हैं जिन्हें "मिनी-बैचेस" (mini-batches) कहा जाता है ताकि वे एक-एक करके उनका अध्ययन कर सकें। लेकिन यहाँ एक पेंच है: यदि ऊन किसी दूर स्थित गोदाम में संग्रहीत है, और रोबोट एक छोटे से कार्यालय में है, तो रोबोट को ऊन के इन टुकड़ों को लेने के लिए गोदाम तक बार-बार दौड़ना पड़ता है। डेटा को नेटवर्क पर भेजने में लगने वाला समय (दौड़ने का समय) अक्सर वास्तव में गांठों का अध्ययन करने में लगने वाले समय से अधिक हो जाता है। यह "कम्युनिकेशन बॉटलनेक" (communication bottleneck) है जो सब कुछ धीमा कर देता है।

यहीं पर एक नया विचार LGNNIC काम आता है। शोधकर्ताओं ने एक सरल प्रश्न पूछा: क्या होगा यदि हम केवल गोदाम में ऊन को स्टोर न करें, बल्कि गोदाम को एक जोड़ी स्मार्ट कैंची और ऊन के ठीक बगल में एक छोटा, सुपर-फास्ट सहायक भी दे दें? बजाय इसके कि रोबोट ऊन का एक बड़ा हिस्सा गोदाम से लाने के लिए पूरी दूरी तय करे और फिर उसे आकार में काटे, गोदाम में मौजूद सहायक उस काम को काटने और सिकोड़ने (shrink करने) का काम रोबोट के मांगने से पहले ही कर सकता है।

"LGNNIC: SmartNICs का उपयोग करके बड़े पैमाने पर GNN प्रशिक्षण की गति बढ़ाना" शीर्षक वाला यह शोध पत्र बिल्कुल यही बताता है। टीम ने एक ऐसा सिस्टम बनाया है जहाँ "गोदाम" (एक रिमोट मेमोरी नोड) के पास एक विशेष, बुद्धिमान नेटवर्क कार्ड है जिसे SmartNIC (विशेष रूप से NVIDIA BlueFlow-2) कहा जाता है। यह SmartNIC उस स्मार्ट सहायक की तरह काम करता है। यह डेटा के ठीक बगल में बैठता है और मुख्य कंप्यूटर (प्रशिक्षण नोड जिसमें शक्तिशाली GPU है) को कुछ भी भेजने से पहले दो जादुई करतब दिखाता है:

  1. नेबर सैंपलिंग (Neighbor Sampling): ग्राफ का एक विशाल, अव्यवस्थित हिस्सा भेजने के बजाय, SmartNIC अनावश्यक कनेक्शनों को काट देता है, जिससे केवल सबसे प्रासंगिक पड़ोसी बचते हैं जिनका रोबोट को अध्ययन करना है। यह ऊन के एक विशाल, भारी बंडल को एक छोटे, सुव्यवस्थित पैकेज में बदल देता है।
  2. क्वांटाइजेशन (Quantization): SmartNIC पैकेज के अंदर की जानकारी के आकार को भी छोटा कर देता है। यह डेटा को एक भारी, उच्च-परिशुद्धता (high-precision) प्रारूप (32-bit floating-point) से एक हल्के, थोड़े कम सटीक प्रारूप (16-bit floating-point) में बदल देता है। इसे एक हाई-डेफिनिशन वीडियो को छोटी फ़ाइल में कंप्रेस करने जैसा समझें जो अभी भी शानदार दिखता है लेकिन आकार में आधा रह जाता है।

शोधकर्ताओं ने Reddit (एक विशाल फोरम) और अकादमिक पेपर नेटवर्क जैसे वास्तविक डेटासेट का उपयोग करके इस सेटअप का परीक्षण किया। उन्होंने पाया कि SmartNIC को डेटा काटने और सिकोड़ने का भारी काम सौंपने से, वे डेटा की मात्रा को नेटवर्क पर भेजने के तरीके को नाटकीय रूप से कम कर सकते हैं।

परिणाम प्रभावशाली थे। जब उन्होंने डेटा स्थानांतरित करने के लिए एक मानक, धीमी विधि (जैसे नियमित इंटरनेट कनेक्शन पर ईमेल भेजना, जिसे वे "Sockets" कहते हैं) का उपयोग किया, तो SmartNIC के प्री-कटिंग और श्रिंकिंग ने प्रशिक्षण प्रक्रिया को कुछ कार्यों के लिए 62.4 गुना तक तेज़ बना दिया। एक तेज़, अधिक प्रत्यक्ष कनेक्शन विधि (जिसे "DOCA-DMA" कहा जाता है) का उपयोग करने के बाद भी, उन्होंने 17.5 गुना तक की गति वृद्धि देखी। "सिकुड़ने" वाले तरीके (quantization) ने और भी अधिक गति प्रदान की, जिससे मानक विधि के साथ ट्रांसफ़र 3.6 गुना तक तेज़ और प्रत्यक्ष विधि के साथ 1.3 गुना तेज़ हो गया।

महत्वपूर्ण रूप से, पेपर नोट करता है कि हालांकि SmartNIC खुद काटने के काम में एक सुपर-पावरफुल मुख्य कंप्यूटर की तुलना में धीमा है, लेकिन नेटवर्क पर एक बड़ा, बिना कटा हुआ बंडल खींचने के बजाय समय बचाने का लाभ अधिक है। "सहायक" काम करने में धीमा है, लेकिन वह "धावक" (नेटवर्क) को एक भारी भार ढोने से बचा लेता है। शोधकर्ताओं ने यह भी जांचा कि इस सिकुड़ने (shrinking) से रोबोट के उत्तर गलत नहीं हुए; परिणामों की सटीकता लगभग वैसी ही रही, जिसमें केवल बहुत मामूली बदलाव आए।

संक्षेप में, यह पेपर सुझाव देता है कि नेटवर्क के किनारे (edge) पर, यानी जहाँ डेटा रहता है, कुछ काम को स्थानांतरित करके, हम रोबोट को बार-बार दौड़ने में समय बर्बाद करने से रोक सकते हैं। यह डेटा को स्थानांतरित करने के तरीके के बारे में अधिक स्मार्ट बनकर, बड़े, जटिल AI प्रशिक्षण को बहुत तेज़ बनाने का एक चतुर तरीका है, बिना किसी बड़े या महंगे कंप्यूटर के निर्माण के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →