← नवीनतम पेपर
💻 computer science

ShardTensor: Domain Parallelism for Scientific Machine Learning

यह शोधपत्र ShardTensor को प्रस्तुत करता है, जो एक नवीन डोमेन पैरेललिज्म फ्रेमवर्क है जो अत्यधिक-रिज़ॉल्यूशन वाले डेटासेट पर साइंटिफिक मशीन लर्निंग मॉडल्स के स्केलेबल, उच्च-सटीक प्रशिक्षण और अनुमान (इन्फरेंस) को सक्षम करने के लिए इनपुट डेटा की स्थानिक विमा (स्पेशियल डाइमेंशनैलिटी) को हार्डवेयर बाधाओं से अलग करता है।

मूल लेखक: Corey Adams, Peter Harrington, Akshay Subramaniam, Mohammad Shoaib Abbas, Jaideep Pathak, Mike Pritchard, Sanjay Choudhry

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Corey Adams, Peter Harrington, Akshay Subramaniam, Mohammad Shoaib Abbas, Jaideep Pathak, Mike Pritchard, Sanjay Choudhry

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "ShardTensor: डोमेन पैरेललिज्म फॉर साइंटिफिक मशीन लर्निंग" पेपर की व्याख्या दी गई है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों में तोड़ा गया है।

बड़ी समस्या: "बहुत बड़ा जो फिट न हो सके" वाला बॉक्स

कल्पना कीजिए कि आप एक वैज्ञानिक हैं जो एक तूफान, एक ब्लैक होल, या मानव मस्तिष्क का अनुकरण (simulate) करने की कोशिश कर रहे हैं। सटीक परिणाम प्राप्त करने के लिए, आपको इन चीजों को अत्यधिक विस्तार से देखने की आवश्यकता होती—जैसे कि एक फोटो को तब तक ज़ूम करना जब तक कि आप उसके हर एक पिक्सेल को न देख सकें।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे हाई-रेज़ोल्यूशन डेटा कहा जाता है।

समस्या यह है कि AI मॉडल विशेष कंप्यूटरों पर चलते हैं जिन्हें GPU (ग्राफिक्स प्रोसेसिंग यूनिट) कहा जाता है। इन GPU की मेमोरी सीमित होती है, जैसे कि एक छोटा सा बैकपैक।

  • समस्या: जब वैज्ञानिक एक विशाल, हाई-रेज़ोल्यूशन इमेज (जैसे कि एक तूफान का 3D स्कैन) को AI में डालने की कोशिश करते हैं, तो डेटा इतना बड़ा होता है कि वह उस बैकपैक में फिट ही नहीं हो पाता।
  • पुराना समाधान: वैज्ञानिक पहले डेटा को "डाउनसैंपल" (downsample) किया करते थे। यह एक 4K मूवी को एक बहुत छोटे, धुंधले 144p थंबनेल में सिकोड़ने जैसा है ताकि वह बैकपैक में फिट हो सके। AI चल तो जाता है, लेकिन परिणाम धुंधले और गलत होते हैं।
  • दूसरा पुराना समाधान: वे डेटा को कई कंप्यूटरों में विभाजित करने की कोशिश कर सकते थे (डेटा पैरेललिज्म), लेकिन यह तभी काम करता है जब आपके पास डेटा के कई अलग-अलग "टुकड़े" हों (जैसे 100 अलग-अलग तूफान)। यदि आपके पास केवल एक विशाल तूफान है जिसका विश्लेषण करना है, तो पुराने तरीके विफल हो जाते हैं। आप गणित को तोड़े बिना एक ही तूफान को 100 टुकड़ों में आसानी से नहीं बाँट सकते।

समाधान: ShardTensor (एक "टीम बैकपैक" रणनीति)

NVIDIA के लेखकों ने ShardTensor नामक एक नया टूल पेश किया है।

ShardTensor को एक विशाल पिज्जा (आपका हाई-रेज़ोल्यूशन डेटा) के स्लाइस काटने और उन स्लाइस को घेरे में खड़े शेफ (GPU) की एक टीम को देने के जादुई तरीके के रूप में समझें।

  • यह कैसे काम करता है: पूरे पिज्जा को एक प्लेट पर रखने के बजाय, सिस्टम पिज्जा को स्थानिक रूप से (क्षेत्र के आधार पर, अलग-अलग पिज्जा के बजाय) काटता है।
    • शेफ A ऊपरी-बाएँ हिस्से का स्लाइस रखता है।
    • शेफ B ऊपरी-दाएँ हिस्से का स्लाइस रखता है।
    • शेफ C निचले-बाएँ हिस्से का स्लाइस रखता है।
  • जादू: जब शेफ को सामग्री मिलाने (गणित करने) की आवश्यकता होती है, तो वे अपने स्लाइस के किनारों को अपने पड़ोसियों को दे सकते हैं। यदि शेफ A को यह जानने की आवश्यकता है कि उनके स्लाइस के बिल्कुल किनारे पर क्या हो रहा है, तो वे शेफ B से पूछते हैं। वे पूरे पहेली को हल करने के लिए मिलकर काम करते हैं बिना पूरे पिज्जा को एक ही प्लेट पर रखे।

इसे डोमेन पैरेललिज्म कहा जाता है। यह वैज्ञानिकों को ऐसा डेटा प्रोसेस करने की अनुमति देता है जो एक सिंगल कंप्यूटर की मेमोरी से भी बड़ा है, भले ही उनके पास केवल एक ही डेटासेट हो।

यह क्यों महत्वपूर्ण है ("क्यों करें?" सेक्शन)

पेपर बताता है कि वैज्ञानिक AI में, सबसे अधिक मेमोरी खर्च करने वाली चीज़ AI का "दिमाग" (मॉडल वेट्स) नहीं है; बल्कि मध्यवर्ती चरण (एक्टिवेशन्स) हैं।

  • उपमा (Analogy): कल्पना कीजिए कि आप व्हाइटबोर्ड पर एक विशाल गणितीय समस्या हल कर रहे हैं। आपको न केवल अंतिम उत्तर के लिए जगह चाहिए, बल्कि आपके द्वारा किए गए हर एक रफ कैलकुलेशन (scratch calculation) के लिए भी जगह चाहिए।
  • परिणाम: हाई-रेज़ोल्यूशन डेटा के साथ, ये "रफ कैलकुलेशन" तुरंत मेमोरी भर देते हैं। ShardTensor इन रफ कैलकुलेशन को कई GPU में फैला देता है।
  • लाभ:
    1. स्ट्रॉन्ग स्केलिंग (Strong Scaling): यदि आपके पास एक विशाल डेटासेट है, तो अधिक GPU जोड़ने से काम बहुत तेज़ी से पूरा होता है (जैसे निर्माण स्थल पर अधिक श्रमिकों को जोड़ना)।
    2. वीक स्केलिंग (Weak Scaling): यदि आपके पास ऐसा डेटासेट है जो इतना विशाल था कि पहले उसे चलाना असंभव था, तो अब आप लोड साझा करने के लिए अधिक GPU जोड़कर उसे चला सकते हैं।

पेपर से वास्तविक दुनिया के उदाहरण

लेखकों ने यह साबित करने के लिए दो विशिष्ट वैज्ञानिक समस्याओं पर इसका परीक्षण किया कि यह काम करता है:

  1. StormScope (मौसम का पूर्वानुमान):

    • चुनौती: व्यक्तिगत गरज के साथ तूफान की भविष्यवाणी करने के लिए पूरे संयुक्त राज्य अमेरिका के मानचित्र को बहुत उच्च विवरण (3 किमी रेज़ोल्यूशन) के साथ देखने की आवश्यकता होती है।
    • समस्या: एक सिंगल कंप्यूटर की मेमोरी (80GB) उस विवरण पर पूरे US मैप के डेटा को नहीं रख सकती थी। यह एक सिंगल फोल्डर में पूरे अमेरिका के नक्शे को ले जाने जैसा था।
    • समाधान: ShardTensor का उपयोग करके, उन्होंने US मैप को 32 GPU में विभाजित किया। AI अब बिना क्रैश हुए उच्च परिभाषा (High Definition) में पूरे देश को "देख" सकता था और तूफानों की सटीक भविष्यवाणी कर सकता था।
  2. Transolver (एयरोडायनामिक्स):

    • चुनौती: ईंधन दक्षता में सुधार के लिए कार के ऊपर बहने वाली हवा का अनुकरण (Simulate) करना।
    • परिणाम: वे एक मेश (3D ग्रिड) पर AI को प्रशिक्षित करने में सक्षम थे जिसमें कार के आकार को दर्शाने वाले 1.2 मिलियन से अधिक बिंदु शामिल थे। इस स्तर का विवरण पहले एक सिंगल मशीन पर प्रशिक्षित करना असंभव था।

पेपर क्या नहीं कहता (सीमाएँ)

लेखक ट्रेड-ऑफ के बारे में ईमानदार हैं:

  • कम्युनिकेशन ओवरहेड (Communication Overhead): क्योंकि GPU को अपने डेटा स्लाइस के किनारों को साझा करने के लिए लगातार एक-दूसरे से बात करनी पड़ती है, इसलिए "बात करने के समय" में थोड़ा नुकसान होता है।
  • छोटा डेटा: यदि डेटा छोटा है, तो यह बातचीत का समय सिस्टम को एक सिंगल कंप्यूटर के मुकाबले धीमा बना देता है। ShardTensor केवल विशाल डेटा के लिए है।
  • हर चीज़ के लिए जादू नहीं: यह विशिष्ट प्रकार के गणितीय ऑपरेशन्स के साथ सबसे अच्छा काम करता है। कुछ पुराने या बहुत विशिष्ट ऑपरेशन्स अभी भी समर्थित नहीं हो सकते हैं।

सारांश

ShardTensor एक नया सॉफ्टवेयर टूल है जो वैज्ञानिकों को विशाल, हाई-रेज़ोल्यूशन वैज्ञानिक डेटा को काटने और उसे कई कंप्यूटरों में फैलाने की अनुमति देता है। यह उन्हें ऐसे विस्तृत डेटा पर AI मॉडल को प्रशिक्षित करने की अनुमति देता है जो पहले एक सिंगल कंप्यूटर की मेमोरी में फिट नहीं हो पाता था, जिससे अधिक सटीक मौसम पूर्वानुमान, बेहतर कार डिज़ाइन और गहरी वैज्ञानिक खोजें संभव हो पाती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →