← नवीनतम पेपर
💻 computer science

Stencil Computations on Cerebras Wafer-Scale Engine

यह शोध पत्र CStencil को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो Cerebras Wafer-Scale Engine (WSE-3) पर टू-डायमेंशनल स्टेंसिल कंप्यूटेशन को सफलतापूर्वक मैप करता है, और पारंपरिक मेमोरी बाधाओं को दूर करने के लिए चिप की विशाल ऑन-चिप मेमोरी और मेश इंटरकनेक्ट का लाभ उठाकर एक अनुकूलित GPU बेसलाइन की तुलना में 342x तक की गति वृद्धि (speedup) प्राप्त करता है।

मूल लेखक: Elia Belli, Daniele De Sensi

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Elia Belli, Daniele De Sensi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल पहेली को हल करने की कोशिश कर रहे हैं जहाँ हर एक टुकड़ा उस टुकड़े पर निर्भर करता है जो उसे छू रहा है। विज्ञान की दुनिया में, इसे स्टेंसिल कंप्यूटेशन (stencil computation) कहा जाता है। यह वह गणित है जिसका उपयोग धातु की प्लेट में गर्मी कैसे फैलती है, विमान के चारों ओर हवा कैसे बहती है, या दशकों में जलवायु पैटर्न कैसे बदलते हैं, जैसे चीजों का अनुकरण (सिमुलेशन) करने के लिए किया जाता है।

पिछले एक दशक में, इन पहेलियों को हल करने के लिए सबसे अच्छे उपकरण GPUs (ग्राफिक्स कार्ड और सुपरकंप्यूटर में शक्तिशाली चिप्स) रहे हैं। लेकिन एक समस्या है: GPUs उन अविश्वसनीय रूप से तेज़ डिलीवरी ट्रकों के बेड़े की तरह हैं जिन्हें पहेली के हर एक टुकड़े को उठाने के लिए एक दूर स्थित गोदाम (मुख्य मेमोरी) से बार-बार आना-जाना पड़ता है। भले ही ट्रक तेज़ हैं, लेकिन वे अपना अधिकांश समय गोदाम का इंतज़ार करते हुए ट्रैफिक में फंसे रहने में बिता देते है। इसे "मेमोरी वॉल" (Memory Wall) के रूप में जाना जाता है।

नया दावेदार: द सेरेब्रास वेफर-स्केल इंजन (The Cerebras Wafer-Scale Engine)

यहाँ सेरेब्रास वेफर-स्केल इंजन (WSE-3) का प्रवेश होता है। ट्रकों के एक बेड़े के बजाय, एक विशाल फैक्ट्री फ्लोर की कल्पना करें जो सिलिकॉन के एक ही विशाल टुकड़े (एक पूरे वेफर) पर बना है। इस फैक्ट्री फ्लोर पर 9,00,000 नन्हे कर्मचारी (प्रोसेसर) हैं, और प्रत्येक के पास अपना खुद का व्यक्तिगत टूलबॉक्स (मेमोरी) है जो उनके ठीक बगल में रखा है। उन्हें गोदाम तक जाने की ज़रूरत नहीं है; वे बस अपने निकटतम पड़ोसियों को नोट्स (संदेश) पास कर सकते हैं।

पेपर एक सरल प्रश्न पूछता है: क्या हम इस AI-डिज़ाइन किए गए फैक्ट्री का उपयोग पारंपरिक GPU ट्रकों की तुलना में इन वैज्ञानिक पहेलियों को तेज़ी से हल करने के लिए कर सकते हैं?

प्रयोग: CStencil बनाम ConvStencil

यह पता लगाने के लिए, शोधकर्ताओं ने सेरेब्रास फैक्ट्री पर चलाने के लिए एक नया प्रोग्राम बनाया जिसे CStencil कहा गया। उन्होंने इसकी तुलना GPU के लिए वर्तमान गोल्ड-स्टैंडर्ड प्रोग्राम, जिसे ConvStencil कहा जाता है, के साथ की।

नियमों को निष्पक्ष बनाने के लिए, उन्हें नियमों को थोड़ा समायोजित करना पड़ा। सेरेब्रास फैक्ट्री "त्वरित, अनुमानित गणनाओं" (लोअर प्रिसिजन मैथ) के लिए अनुकूलित है, जबकि वैज्ञानिक सिमुलेशन को आमतौर पर "अत्यधिक सटीक गणनाओं" (डबल प्रिसिजन) की आवश्यकता होती है। चूंकि सेरेब्रास डबल प्रिसिजन को अच्छी तरह से नहीं करता है, इसलिए शोधकर्ताओं ने GPU प्रोग्राम को सिंगल प्रिसिजन में बदलकर टवीक किया, ठीक वैसे ही जैसे सेरेब्रास चिप करती है, ताकि वे सेब की तुलना सेब से (समान चीज़ों की तुलना) कर सकें।

उन्होंने यह कैसे किया: "हेलो" स्वैप (The "Halo" Swap)

इन पहेलियों का कठिन हिस्सा किनारे (edges) हैं। जब ग्रिड के बीच का एक कर्मचारी अपने टुकड़े को अपडेट करता है, तो उसे जानना होता है कि उसके पड़ोसी क्या कर रहे हैं।

  • GPU पर: कर्मचारियों को पड़ोसी का डेटा प्राप्त करने के लिए एक केंद्रीय गोदाम के पार चिल्लाना पड़ता है। इसमें समय लगता है।
  • सेरेब्रास पर: कर्मचारी सीधे अपने बगल में खड़े व्यक्ति को नोट्स पास करते हैं।

शोधकर्ताओं को सेरेब्रास कर्मचारियों को नोट्स पास करने के दो अलग-अलग तरीके सिखाने पड़े:

  1. स्टार पैटर्न (Star Pattern): केवल उत्तर, दक्षिण, पूर्व और पश्चिम के चार लोगों को नोट्स पास करना।
  2. बॉक्स पैटर्न (Box Pattern): चार सीधे पड़ोसियों के साथ-साथ चार तिरछे (diagonal) लोगों को भी नोट्स पास करना। चूंकि कर्मचारी केवल सीधे पड़ोसियों से बात कर सकते हैं, इसलिए उन्हें एक "रिले" सिस्टम का उपयोग करना पड़ा: तिरछे नोट को पड़ोसी को दें, जो फिर उसे तिरछे दोस्त तक पहुँचा दे।

परिणाम: एक बड़ी जीत

परिणाम चौंका देने वाले थे।

  • गति (Speed): परीक्षण किए गए सबसे बड़े पहेलियों पर, सेरेब्रास चिप GPU की तुलना में 342 गुना तेज़ थी।
  • कारण: GPU ट्रैफिक में फंसा हुआ था (मेमोरी का इंतज़ार कर रहा था)। सेरेब्रास चिप कभी फैक्ट्री फ्लोर से बाहर नहीं गई। क्योंकि प्रत्येक कर्मचारी के पास उनकी अपनी मेमोरी ठीक बगल में थी, वे उतनी ही तेज़ी से गणना कर सकते थे जितनी तेज़ी से उनका दिमाग सोच सकता था, बिना कभी डिलीवरी का इंतज़ार किए।
  • स्केलिंग (Scaling): जैसे-जैसे पहेली बड़ी होती गई, GPU धीमा होता गया क्योंकि ट्रैफिक खराब होता गया। सेरेब्रास चिप तेज़ (या उतनी ही तेज़) होती गई क्योंकि उन्होंने बस फैक्ट्री फ्लोर में अधिक कर्मचारियों को जोड़ा, और वे सभी मिलकर पूरी तरह से काम करते रहे।

चुनौती: इसे प्रोग्राम करना कठिन है

पेपर स्वीकार करता है कि हालांकि सेरेब्रास चिप एक स्पीड डेमन (गति का दैत्य) है, लेकिन इसे चलाना बहुत कठिन है।

  • GPU: आप उच्च-स्तरीय उपकरणों (जैसे CUDA) का उपयोग कर सकते हैं जो आपके लिए ट्रैफिक को संभाल लेते हैं। यह एक ऑटोमैटिक कार चलाने जैसा है।
  • सेरेब्रास: आपको हर एक कर्मचारी को मैन्युअल रूप से बताना होगा कि कब नोट पास करना है और कब गणना शुरू करनी है। यह एक ऐसे ऑर्केस्ट्रा के कंडक्टर होने जैसा है जहाँ आपको 9,00,000 संगीतकारों को ठीक से बताना पड़ता है कि उन्हें कब ताली बजानी है। यदि आप कोई गलती करते हैं, तो पूरा सिस्टम रुक जाता है।

निष्कर्ष

यह पेपर सिद्ध करता है कि आर्टिफिशियल इंटेलिजेंस (जो डेटा को पड़ोसियों के बीच पास करने को पसंद करता है) के लिए बनाई गई हार्डवेयर को पारंपरिक वैज्ञानिक समस्याओं को हल करने के लिए फिर से उपयोग किया जा सकता है। जलवायु मॉडलिंग या फ्लूइड डायनेमिक्स जैसे विशाल सिमुलेशन के लिए, सेरेब्रास वेफर-स्केल इंजन उस "मेमोरी वॉल" को तोड़ने का एक तरीका प्रदान करता है जिसने वर्षों से सुपरकंप्यूटरों को पीछे धकेल रखा है, और ऐसी गति प्रदान करता है जो पहले असंभव थी। हालाँकि, जब तक प्रोग्रामिंग टूल्स आसान नहीं हो जाते, यह रोज़मर्रा के कंप्यूटरों के विकल्प के बजाय विशेषज्ञों के लिए एक विशेष उपकरण बना हुआ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →