← नवीनतम पेपर
💬 NLP

ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs

ArcLight एक हल्का (lightweight) LLM इन्फरेंस आर्किटेक्चर है जिसे विशेष रूप से many-core CPUs के लिए डिज़ाइन किया गया है जो कुशल मेमोरी प्रबंधन, थ्रेड शेड्यूलिंग और नियंत्रित टेंसर पैरेललिज्म के माध्यम से cross-NUMA मेमोरी एक्सेस बाधाओं को दूर करता है, जिससे व्यापक डिवाइस अनुकूलता बनाए रखते हुए मुख्यधारा के फ्रेमवर्क्स की तुलना में 46% तक अधिक थ्रूपुट प्राप्त होता है।

मूल लेखक: Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल पुस्तकालय (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसे आप पढ़ना चाहते हैं और जिसके सवालों के जवाब देना चाहते हैं। आमतौर पर, लोग इसे करने के लिए बहुत तेज़, महंगे ग्राफिक्स कार्ड (GPUs) का उपयोग करते हैं। लेकिन क्या होगा अगर आपके पास केवल एक विशाल, शक्तिशाली कंप्यूटर सर्वर हो जिसमें सैकड़ों सामान्य प्रोसेसर कोर (CPUs) हों?

यहीं ARCLIGHT काम आता है। यह इन बड़े CPU सर्वरों पर इन AI मॉडल्स को चलाने का एक नया तरीका है, और यह एक बहुत ही विशिष्ट, उबाऊ लेकिन घातक समस्या को हल करता है: "क्रॉस-नोड" (Cross-Node) ट्रैफिक जाम।

यहाँ ARCLIGHT की कहानी है, जिसे सरल भाषा में समझाया गया है।

1. समस्या: "ऑफिस बिल्डिंग" का ट्रैफिक जाम

एक विशाल ऑफिस बिल्डिंग की कल्पना करें जिसमें 128 कर्मचारी (CPU कोर) और 4 अलग-अलग फ्लोर (NUMA नोड्स) हैं। प्रत्येक फ्लोर के पास अपना खुद का सप्लाई क्लोजेट (लोकल मेमोरी) है।

  • पुराना तरीका (llama.cpp): मैनेजर सभी 128 कर्मचारियों को एक कार्य पर मिलकर काम करने के लिए कहता है। लेकिन यहाँ एक पेंच है: मैनेजर को इस बात की परवाह नहीं है कि सप्लाई क्लोजेट किस फ्लोर पर है। यदि फ्लोर 1 के किसी कर्मचारी को फ्लोर 4 के क्लोजेट से स्टेपलर चाहिए, तो उन्हें लिफ्ट लेनी होगी, बिल्डिंग के आर-पार जाना होगा और लाइन में खड़ा होना होगा।
  • परिणाम: भले ही आपके पास 128 कर्मचारी हों, वे अपना 75% समय लिफ्ट का इंतज़ार करने और पैदल चलने में बिताते हैं। वे डेटा और वर्कर के बीच की दूरी के कारण "अटक" (stalled) जाते हैं। इसे "क्रॉस-NUMA मेमोरी वॉल" कहा जाता है।

मौजूदा सॉफ्टवेयर (जैसे llama.cpp) छोटे, सरल कंप्यूटरों के लिए बनाए गए थे। जब आप इन्हें इन विशाल 128-कोर सर्वरों पर चलाने की कोशिश करते हैं, तो यह धीमा हो जाता है क्योंकि इसे यह नहीं पता होता कि वर्कर्स को उनके अपने फ्लोर पर कैसे रखा जाए।

2. समाधान: ARCLIGHT (एक स्मार्ट मैनेजर)

लेखकों ने ARCLIGHT को शून्य से बनाया है। इसे एक भारी-भरकम सॉफ्टवेयर सूट के रूप में नहीं, बल्कि विशेष रूप से इन विशाल ऑफिस बिल्डिंगों के लिए डिज़ाइन किए गए एक हल्के, मिनिमलिस्ट टूलकिट के रूप में देखें।

यह तीन मुख्य तरकीबों के साथ ट्रैफिक जाम को ठीक करता है:

A. "लोकल सप्लाई क्लोजेट" रणनीति (मेमोरी मैनेजमेंट)

ऑपरेटिंग सिस्टम को रैंडम तरीके से सप्लाई रखने देने के बजाय, ARCLIGHT कहता है: "यदि आप फ्लोर 1 पर हैं, तो आपकी सप्लाई फ्लोर 1 पर ही रहेगी।"

  • यह प्रत्येक फ्लोर के लिए अलग-अलग सप्लाई क्लोजेट बनाता है।
  • यह सुनिश्चित करता है कि जब किसी कर्मचारी को डेटा की आवश्यकता हो, तो वे अपने ठीक बगल वाले क्लोजेट से उसे उठा लें। कोई लिफ्ट नहीं, कोई पैदल चलना नहीं।

B. "स्प्लिट टीम" रणनीति (टेन्सर पैरेललिज्म)

पुराने तरीके में, सभी लोग एक ही समय में बिल्कुल एक जैसा मैथ (गणित) करने की कोशिश करते थे, जिससे इस बात को लेकर भ्रम पैदा होता था कि किसे क्या चाहिए।
ARCLIGHT खेल बदल देता है:

  • यह बड़े मैथ के सवाल को चार छोटे हिस्सों में बाँट देता है।
  • फ्लोर 1 अपने फ्लोर 1 के डेटा का उपयोग करके पहला हिस्सा करता है।
  • फ्लोर 2 अपने फ्लोर 2 के डेटा का उपयोग करके दूसरा हिस्सा करता है।
  • वे पूरी तरह से स्वतंत्र रूप से काम करते हैं। उन्हें अंत तक एक-दूसरे से बात करने की आवश्यकता नहीं होती है।
  • उपमा (Analogy): 128 लोगों द्वारा एक साथ एक विशाल लेगो (Lego) किला बनाने के बजाय (जहाँ वे एक-दूसरे से टकराते हैं), आप फ्लोर 1 के 32 लोगों को किले का एक छोटा हिस्सा बनाने के लिए देते हैं, और फ्लोर 2 के 32 लोग अपना खुद का सेक्शन बनाते हैं। वे अंत में टुकड़ों को आपस में जोड़ने के लिए मिलते हैं।

C. "फ्लेक्सिबल असेंबली लाइन" (थ्रेड शेड्यूलिंग)

कभी-कभी अलग-अलग फ्लोर के वर्कर्स अपने छोटे कार्यों को अलग-अलग गति से पूरा करते हैं।

  • पुराना तरीका: सभी लोग अगले चरण पर जाने से पहले सबसे धीमे व्यक्ति का इंतज़ार करते हैं। (द "ग्लोबल बैरियर")।
  • ARCLIGHT का तरीका: यह एक स्मार्ट सिस्टम का उपयोग करता है। यदि फ्लोर 1 जल्दी समाप्त कर लेता है, तो वे फ्लोर 2 के अभी भी काम करने के दौरान तुरंत अगला छोटा कार्य शुरू कर सकते हैं। वे केवल तभी सिंक (sync) होने के लिए रुकते हैं जब वास्तव में आवश्यक हो। यह सबको व्यस्त और तेज़ रखता है।

3. परिणाम: ऑफिस की गति बढ़ाना

लेखकों ने 192 कोर (48 कोर के 4 फ्लोर) वाले एक विशाल सर्वर पर इसका परीक्षण किया।

  • प्रतियोगिता: लोकप्रिय टूल llama.cpp लिफ्ट के ट्रैफिक (क्रॉस-नोड मेमोरी एक्सेस) के कारण धीमा था।
  • ARCLIGHT: डेटा को लोकल रखकर और काम को स्मार्ट तरीके से विभाजित करके, यह 46% तेज़ था।

यह क्यों मायने रखता है?

अधिकांश लोग सोचते हैं कि AI के लिए महंगे, दुर्लभ GPUs की आवश्यकता होती है। लेकिन कई कंपनियों के पास पहले से ही विशाल CPU सर्वर (वेब होस्टिंग और नेटवर्किंग के लिए उपयोग किए जाने वाले) मौजूद हैं।

  • पहले: ये सर्वर बड़े AI मॉडल्स को कुशलतापूर्वक चलाने के लिए बहुत धीमे थे।
  • अब: ARCLIGHT के साथ, कंपनियाँ पहले से मौजूद हार्डवेयर का उपयोग शक्तिशाली AI चलाने के लिए कर सकती हैं, जिससे पैसा बचता है और AI अधिक सुलभ बनता है।

संक्षेप में

ARCLIGHT एक चतुर, हल्का सॉफ्टवेयर मैनेजर है जो बड़े कंप्यूटर सर्वरों को डेटा लेने के लिए बिल्डिंग के आर-पार चलकर समय बर्बाद करने से रोकता है। यह वर्कर्स को व्यवस्थित करता है ताकि वे अपने ही मोहल्ले में रहें, काम को इस तरह बाँटता है कि वे एक-दूसरे से न टकराएं, और उन्हें अपनी गति से काम करने देता है। परिणाम? स्टैंडर्ड कंप्यूटर चिप्स पर AI चलाने का एक बहुत तेज़ और सस्ता तरीका।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →