← नवीनतम पेपर
🤖 AI

Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling

यह शोध पत्र AFlex प्रस्तुत करता है, जो विच्छिन्न (disaggregated) अटेंशन-एफएफएन निष्पादन, संयुक्त संसाधन और आवृत्ति अनुकूलन, और एक इंटरलीव्ड पाइपलाइन के माध्यम से, जो सख्त विलंबता SLOs को पूरा करते हुए ऑपरेटर-स्तरीय आवृत्ति संवेदनशीलता के अनुकूल होता है, LLM सर्विंग में ऊर्जा खपत को 49% तक कम करता है।

मूल लेखक: Cunchen Hu, Liangliang Xu, Tian Liu, Min Lyu, Yongkun Li, Sa Wang, Shuo Quan, Yanan Yang, Wenda Tang, Yiduo Wang, Fu Yu, Jie Wu

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cunchen Hu, Liangliang Xu, Tian Liu, Min Lyu, Yongkun Li, Sa Wang, Shuo Quan, Yanan Yang, Wenda Tang, Yiduo Wang, Fu Yu, Jie Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल डेटा सेंटर में एक विशाल, सुपर-स्मार्ट रोबोटिक मस्तिष्क चला रहे हैं। यह मस्तिष्क, जिसे लार्ज लैंग्वेज मॉडल (LLM) के रूप में जाना जाता है, चैटबॉट्स, कोडिंग सहायकों और रचनात्मक लेखकों के पीछे का इंजन है। लेकिन इसमें एक पेंच है: ये मस्तिष्क अविश्वसनीय रूप से भूखे होते हैं। वे भारी मात्रा में बिजली की खपत करते हैं, अक्सर अपने प्रोसेसरों को पूरी गति से चलाते हैं, जैसे कि एक रेस कार का इंजन तब भी अधिकतम RPM पर गरज रहा हो जब कार ट्रैफिक में फंसी हो। यह एक समस्या है क्योंकि यह ऊर्जा की बहुत अधिक लागत पैदा करता है और बहुत अधिक गर्मी भी उत्पन्न करता है।

इन रोबोटों को तेज़ चलाने के लिए, वैज्ञानिकों ने काम को विभाजित करने का तरीका खोज निकाला है। रोबोट की सोचने की प्रक्रिया को दो मुख्य चरणों के रूप में सोचें: पहले, यह आपके प्रश्न को पढ़ता और समझता है ("प्रीफिल" चरण), और दूसरा, यह शब्द दर शब्द उत्तर लिखता है ("डिकोड" चरण)। हाल ही में, इंजीनियरों ने महसूस किया कि इन दोनों चरणों को अलग-अलग कमरों में, श्रमिकों की अलग-अलग टीमों के साथ रखना बेहतर है, न कि एक ही टीम से दोनों काम करवाना। इसे "डिसएग्रिगेशन" (disaggregation) कहा जाता है। यह रोबोट को तेज़ी से उत्तर देने में मदद करता है, लेकिन यह ज़रूरी नहीं कि इससे बिजली का उपयोग कम हो जाए। वास्तव में, यदि आप बिजली बचाने के लिए श्रमिकों की गति को कम कर देते हैं, तो रोबोट बहुत धीमा हो सकता है और अपनी समय सीमा चूक सकता है। बड़ी चुनौती यह है कि हम ऊर्जा बचाने के लिए गति को कैसे कम करें बिना रोबोट के अटकने या विफल होने के डर के?

यह शोध पत्र एक चतुर नए सिस्टम को पेश करता है जिसका नाम AFlex है, जो इस पहेली को एक ऐसे समाधान के रूप में हल करता है जो रोबोट के मस्तिष्क को अलग-अलग ऊर्जा आवश्यकताओं वाले विशेषज्ञों की एक टीम की तरह मानता है। शोधकर्ताओं ने पाया कि रोबोट के मस्तिष्क के दो मुख्य भाग—वह भाग जो आपके शब्दों पर ध्यान देता है (अटेंशन/Attention) और वह भाग जो तर्क को प्रोसेस करता है (फीड-फॉरवर्ड नेटवर्क, या FFN)—एक समान नहीं हैं। वे दो अलग-अलग एथलीटों की तरह हैं: एक स्प्रिंटर (धावक) है जिसे तेज़ दौड़ने के लिए हाई-स्पीड बूस्ट की आवश्यकता होती है, जबकि दूसरा मैराथन धावक है जो थक जाता है यदि आप उसे बहुत अधिक धकेलते हैं, लेकिन वह कुशलतापूर्वक एक स्थिर, धीमी गति बनाए रख सकता है।

इससे पहले, सिस्टम पूरे मस्तिष्क को एक इकाई के रूप में देखते थे, जिससे स्प्रिंटर और मैराथन धावक दोनों को एक ही गति से दौड़ने के लिए मजबूर होना पड़ता था। यदि आप स्प्रिंटर की मदद के लिए उन्हें तेज़ करते, तो मैराथन धावक ऊर्जा बर्बाद करता। यदि आप मैराथन धावक को बचाने के लिए उन्हें धीमा करते, तो स्प्रिंटर बहुत धीमा हो जाता। इस पेपर के लेखकों ने पाया कि ये दोनों भाग वास्तव में अलग-अलग गति पसंद करते हैं, जो इस बात पर निर्भर करता है कि रोबोट क्या कर रहा है, प्रश्न कितना लंबा है, और एक साथ कितने लोग सवाल पूछ रहे हैं।

इसे ठीक करने के लिए, AFlex एक स्मार्ट मैनेजर की तरह कार्य करता है जो स्प्रिंटर और मैराथन धावक को उनके अपने अलग ट्रैक और उनकी अपनी व्यक्तिगत गति सेटिंग्स दे सकता है। यह एक "ग्लोबल शेड्यूलर" (Global Scheduler) का उपयोग करता है जो बड़े चित्र की योजना बनाता है, यह तय करता है कि प्रत्येक कार्य के लिए कितने श्रमिकों को नियुक्त किया जाए, और एक "लोकल कंट्रोलर" (Local Controller) का उपयोग करता है जो वास्तविक समय में, प्रति सेकंड, उनकी गति को सूक्ष्म रूप से नियंत्रित करता है। यह सिस्टम एक विशेष पाइपलाइन तकनीक का भी उपयोग करता है जहाँ कार्यकर्ता काम करते समय एक-दूसरे को नोट्स पास करते हैं, ताकि कोई भी खाली न बैठा रहे। यह "इंटरलीव्ड" (interleaved) दृष्टिकोण सुनिश्चित करता है कि असेंबली लाइन बिना किसी अंतराल के सुचारू रूप से चलती रहे।

शोधकर्ताओं ने शक्तिशाली कंप्यूटर चिप्स (NVIDIA A800 GPUs) पर AFlex का परीक्षण किया और कोडिंग एवं बातचीत के कार्यों से संबंधित वास्तविक दुनिया के डेटा का उपयोग किया। उन्होंने पाया कि अटेंशन और FFN भागों को अपनी अनूठी, ऊर्जा-बचत वाली गति पर चलने देने से, यह सिस्टम मौजूदा सर्वोत्तम तरीकों की तुलना में प्रति शब्द उत्पन्न होने वाली ऊर्जा को 49% तक कम कर सकता है, और उन सिस्टमों की तुलना में जो केवल पूरे चिप को धीमा करने की कोशिश करते हैं, 48% कम कर सकता है। महत्वपूर्ण रूप से, रोबोट अभी भी पहले की तरह ही तेज़ उत्तर देता रहा, और अपनी गति के वादों को पूरा करता रहा। यह पेपर सुझाव देता है कि एआई के मस्तिष्क के विभिन्न हिस्सों को अलग-अलग गति देने का यह दृष्टिकोण आर्टिफिशियल इंटेलिजेंस को प्रदर्शन से समझौता किए बिना बहुत अधिक ऊर्जा-कुशल बनाने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →