← नवीनतम पेपर
🤖 machine learning

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

यह शोध पत्र HELLoRA का प्रस्ताव करता है, जो Mixture-of-Experts मॉडल्स के लिए एक पैरामीटर-कुशल फाइन-ट्यूनिंग विधि है, जो केवल सबसे अधिक सक्रिय होने वाले विशेषज्ञों (experts) से ही लो-रैंक अडैप्टेशन (LoRA) मॉड्यूल को जोड़ता है, जिससे मानक LoRA की तुलना में प्रशिक्षण योग्य मापदंडों और कम्प्यूटेशनल लागत को कम करते हुए डाउनस्ट्रीम प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang

प्रकाशित 2026-05-20
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अत्यधिक विशिष्ट रसोई है जिसमें 64 अलग-अलग शेफ हैं (ये एक Mixture-of-Experts AI मॉडल में "एक्सपर्ट्स" हैं)। जब कोई ग्राहक किसी व्यंजन का ऑर्डर देता है, तो हेड शेफ सभी 64 शेफों से नहीं पूछता कि क्या पकाएं; इसके बजाय, वह उन शीर्ष 8 शेफों को चुनता है जो उस विशिष्ट ऑर्डर के लिए सबसे उपयुक्त हैं। यह रसोई को अविश्वसनीय रूप से कुशल बनाता है क्योंकि एक समय में केवल कुछ ही लोग काम कर रहे होते हैं।

अब, कल्पना कीजिए कि आप इस रसोई को एक नई, विशिष्ट रेसिपी (जैसे कि "एक परफेक्ट सडेरौ (sourdough) कैसे बेक करें") सिखाना चाहते हैं। इसे "फाइन-ट्यूनिंग" कहा जाता है।

समस्या: "ऑल-हैंड्स" दृष्टिकोण (The "All-Hands" Approach)

इन रसोईयों को सिखाने का मानक तरीका (LoRA नामक विधि का उपयोग करके) यह है कि आप प्रत्येक शेफ को एक नया रेसिपी कार्ड और अभ्यास करने के लिए एक नोटबुक देते हैं, यहाँ तक कि उन्हें भी जो इस सडेरौ को बनाने के लिए कभी बुलाए ही नहीं जाएंगे।

  • बर्बादी: आप उन शेफों को प्रशिक्षित करने में समय और मेमोरी बर्बाद कर रहे हैं जो इस नई रेसिपी का उपयोग कभी नहीं करेंगे।
  • जोखिम: यदि आप एक ऐसे शेफ को मजबूर करते हैं जो "सुशी" में विशेषज्ञ है कि वह "सडेरौ" का अभ्यास करे क्योंकि शायद उसे बुलाया जा जाए, तो आप उनके मूल सुशी कौशल को बिगाड़ सकते हैं। आप उनकी विशेषज्ञता को कमज़ोर कर रहे हैं।

समाधान: HELLoRA (Hot Experts Layer-Level Low-Rank Adaptation)

लेखकों ने एक स्मार्ट तरीका प्रस्तावित किया है जिसे HELLOARA कहा जाता है। सभी को प्रशिक्षित करने के बजाय, वे यह करते हैं:

  1. "टेस्ट ऑफ टेस्ट" (वॉर्म-अप): वास्तविक प्रशिक्षण शुरू होने से पहले, वे एक त्वरित, छोटा अभ्यास सत्र चलाते हैं। वे रसोई पर नज़र रखते हैं कि कौन से विशिष्ट शेफ वास्तव में सडेरौ पकाने के लिए बुलाए जाते हैं।
  2. "हॉट लिस्ट": वे "हॉट एक्सपर्ट्स" की पहचान करते—वे कुछ शेफ जो इस विशिष्ट कार्य के लिए 90% काम करते हैं।
  3. लक्षित प्रशिक्षण (Targeted Training): वे केवल इन "हॉट एक्सपर्ट्स" को ही नए रेसिपी कार्ड और नोटबुक देते हैं। अन्य 56 शेफों ( "कोल्ड एक्सपर्ट्स") को शांत रहने, अपने मूल कौशल को तेज़ रखने और कुछ न करने के लिए कहा जाता है।

यह क्यों काम करता है (जादू)

पेपर का दावा है कि यह सरल ट्रिक एक साथ तीन अद्भुत चीजें करती है:

  • यह तेज़ है: चूंकि आप 56 बेकार शेफों को प्रशिक्षित नहीं कर रहे हैं, इसलिए पूरी प्रक्रिया लगभग 2x तेज़ चलती है। यह रसोई से उन लोगों को हटाने जैसा है जो खाना नहीं बना रहे हैं ताकि असली रसोइये तेज़ी से काम कर सकें।
  • यह सस्ता है: आपको बहुत कम जानकारी याद रखने की आवश्यकता है (कम पैरामीटर्स)। HELLoRA ने पुरानी विधि की तुलना में केवल लगभग 16% से 30% मेमोरी का उपयोग किया।
  • यह स्मार्ट है: "कोल्ड एक्सपर्ट्स" को अकेला छोड़कर, आप उनके मूल, प्री-ट्रेंड कौशल की रक्षा करते हैं। यह एक सुशी शेफ को बेकिंग का अभ्यास करने के लिए मजबूर न करने जैसा है, ताकि वे गलती से मछली काटना न भूल जाएं। यह वास्तव में AI को नए कार्य पर पुराने तरीकों की तुलना में बेहतर प्रदर्शन करने में मदद करता है।

"HELLoRI" अपग्रेड

लेखकों ने एक सुपर-लाइटवेट संस्करण भी बनाया है जिसे HELLoRI कहा जाता है। कल्पना कीजिए कि "हॉट एक्सपर्ट्स" के लिए भी, आप उन्हें उनके नोटपैड के केवल 10% पन्नों पर लिखने की अनुमति देते हैं। यह प्रशिक्षण लागत को लगभग शून्य (मूल आकार के 1% से भी कम) तक कम कर देता है और फिर भी AI को बहुत स्मार्ट बनाए रखता है।

परिणाम

टीम ने तीन अलग-अलग प्रकार की AI रसोई (OlMo-E, Mixtral, और DeepSeekMoE) और तीन अलग-अलग कार्यों (गणित, कोडिंग और सुरक्षा) पर इसका परीक्षण किया।

  • फैसला: HELLoRA ने लगातार पुराने तरीकों को हराया। यह तेज़ था, इसने कम मेमोरी का उपयोग किया, और गणित एवं कोडिंग परीक्षणों में उच्च स्कोर प्राप्त किया।
  • उपमा: यह एक पूरे स्टेडियम के लोगों को जगलिंग (juggle) सिखाने (उन लोगों पर समय बर्बाद करना जो कभी जगलिंग नहीं करेंगे) बनाम भीड़ में से उन 5 लोगों को खोजने और उन्हें मास्टरक्लास देने के बीच का अंतर है जो पहले से ही इसमें अच्छे हैं।

संक्षेप में: HELLoRA उन "कोल्ड" एक्सपर्ट्स को प्रशिक्षित करने में समय बर्बाद करना बंद कर देता है जो काम नहीं कर रहे हैं, अपनी पूरी ऊर्जा उन "हॉट" एक्सपर्ट्स पर केंद्रित करता है जो काम कर रहे हैं, और ऐसा करके AI को तेज़, सस्ता और स्मार्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →