← नवीनतम पेपर
🤖 AI

L3^3: Large Lookup Layers

यह शोध पत्र लार्ज लुकअप लेयर्स (L3^3) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो डिकोडर परतों के लिए स्थिर, टोकन-आधारित रूटिंग को सक्षम करने हेतु एम्बेडिंग टेबल्स का सामान्यीकरण करता है, जिससे मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडल्स का एक अधिक हार्डवेयर-कुशल और स्थिर विकल्प मिलता है और साथ ही भाषा मॉडलिंग एवं डाउनस्ट्रीम कार्यों में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Albert Tseng, Christopher De Sa

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Albert Tseng, Christopher De Sa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "लार्ज लुकअप लेयर्स" (L3) पेपर की व्याख्या सरल भाषा और रोज़मर्रा के उदाहरणों के साथ दी गई है।

बड़ी समस्या: AI में "ट्रैफिक जाम"

कल्पना कीजिए कि एक आधुनिक AI भाषा मॉडल एक विशाल, व्यस्त ऑफिस बिल्डिंग की तरह है। एक वाक्य लिखने के लिए, AI को हज़ारों शब्दों (टोकन्स) को प्रोसेस करना पड़ता है।

वर्तमान में, इन मॉडल्स को असंभव रूप से विशाल बनाए बिना उन्हें स्मार्ट बनाने का सबसे लोकप्रिय तरीका मिक्सचर-ऑफ़-एक्सपर्ट्स (MoE) कहलाता है। इसे एक विशाल ऑफिस की तरह समझें जहाँ, हर उस शब्द के लिए जिसे AI प्रोसेस करता है, एक "राउटर" को यह तय करना होता है कि विशेषज्ञों की कौन सी विशिष्ट टीम (कंप्यूटरों का एक छोटा समूह) उस शब्द को संभालेगी।

  • समस्या: यह राउटर एक ट्रैफिक पुलिसकर्मी की तरह है जिसे हर कार (शब्द) को रोकना पड़ता है, उसके गंतव्य को देखना पड़ता है, और यह तय करना पड़ता है कि उसे किस लेन में भेजना है। इसमें समय लगता है, ट्रैफिक जाम (हार्डवेयर अक्षमता) पैदा करता है, और कभी-कभी पुलिसकर्मी गलत निर्णय ले लेता है, जिससे एक लेन में बहुत अधिक कारें चली जाती हैं और दूसरी खाली रह जाती है। यातायात को सुचारू रूप से चलाने के लिए अतिरिक्त "ट्रेनिंग" की भी आवश्यकता होती है।

पुराना समाधान: डिक्शनरी (शब्दकोश)

दूसरी ओर, प्रत्येक AI के पास एक बुनियादी एम्बेडिंग टेबल (एक डिक्शनरी की तरह) होती है। जब AI "Apple" शब्द देखता है, तो वह बस डिक्शनरी में उसे ढूँढता है और उसकी परिभाषा ले लेता है।

  • अच्छी बात: यह अविश्वसनीय रूप से तेज़ है। किसी ट्रैफिक पुलिसकर्मी की ज़रूरत नहीं है।
  • बुरी बात: यह "मूर्ख" है। इसे संदर्भ (context) का पता नहीं होता। "Apple Pie" में "Apple" शब्द को "Apple Computer" वाले "Apple" जैसा ही सटीक अर्थ मिलता है। इसमें वाक्य की बारीकियों का अभाव होता है।

नया विचार: "स्मार्ट लाइब्रेरी" (L3)

इस पेपर के लेखकों ने लार्ज लुकअप लेयर्स (L3) पेश किया है। उन्होंने पूछा: क्या होगा यदि हम "डिक्शनरी" को इतना स्मार्ट बना सकें कि वह संदर्भ को समझ सके, लेकिन उसे एक साधारण लुकअप जितना ही तेज़ बनाए रखें?

कल्पना कीजिए कि AI के पास केवल एक डिक्शनरी नहीं है, बल्कि एक विशाल, सुपर-व्यवस्थित लाइब्रेरी है।

  1. स्टैटिक रूटिंग (कोई ट्रैफिक पुलिसकर्मी नहीं): पूरे वाक्य के आधार पर शब्द को कहाँ भेजना है, यह तय करने के लिए राउटर के बजाय, L3 सिस्टम स्वयं शब्द (जैसे, "Apple") को देखता है और तुरंत जान जाता है कि लाइब्रेरी में कौन सी अलमारियों पर जाना है। यह एक बारकोड स्कैनर होने जैसा है जो तुरंत बताता है, "गली 4, शेल्फ 2 पर जाएँ।" आपको सही किताबें खोजने के लिए वाक्य के संदर्भ के बारे में सोचने की ज़रूरत नहीं है; सिस्टम केवल शब्द की ID से ही स्थान को जान जाता है।
  2. कॉन्टेक्स्टुअल एग्रीगेशन (स्मार्ट रीडर): एक बार जब सिस्टम जान जाता है कि किन अलमारियों पर जाना है, तो वह उस शब्द से संबंधित किताबों (एम्बेडिंग्स) का एक सेट निकालता है। फिर, AI का वर्तमान "विचार" (हिडन स्टेट) एक पाठक की तरह कार्य करता है जो उन किताबों को तेज़ी से स्कैन करता है और उन विशिष्ट विवरणों को चुनता है जो वर्तमान वाक्य में फिट बैठते हैं।
    • उदाहरण: यदि शब्द "Apple" है, तो लाइब्रेरी "फल", "तकनीक" और "स्वास्थ्य" के बारे में किताबें निकाल सकती है। यदि वाक्य "पाई" (Pie) के बारे में है, तो AI का "रीडर" "फल" वाली किताब पर ध्यान केंद्रित करेगा और बाकी को अनदेखा कर देगा।

उन्होंने लाइब्रेरी को कैसे व्यवस्थित किया (एल्गोरिदम)

सबसे बड़ी चुनौती यह थी: हम यह कैसे तय करें कि हर एक शब्द के लिए शेल्फ पर कितनी किताबें रखी जाएँ?

  • यदि हम हर शब्द को किताबों की समान संख्या देते हैं, तो सामान्य शब्दों (जैसे "the") को बहुत कम किताबें मिलेंगी, और दुर्लभ शब्दों को बहुत अधिक।
  • लेखकों ने लाइब्रेरी को व्यवस्थित करने के लिए एक कंप्रेशन एल्गोरिदम (ZIP फाइलों की तरह काम करने वाला) का उपयोग किया।
    • रूपक: कल्पना कीजिए कि एक लाइब्रेरियन नोटिस करता है कि लोग दिन में लाखों बार "The" और "And" के बारे में पूछते हैं, लेकिन "Zephyr" के बारे में साल में केवल एक बार पूछते हैं। लाइब्रेरियन "The" के लिए एक विशाल, विस्तृत सेक्शन बनाता है (सैकड़ों किताबों के साथ) और "Zephyr" के लिए एक छोटा, एकल-किताब वाला सेक्शन बनाता है।
    • यह सुनिश्चित करता है कि सबसे सामान्य शब्दों के पास सबसे अधिक "ब्रेनपावर" उपलब्ध हो, जबकि दुर्लभ शब्द जगह बर्बाद न करें।

यह तेज़ और बेहतर क्यों है

पेपर का दावा है कि L3 वर्तमान "ट्रैफिक पुलिसकर्मी" विधि (MoE) को दो मुख्य कारणों से मात देता है:

  1. कोई सरप्राइज नहीं (हार्डवेयर के अनुकूल): MoE विधि में, कंप्यूटर को यह नहीं पता होता कि उसे किन विशेषज्ञों की आवश्यकता है जब तक कि वह वाक्य को प्रोसेस करने के बीच में न पहुँच जाए। यह कंप्यूटर को सभी विशेषज्ञों को तैयार रखने के लिए मजबूर करता है, जिससे मेमोरी बर्बाद होती है।

    • L3 का लाभ: क्योंकि शब्द टाइप होते ही "शेल्फ लोकेशन" ज्ञात होती है, इसलिए कंप्यूटर पिछले शब्द के बारे में सोच ही रहा होता है, तभी वह सही किताबें भी निकाल सकता है। यह एक शेफ की तरह है जो वर्तमान व्यंजन पकते समय अगले व्यंजन के लिए सामग्री तैयार कर रहा है। यह उन्हें "लाइब्रेरी" को सस्ते, धीमे हार्ड ड्राइव (CPU) पर स्टोर करने और अंतिम सेकंड में केवल आवश्यक छोटे हिस्से को तेज़ प्रोसेसर (GPU) पर लाने की अनुमति देता है।
  2. बेहतर प्रदर्शन: जब उन्होंने 2.6 बिलियन सक्रिय पैरामीटर्स तक के मॉडल्स पर इसका परीक्षण किया, तो L3 मॉडल्स ने मानक "डेंस" मॉडल्स और वर्तमान "MoE" मॉडल्स दोनों की तुलना में बेहतर वाक्य लिखे और भाषा को बेहतर ढंग से समझा, और वह भी कम कंप्यूटिंग पावर का उपयोग करते हुए।

सारांश

यह पेपर AI बनाने का एक नया तरीका पेश करता है जो एक स्मार्ट, प्री-सॉर्टेड लाइब्रेरी की तरह काम करता है।

  • यह शब्द देखते ही जानकारी कहाँ ढूँढनी है, यह जानकर वर्तमान AI के "ट्रैफिक जाम" से बचता है।
  • यह एक स्मार्ट फाइलिंग सिस्टम (शब्दों के बार-बार आने की आवृत्ति पर आधारित) का उपयोग करता है ताकि सामान्य शब्दों को सबसे अधिक ध्यान मिले।
  • यह AI को बिना धीमा किए विशाल और स्मार्ट होने की अनुमति देता है, क्योंकि यह डेटा के इंतज़ार में अटके बिना अपनी मेमोरी को सस्ते स्टोरेज पर "ऑफलोड" कर सकता है।

संक्षेप में: L3 AI को एक विशाल, संदर्भ-जागरूक मेमोरी बैंक देता है जो एक साधारण डिक्शनरी की तरह एक्सेस करने में तेज़ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →