← नवीनतम पेपर
🤖 AI

EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs

EntropyMoE एक एंट्रॉपी-अवेयर मिक्स्चर-ऑफ-एक्सपर्ट्स आर्किटेक्चर पेश करता है जो टोकनाइज़र-मुक्त लार्ज लैंग्वेज मॉडल्स के लिए है, जो उनके एंट्रॉपी और लंबाई के आधार पर बाइट-लेवल पैचेस को विशिष्ट विशेषज्ञों (एक्सपर्ट्स) में गतिशील रूप से रूट करता है, जिससे फिक्स्ड टोकनाइज़र पर निर्भर रहे बिना बेहतर संपीड़न दक्षता (कंप्रेशन एफिशिएंसी) और तुलनीय सटीकता प्राप्त होती है।

मूल लेखक: Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang

प्रकाशित 2026-08-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पढ़ना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, ऐसा करने का सबसे अच्छा तरीका हर वाक्य को पहले से बने "टुकड़ों" में तोड़ना था जिन्हें टोकन कहा जाता है, जैसे पिज्जा को परोसने से पहले निश्चित स्लाइस में काट देना। लेकिन क्या होगा यदि रोबोट कच्चे माल यानी अक्षरों या बाइट्स को पढ़ सके? यह "टोकेनाइज़र-फ्री" (tokenizer-free) मॉडल्स की दुनिया है। वे उन शेफ की तरह हैं जो पहले से कटे हुए अवयवों का उपयोग नहीं करते बल्कि पूरे सब्जी को संभालते हैं, और यह तय करते हैं कि बनावट की जटिलता के आधार पर कितना बड़ा टुकड़ा लेना है। यदि सब्जी सख्त (अनिश्चित) है, तो वे एक छोटा टुकड़ा लेते हैं; यदि वह नरम (अनुमानित) है, तो वे एक बड़ा टुकड़ा लेते हैं। यह पढ़ने की प्रक्रिया को बहुत अधिक लचीला बनाता है।

हालाँकि, इसमें एक पेंच है। भले ही रोबोट टेक्स्ट को अलग-अलग आकार के टुकड़ों में काटने में सक्षम है, फिर भी वे कटिंग बोर्ड पर आने के बाद हर एक टुकड़े के साथ बिल्कुल एक जैसा व्यवहार करते हैं। वे एक साधारण, उबाऊ शब्द को प्रोसेस करने के लिए उतनी ही दिमागी शक्ति का उपयोग करते हैं जितना कि एक जटिल, भ्रमित करने वाले शब्द के लिए। यह 100 जीनियसों की एक टीम को हायर करने जैसा है जो गणित की समस्या को हल करने के लिए काम पर रखते हैं, लेकिन उन सभी 100 को हर समस्या पर काम करने के लिए मजबूर करते हैं, चाहे वह "2+2" हो या "क्वांटम फिजिक्स"। यह ऊर्जा की भारी बर्बादी है। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: क्या हम रोबोट को स्मार्ट बना सकते हैं ताकि वह आसान चीजों पर समय बर्बाद किए बिना, सही काम के लिए सही विशेषज्ञों को ही बुलाए?

यही वह चीज़ है जिसे पेपर "EntropyMoE" हल करता है। शोधकर्ताओं ने एक नया सिस्टम बनाया है जिसे EntropyMoE कहा जाता है, जो AI विशेषज्ञों की एक टीम के लिए एक सुपर-कुशल मैनेजर की तरह काम करता है। टेक्स्ट के पूरे, जटिल अर्थ को देखने के बजाय, यह मैनेजर केवल एक सरल संख्या देखता है: एन्ट्रॉपी (entropy)। रोजमर्रा की भाषा में, यहाँ एन्ट्रॉपी "आश्चर्य" या "अनिश्चितता" का एक माप है। यदि टेक्स्ट का एक हिस्सा बहुत अनुमानित (कम एन्ट्रॉपी) है, तो मैनेजर जानता है कि यह आसान है। यदि यह आश्चर्यों (उच्च एन्ट्रॉपी) से भरा है, तो यह कठिन है।

जादू तब होता है जब मैनेजर प्रत्येक टेक्स्ट चंक को संभालने के लिए आठ विशेषज्ञों की टीम में से ठीक दो विशेषज्ञों को चुनने के लिए इस "सरप्राइज स्कोर" का उपयोग करता है। सबसे अच्छी बात? मैनेजर को यह निर्णय लेने के लिए पूरे टेक्स्ट को पढ़ने की आवश्यकता नहीं है; उसे बस उस एक "सरप्राइज" नंबर की आवश्यकता है। यह एक क्लब के बाउंसर की तरह है जिसे यह तय करने के लिए कि आपको अंदर आने देना है या नहीं, केवल आपके आईडी देखने की आवश्यकता है, न कि आपकी पूरी जीवन कहानी के बारे में इंटरव्यू लेने की। ऐसा करके, सिस्टम कंप्यूटर मेमोरी और प्रोसेसिंग पावर की भारी बचत करता है। अपने परीक्षणों में, EntropyMoE सिस्टम ने इन रूटिंग निर्णयों को लेने के लिए केवल 400 सूक्ष्म पैरामीटर्स का उपयोग किया, जबकि पुराने तरीके को वही काम करने के लिए 400,000 से अधिक पैरामीटर्स की आवश्यकता थी।

परिणाम प्रभावशाली थे। जब उन्होंने इस नए सिस्टम का पुराने "डेंस" मॉडल्स (जहाँ हर कोई हर चीज़ पर काम करता है) और अन्य स्मार्ट-रूटिंग मॉडल्स के खिलाफ परीक्षण किया, तो EntropyMoE टेक्स्ट के अगले बाइट की भविष्यवाणी करने में सबसे सटीक साबित हुआ। इसने "बिट्स पर बाइट" (bits per byte) में मापा गया सबसे कम गलतियाँ कीं। हालाँकि इसने हर एक खेल में (जैसे हेलास्वैग (HellaSwag) नामक एक विशिष्ट ट्रिविया क्विज़ जहाँ इसने थोड़ा बेहतर प्रदर्शन किया) प्रतिस्पर्धा को पूरी तरह से नहीं कुचला, लेकिन इसने साबित कर दिया कि "सरप्राइज" का उपयोग करना एक जीतने वाली रणनीति है। पेपर सुझाव देता है कि यह दृष्टिकोण स्मार्ट AI बनाने का एक ठोस, कुशल तरीका है, हालांकि शोधकर्ता स्वीकार करते हैं कि वर्तमान संस्करण पुराने, सरल मॉडल्स की तुलना में चलने में थोड़ा धीमा है क्योंकि "एक्सपर्ट स्विचिंग" में थोड़ा अतिरिक्त समय लगता है। अंततः, उन्होंने दिखाया है कि आपको यह तय करने के लिए कि काम कौन करेगा, एक सुपर-जटिल दिमाग की आवश्यकता नहीं है; कभी-कभी, टेक्स्ट कितना आश्चर्यजनक है इसका एक सरल माप ही विशेषज्ञों की टीम को व्यवस्थित करने के लिए पर्याप्त होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →