← नवीनतम पेपर
🤖 machine learning

Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models

यह शोध पत्र टोप्लिट्ज़ एमएलपी मिक्सर (TMM) को प्रस्तुत करता है, जो एक ट्रांसफॉर्मर-समान आर्किटेक्चर है जो अन्य सब-क्वाड्रेटिक मॉडलों की तुलना में बेहतर प्रशिक्षण दक्षता, सूचना प्रतिधारण और इन-कॉन्टेक्स्ट लर्निंग प्रदर्शन प्रदर्शित करते हुए, सब-क्वाड्रेटिक जटिलता प्राप्त करने के लिए अटेंशन को त्रिकोणीय-मास्क्ड टोप्लिट्ज़ मैट्रिक्स गुणन से बदल देता है।

मूल लेखक: Benjamin L. Badger, Ethan Roland

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benjamin L. Badger, Ethan Roland

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

बड़ी समस्या: "लाइब्रेरी ऑफ बाबेल" की बाधा (The "Library of Babel" Bottleneck)

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन हर बार नया वाक्य जोड़ने के लिए आपको अपनी पूरी कहानी पहले शब्द से दोबारा पढ़नी पड़ती है। यदि आपकी कहानी छोटी है, तो यह आसान है। लेकिन अगर आपकी कहानी एक पूरा उपन्यास है, तो हर नए शब्द के लिए इसे दोबारा पढ़ना बहुत समय लेने वाला काम है।

यह बिल्कुल वर्तमान के शीर्ष-स्तरीय AI मॉडल्स (जिन्हें Transformers कहा जाता है) के साथ होने वाली समस्या है। वे "अटेंशन" (attention) नामक एक तंत्र का उपयोग करते हैं जो उन्हें अगला शब्द तय करने के लिए पिछले हर शब्द को देखने की अनुमति देता है। हालांकि यह शक्तिशाली है, लेकिन जैसे-जैसे टेक्स्ट लंबा होता जाता है, यह अविश्वसनीय रूप से धीमा और मेमोरी-गहन (memory-hungry) होता जाता है। यह एक ऐसी लाइब्रेरी में एक विशिष्ट पुस्तक खोजने जैसा है जहाँ आपको एक पुस्तक चुनने से पहले हर शेल्फ पर मौजूद हर एक किताब को चेक करना पड़ता है।

नया समाधान: "टोप्लिट्ज़ मिक्सर" (The "Toeplitz Mixer")

लेखक एक नया मॉडल पेश करते हैं जिसे Toeplitz MLP Mixer (TMM) कहा जाता है। इसे उस लाइब्रेरी को व्यवस्थित करने का एक नया तरीका समझें।

हर किताब को व्यक्तिगत रूप से चेक करने के बजाय, TMM जानकारी को व्यवस्थित करने के लिए एक विशेष, दोहराते रहने वाले पैटर्न (गणितीय रूप से जिसे Toeplitz matrix कहा जाता है) का उपयोग करता है।

  • उपमा (Analogy): एक कारखाने में कन्वेयर बेल्ट की कल्पना करें। एक मानक मॉडल में, एक कर्मचारी को एक विशिष्ट भाग लेने के लिए पूरी लाइन में नीचे तक जाना पड़ता है। TMM में, हिस्से एक दोहराते हुए, अनुमानित पैटर्न में व्यवस्थित होते हैं। कर्मचारी एक शॉर्टकट (एक गणितीय ट्रिक जिसे Fast Fourier Transform कहा जाता है) का उपयोग करके तुरंत वही प्राप्त कर सकता है जिसकी उसे आवश्यकता है, चाहे लाइन कितनी भी लंबी क्यों न हो।
  • परिणाम: यह मॉडल को बहुत तेज़ बनाता है और कम मेमोरी का उपयोग करता है, विशेष रूप से जब यह पहली बार किसी लंबे प्रॉम्प्ट (जैसे कोई दस्तावेज़ भरने के दौरान) को पढ़ रहा हो।

आश्चर्य: गति का अर्थ "मूर्खता" नहीं है (Speed Doesn't Mean "Dumb")

आमतौर पर, जब आप डेटा को देखने के तरीके को सरल बनाकर किसी कंप्यूटर मॉडल को तेज़ बनाते हैं, तो वह "मूर्ख" हो जाता है। वह चीजें भूलने लगता है।

  • "स्टेट स्पेस" (State Space) मॉडल्स: अन्य तेज़ मॉडल (जैसे Mamba) कुशल होने के लिए अब तक पढ़े गए सब कुछ का एक एकल "सारांश" (summary) रखने की कोशिश करते हैं। यह एक 500 पन्नों की किताब को केवल उसकी अंतिम पंक्ति याद रखकर याद रखने की कोशिश करने जैसा है। यह तेज़ है, लेकिन मॉडल अक्सर विवरण भूल जाता है।
  • TMM का लाभ: TMM एक एकल सारांश पर निर्भर नहीं है। यह पूरे टेक्स्ट के "पैटर्न" को सुलभ रखता है।
    • कॉपी टेस्ट: लेखकों ने इस परीक्षण के माध्यम से इसकी जांच की कि क्या मॉडल संख्याओं या शब्दों की एक लंबी सूची को कॉपी कर सकता है।
    • परिणाम: जबकि "सारांश" वाले मॉडल्स (Mamba) सूची को याद रखने में संघर्ष कर रहे थे, TMM इसे लगभग पूरी तरह से कॉपी कर सका, ठीक वैसे ही जैसे भारी-भरकम Transformers करते हैं। इसने अन्य तेज़ मॉडल्स की तुलना में जानकारी को बहुत बेहतर तरीके से बनाए रखा।

यह कैसे काम करता है? ("No Biases" थ्योरी)

पेपर सुझाव देता है कि अन्य तेज़ मॉडल्स में अंतर्निहित "बायस" (biases) या आदतें होती हैं। उदाहरण के लिए, उन्हें सबसे हालिया शब्दों पर अधिक ध्यान देने और पुराने शब्दों को अनदेखा करने के लिए प्रोग्राम किया जा सकता है।

  • उपमा: एक ऐसे छात्र की कल्पना करें जो केवल पाठ्यपुस्तक के अंतिम अध्याय का अध्ययन करता है क्योंकि उसे लगता है कि वही सबसे महत्वपूर्ण है। वह अंतिम अध्याय पर क्विज़ पास कर सकता है लेकिन यदि शुरुआत के बारे में पूछा जाए तो असफल हो सकता है।
  • TMM: TMM में यह बायस नहीं है। यह टेक्स्ट के पैटर्न के साथ समान व्यवहार करता है। क्योंकि यह खुद को पुरानी जानकारी भूलने के लिए मजबूर नहीं करता है, यह स्वाभाविक रूप से अधिक विवरण रखता है, जिससे लंबे दस्तावेज़ में विशिष्ट तथ्यों को खोजने या जटिल निर्देशों का पालन करने जैसे कार्यों में बेहतर प्रदर्शन होता है।

"इनवर्टेबिलिटी" का जादू (The "Magic" of Invertibility)

लेखकों ने गहरे गणितीय विश्लेषण (जिसे operator index theory कहा जाता है) का उपयोग किया और एक विरोधाभासी तथ्य पाया:

  • भले ही TMM को इस तरह से जानकारी को प्रोसेस करने के लिए डिज़ाइन किया गया है कि कुछ विवरण खो जाने चाहिए (क्योंकि यह एक "कॉज़ल" मॉडल है जो केवल आगे देखता है), गणित दिखाता है कि इसकी आंतरिक परतें वास्तव में रिवर्सिबल (reversible) होने के बहुत करीब हैं।
  • उपमा: एक ऐसी मशीन की कल्पना करें जो कागज को फाड़ देती है। आमतौर पर, आप कागज वापस नहीं पा सकते। लेकिन TMM एक ऐसे श्रेडर (shredder) की तरह है जो कागज को ऐसी पट्टियों में काटता है जो अभी भी पूरी तरह से संरेखित (aligned) हैं। यदि आपके पास सही उपकरण है, तो आप उन्हें लगभग पूरी तरह से वापस जोड़ सकते हैं। यह सुझाव देता है कि मॉडल मूल जानकारी के "आकार" को बहुत अच्छी तरह से थामे रखता है, भले ही वह उसे प्रोसेस कर रहा हो।

कमी (सीमाएं)

पेपर इस बात के बारे में ईमानदार है कि TMM अभी क्या नहीं कर सकता:

  1. स्केल (Scale): उन्होंने अपेक्षाकृत छोटे मॉडल्स (20 से 300 मिलियन पैरामीटर्स) का परीक्षण किया। हमें अभी तक पता नहीं है कि क्या यह उन विशाल मॉडल्स के लिए भी काम करता है जिनका उपयोग आज बड़ी टेक कंपनियाँ करती हैं।
  2. एक-एक शब्द बनाना (Generating One Word at a Time): जबकि TMM एक लंबे प्रॉम्प्ट को पढ़ने में (प्रीफिल चरण में) सुपर फास्ट है, एक बार जब यह एक-एक शब्द बनाना शुरू करता है, तो यह पुराने Transformers की समान गति पर धीमा हो जाता है। यह शुरुआत में तेज़ है, लेकिन ज़रूरी नहीं कि यह फिनिश लाइन पर भी तेज़ हो।

सारांश

Toeplitz MLP Mixer एक नए प्रकार का AI आर्किटेक्चर है जो लंबे टेक्स्ट को तेज़ी से पढ़ने के लिए एक चतुर गणितीय शॉर्टकट का उपयोग करता है बिना विवरणों को भूले। यह साबित करता है कि आपको "मेमोरी" को पाने के लिए "गति" का त्याग करने की आवश्यकता नहीं है। यह एक ऐसे लाइब्रेरियन की तरह कार्य करता है जो किताबों को तुरंत खोजने के लिए एक स्मार्ट फाइलिंग सिस्टम का उपयोग करता है, बजाय इसके कि वह पूरी लाइब्रेरी को अपने दिमाग में याद रखने की कोशिश करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →