← नवीनतम पेपर
💬 NLP

MesaNet: Sequence Modeling by Locally Optimal Test-Time Training

मूल लेखक: Johannes von Oswald, Nino Scherrer, Seijin Kobayashi, Luca Versari, Songlin Yang, Sarthak Mittal, Maximilian Schlegel, Kaitlin Maile, Yanick Schimpf, Oliver Sieberling, Alexander Meulemans, Rif A. Sau
प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Johannes von Oswald, Nino Scherrer, Seijin Kobayashi, Luca Versari, Songlin Yang, Sarthak Mittal, Maximilian Schlegel, Kaitlin Maile, Yanick Schimpf, Oliver Sieberling, Alexander Meulemans, Rif A. Saurous, Guillaume Lajoie, Charlotte Frenkel, Razvan Pascanu, Blaise Agüera y Arcas, João Sacramento

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MesaNet पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।

बड़ी तस्वीर: वर्तमान AI के साथ समस्या

कल्पना कीजिए कि एक बहुत ही बुद्धिमान लाइब्रेरियन (एक Transformer, जो AI का वर्तमान मानक है) आपके प्रश्न का उत्तर देने के लिए एक किताब पढ़ रहा है।

  • अच्छी बात: यह लाइब्रेरियन किताब की शुरुआत से अंत तक के विवरणों को याद रखने में अविश्वसनीय रूप से कुशल है।
  • बुरी बात: ऐसा करने के लिए, लाइब्रेरियन को अपनी मेज पर इंडेक्स कार्डों का एक बढ़ता हुआ ढेर रखना पड़ता है। जैसे-जैसे किताब लंबी होती है, ढेर ऊँचा होता जाता है। अंततः, वह ढेर इतना बड़ा हो जाता है कि वह पूरे कमरे में जगह घेर लेता है, और लाइब्रेरियन उत्तर खोजने के लिए उन सभी कार्डों को पलटने में घबरा जाता है। यह लंबे टेक्स्ट के लिए उन्हें धीमा और महंगा बना देता है।

हाल ही में, वैज्ञानिकों ने एक अलग प्रकार का लाइब्रेरियन बनाने की कोशिश की (जिसे RNNs कहा जाता है जैसे Mamba या DeltaNet)। ये लाइब्रेरियन केवल एक छोटा, निश्चित आकार का नोटपैड रखते हैं। वे तेज़ हैं और उन्हें बड़े कमरे की आवश्यकता नहीं होती। हालाँकि, वे कभी-कभी एक लंबी कहानी की शुरुआत को याद रखने में संघर्ष करते हैं, या जब कहानी बहुत जटिल हो जाती है तो गलतियाँ कर देते हैं।

समाधान: MesaNet का आगमन

इस पेपर के लेखकों ने एक नया लाइब्रेरियन बनाया जिसे MesaNet कहा जाता है। वे छोटे नोटपैड वाले लाइब्रेरियन की गति और बड़े ढेर वाले लाइब्रेरियन की मेमोरी शक्ति, दोनों चाहते थे।

ऐसा करने के लिए, उन्होंने एक विशेष उपकरण पेश किया जिसे Mesa Layer कहा जाता है।

उपमा: "इंस्टेंट एक्सपर्ट" बनाम "स्लो लर्नर"

कल्पना कीजिए कि आप अभी देखी गई संख्याओं की एक सूची के आधार पर एक गणित की समस्या हल करने की कोशिश कर रहे हैं।

  • पुराने RNNs (द स्लो लर्नर): हर बार जब एक नई संख्या आती है, तो लाइब्रेरियन एक छोटा सा अनुमान लगाता है, जाँच करता है कि क्या वह गलत था, और अपने नोटपैड को थोड़ा समायोजित करता है। वे यह काम स्टेप-बाय-स्टेप करते हैं। यह कुशल है, लेकिन वे तुरंत परफेक्ट उत्तर नहीं दे पाते क्योंकि वे केवल "अनुमान और समायोजन" कर रहे होते हैं।
  • MesaNet (द इंस्टेंट एक्सपर्ट): जब एक नई संख्या आती है, तो MesaNet लाइब्रेरियन केवल अनुमान नहीं लगाता। वे तुरंत एक सुपर-फास्ट मानसिक गणना चलाते हैं ताकि यह पता लगाया जा सके कि अब तक देखी गई हर एक संख्या के आधार पर अपने नोटपैड को समायोजित करने का परफेक्ट तरीका क्या है। वे यह सुनिश्चित करने के लिए कि उत्तर वर्तमान संदर्भ के लिए सबसे अच्छा फिट है, एक ही बार में पूरी ऑप्टिमाइज़ेशन समस्या को हल करते हैं।

यह कैसे काम करता है ("टेस्ट-टाइम ट्रेनिंग")

पेपर इसे "Test-Time Training" कहता है।

आमतौर पर, AI मॉडल एक कारखाने में एक बार प्रशिक्षित किए जाते हैं, और फिर वे बस चलते हैं। वे वास्तव में आपसे बात करते समय कुछ भी नया नहीं सीखते हैं।

  • MesaNet की ट्रिक: हर बार जब MesaNet एक नया शब्द पढ़ता है, तो वह उस सटीक क्षण के लिए अपनी आंतरिक मेमोरी को "री-ट्रेन" करने के लिए एक सेकंड के छोटे से हिस्से के लिए रुकता है। वह पूछता है: "अब तक मैंने जो कुछ भी पढ़ा है, उसे देखते हुए, इस जानकारी को स्टोर करने का सबसे अच्छा तरीका क्या है?"
  • लागत: यह "री-ट्रेनिंग" पुराने तरीकों की तुलना में थोड़ा अधिक कंप्यूटिंग पावर (जैसे एक त्वरित गणित सॉल्वर चलाना) लेती है।
  • लाभ: क्योंकि यह हर बार ऑप्टिमल उत्तर के लिए हल करता है, इसलिए यह लंबे, जटिल कहानों को पुराने "स्लो लर्नर" RNNs की तुलना में बहुत बेहतर समझता है।

"चंकी" नवाचार (The "Chunky" Innovation)

इस विचार का मूल संस्करण (पिछले पेपर से) प्रशिक्षण के दौरान बहुत धीमा था क्योंकि इसे ये गणनाएँ एक-एक करके करनी पड़ती थीं, जैसे एक समय में एक पन्ना पढ़ना।

  • नया मोड़: लेखकों ने इन गणनाओं को चंक्स (chunks) में करने का तरीका खोज निकाला। कल्पना कीजिए कि एक समय में एक पन्ना पढ़ने के बजाय, लाइब्रेरियन एक पूरा अध्याय पकड़ लेता है, शक्तिशाली कंप्यूटर चिप्स का उपयोग करके एक ही बार में पूरे अध्याय के लिए गणित हल करता है, और फिर आगे बढ़ जाता है। यह इसे भारी मात्रा में डेटा पर प्रशिक्षित करने के लिए पर्याप्त तेज़ बनाता है।

उन्होंने क्या पाया

टीम ने अरबों शब्दों के विशाल डेटासेट पर MesaNet का परीक्षण किया और इसकी तुलना Transformers और अन्य तेज़ RNNs से की।

  1. शुरुआत में बेहतर: MesaNet वाक्य या कहानी की शुरुआत को समझने में अद्भुत है। यह अक्सर पहले कुछ सौ शब्दों में विशाल Transformers को भी पीछे छोड़ देता है।
  2. लंबे संदर्भ (Long Contexts) में बेहतर: जबकि अन्य तेज़ RNNs कहानी लंबी होने पर भूलने या भ्रमित होने लगते हैं, MesaNet अपना आधार बहुत बेहतर तरीके से बनाए रखता है। यह लंबे दस्तावेज़ों को अपने साथियों की तुलना में अधिक सटीकता से समझ सकता है।
  3. समझौता (Trade-off): MesaNet "मुफ्त" नहीं है। यह उन गणितीय समस्याओं को हल करने के लिए पढ़ने की प्रक्रिया के दौरान अधिक कंप्यूटिंग पावर (FLOPs) का उपयोग करता है। हालाँकि, लेखकों ने पाया कि यह अतिरिक्त प्रयास बेहतर सटीकता के साथ काम आता है, विशेष रूप से लंबे संदर्भों की गहरी समझ वाले कार्यों पर।
  4. डायनेमिक स्पीड: सिस्टम स्मार्ट है कि उसे कब कड़ी मेहनत करनी है। यदि वाक्य सरल है, तो यह कम गणितीय स्टेप्स कर सकता है। यदि वाक्य जटिल है, तो यह अधिक स्टेप्स करता है। यह कार्य की कठिनाई के आधार पर अपनी मेहनत को डायनेमिक रूप से आवंटित करता है।

सारांश

MesaNet एक नए प्रकार का AI आर्किटेक्चर है जो एक ऐसे लाइब्रेरियन की तरह काम करता है जो पढ़ते समय कहानी को याद रखने के परफेक्ट तरीके की लगातार पुनर्गणना (re-calculate) करता है। "सबसे अच्छे संभव मेमोरी" को खोजने के लिए हर स्टेप पर एक जटिल गणितीय समस्या को हल करके, यह अन्य तेज़, मेमोरी-कुशल मॉडलों की तुलना में बेहतर समझ प्राप्त करता है, विशेष रूप से लंबे और जटिल टेक्स्ट के मामले में। यह बेहतर बुद्धिमत्ता के लिए थोड़े अतिरिक्त कंप्यूटिंग पावर का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →