← नवीनतम पेपर
💬 NLP

MrRoPE: Mixed-radix Rotary Position Embedding

यह शोध पत्र MrRoPE को प्रस्तुत करता है, जो मिश्रित-आधार (mixed-radix) रूपांतरण पर आधारित एक एकीकृत सैद्धांतिक ढांचा है जो रोटरी पोजीशन एम्बेडिंग (RoPE) विस्तारों का सामान्यीकरण करता है और MrRoPE-Pro जैसी नवीन रणनीतियों के माध्यम से प्रभावी प्रशिक्षण-मुक्त दीर्घ-संदर्भ हैंडलिंग को सक्षम बनाता है, जो दीर्घ-अनुक्रम पुनर्प्राप्ति कार्यों में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Qingyuan Tian, Wenhong Zhu, Xiaoran Liu, Xiaofeng Wang, Rui Wang

प्रकाशित 2026-02-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingyuan Tian, Wenhong Zhu, Xiaoran Liu, Xiaofeng Wang, Rui Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) है, जिसने बात करना सीखने के लिए किताबों का एक विशाल पुस्तकालय पढ़ा है। लेकिन इसमें एक पेंच है: इसके प्रशिक्षण (training) के दौरान, इसे केवल छोटी कहानियाँ पढ़ने की अनुमति दी गई थी, शायद 8,000 शब्दों की। अब, आप चाहते हैं कि यह एक पूरा उपन्यास (128,000 शब्द) पढ़े और उस पर आधारित सवालों के जवाब दे।

समस्या यह है कि रोबोट के पास यह ट्रैक रखने का एक विशिष्ट तरीका है कि वह टेक्स्ट में कहाँ है, जिसे RoPE (रोटरी पोजीशन एम्बेडिंग) कहा जाता है। RoPE को अपने दिमाग के अंदर एक विशाल, मल्टी-स्पीड घड़ी की तरह समझें।

  • कुछ सुइयाँ बहुत तेज़ी से घूमती हैं (उच्च आयाम/high dimensions)।
  • कुछ सुइयाँ बहुत धीरे घूमती हैं (निम्न आयाम/low dimensions)।

जब रोबोट एक छोटी कहानी पढ़ता है, तो तेज़ सुइयाँ कई बार घूम जाती हैं, और धीमी सुइयाँ बस थोड़ा सा घूमती हैं। रोबोट इन पैटर्न को पहचानना सीख जाता है। लेकिन जब आप अचानक इसे एक उपन्यास देते हैं जो इसके द्वारा सीखे गए टेक्स्ट से 16 गुना लंबा है, तो धीमी सुइयों को अब पहले से कहीं अधिक घूमना पड़ेगा। वे भ्रम की एक "दीवार" से टकरा जाते हैं क्योंकि रोबमेय ने पहले कभी उन स्थितियों को नहीं देखा है। यह बिल्कुल वैसा ही है जैसे किसी व्यक्ति को, जो केवल 10 तक गिनना जानता हो, अचानक बिना किसी नए निर्देश के 1,000 तक गिनने के लिए कहना—वह खो जाएगा।

पुराने समाधान (The "Stretchy" Approaches)

वैज्ञानिकों ने घड़ी को खींचने (stretch करने) की कोशिश की।

  • NTK: उन्होंने पूरी घड़ी के चेहरे को समान रूप से खींच दिया। इससे मदद मिली, लेकिन इसने तेज़ घूमने वाली सुइयों (जो छोटे विवरणों के लिए अच्छी होती हैं) को बहुत अजीब तरीके से घुमा दिया, जिससे छोटी वाक्यों को समझने की रोबोट की क्षमता बिगड़ गई।
  • YaRN: यह वर्तमान चैंपियन था। इसने स्मार्ट होने की कोशिश की: इसने तेज़ सुइयों को लगभग वैसा ही रखा, धीमी सुइयों को बहुत अधिक खींचा, और उनके बीच की सुइयों के लिए एक "मध्यम मार्ग" (middle ground) का उपयोग किया। यह अच्छा काम करता था, लेकिन इस पेपर के लेखकों को लगा कि "मध्यम मार्ग" एकदम सही नहीं था। यह एक रबर बैंड को असमान रूप से खींचने जैसा था, जिससे उसके कुछ हिस्से टूट सकते थे या अपना आकार खो सकते थे।

नया समाधान: MrRoPE (The "Mixed-Radix" Clock)

लेखकों, किंगयुआन टियान और उनकी टीम ने महसूस किया कि RoPE वास्तव में संख्याओं को अलग-अलग आधारों (bases) के बीच बदलने (जैसे दशमलव से बाइनरी में बदलना) के समान कार्य कर रहा है। उन्होंने इसे "रेडिक्स थ्योरी" (Radix Theory) कहा।

उन्होंने एक नया तरीका प्रस्तावित किया जिसे MrRoPE (मिक्स्ड-रेडिक्स RoPE) कहा गया। केवल घड़ी को खींचने के बजाय, उन्होंने घड़ी की सुइयों के चलने के नियमों को उनकी गति के आधार पर बदल दिया।

उन्होंने घड़ी को ठीक करने के दो नए तरीके पेश किए:

  1. MrRoPE-Uni: बीच की सुइयों के लिए एक समान खिंचाव (uniform stretch)।
  2. MrRoPE-Pro (विजेता): एक "प्रोग्रेसिव" (प्रगतिशील) खिंचाव।

MrRoPE-Pro का रूपक (Analogy):
कल्पना कीजिए कि घड़ी की सुइयाँ धावकों की एक टीम हैं।

  • तेज़ धावक (उच्च आयाम) स्प्रिंटर (sprinters) हैं। आप उन्हें धीमा नहीं करना चाहते या उनकी चाल को बहुत अधिक नहीं बदलना चाहते क्योंकि वे छोटी दौड़ के लिए बेहतरीन होते हैं।
  • धीमे धावक (निम्न आयाम) मैराथन धावक हैं। अब उन्हें बहुत दूर जाना है, इसलिए आप उन्हें एक बड़ा कदम (stride) देते हैं।
  • बीच के धावक सबसे पेचीदा हिस्सा हैं।

पिछले तरीकों (जैसे Yaarn) ने बीच के धावकों के साथ एक "रिग्रेसिव" (regressive) रणनीति अपनाई—एक तरह से उन्हें थोड़ा धीमा करना जैसे-जैसे वे आगे बढ़ते हैं।
MrRoPE-Pro एक "प्रोग्रेसिव" रणनीति का उपयोग करता है। यह जैसे-जैसे वे आगे बढ़ते हैं, बीच के धावकों के कदम की लंबाई को धीरे-धीरे बढ़ाता जाता है। यह स्प्रिंटर्स की लय को एकदम सही रखता है जबकि यह सुनिश्चित करता है कि मैराथन धावक चक्कर खाए बिना फिनिश लाइन तक पहुँच सकें। यह उन्हें एक कोमल, त्वरित बढ़ावा देने जैसा है।

जब उन्होंने इसका परीक्षण किया तो क्या हुआ?

टीम ने कई चुनौतियों पर इस नए "प्रोग्रेसिव क्लॉक" का परीक्षण किया:

  1. "नीडल इन अ हेस्टैक" (Needle in a Haystack) टेस्ट: उन्होंने एक विशाल किताब (हेस्टैक) के अंदर एक विशिष्ट वाक्य (सुई/needle) छिपा दिया और रोबोट को उसे खोजने के लिए कहा।

    • परिणाम: MrRoPE-Pro 128,000 शब्दों तक की किताबों में से सुई को 85% से अधिक सटीकता के साथ खोज सका। YaRN 64,000 शब्दों के बाद बुरी तरह विफल होने लगा। यह ऐसा था जैसे MrRoPE-Pro के पास एक सुपर-शार्प टॉर्चलाइट थी, जबकि YaRN की टॉर्च अंधेरे में टिमटिमाने लगी थी।
  2. "इनफिनिट-बेंच" (Infinite-Bench) टेस्ट: इसने यह परीक्षण किया कि क्या रोबोट वास्तव में उस जानकारी का उपयोग करके सवालों के जवाब दे सकता है या बातचीत कर सकता है।

    • परिणाम: MrRoPE-Pro ने न केवल सुई को ढूँढा; बल्कि इसने कहानी को समझा भी। इसने YaRN को भारी अंतर से पीछे छोड़ दिया (कभी-कभी दोगुना स्कोर) और अन्य रोबोट्स के बराबर या उनसे बेहतर प्रदर्शन किया जिन्हें लंबी किताबों के लिए विशेष रूप से प्रशिक्षित (fine-tuned) किया गया था। सबसे अच्छी बात? MrRoPE-Pro को किसी पुन: प्रशिक्षण (retraining) की आवश्यकता नहीं थी। यह गणित के नियमों को बदलकर तुरंत काम करने लगा।

निष्कर्ष (The Bottom Line)

पेपर का दावा है कि रोबोट के स्थिति-ट्रैकिंग सिस्टम को "नंबर बेस कन्वर्जन" के नजरिए से देखकर, उन्होंने इसकी घड़ी को खींचने का एक बेहतर तरीका खोज लिया है। MrRoPE-Pro एक "ट्रेन शॉर्ट, टेस्ट लॉन्ग" (कम में सीखो, ज्यादा में टेस्ट करो) वाला जादू है: आप एक रोबोट को छोटी टेक्स्ट पर प्रशिक्षित कर सकते हैं, और फिर बिना किसी अतिरिक्त लर्निंग के, केवल इस नए प्रोग्रेसिव स्ट्रेचिंग नियम को लागू करके, उसे विशाल उपन्यास पढ़ने और समझने के लिए तुरंत उपयोग कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →