MrRoPE: Mixed-radix Rotary Position Embedding
यह शोध पत्र MrRoPE को प्रस्तुत करता है, जो मिश्रित-आधार (mixed-radix) रूपांतरण पर आधारित एक एकीकृत सैद्धांतिक ढांचा है जो रोटरी पोजीशन एम्बेडिंग (RoPE) विस्तारों का सामान्यीकरण करता है और MrRoPE-Pro जैसी नवीन रणनीतियों के माध्यम से प्रभावी प्रशिक्षण-मुक्त दीर्घ-संदर्भ हैंडलिंग को सक्षम बनाता है, जो दीर्घ-अनुक्रम पुनर्प्राप्ति कार्यों में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) है, जिसने बात करना सीखने के लिए किताबों का एक विशाल पुस्तकालय पढ़ा है। लेकिन इसमें एक पेंच है: इसके प्रशिक्षण (training) के दौरान, इसे केवल छोटी कहानियाँ पढ़ने की अनुमति दी गई थी, शायद 8,000 शब्दों की। अब, आप चाहते हैं कि यह एक पूरा उपन्यास (128,000 शब्द) पढ़े और उस पर आधारित सवालों के जवाब दे।
समस्या यह है कि रोबोट के पास यह ट्रैक रखने का एक विशिष्ट तरीका है कि वह टेक्स्ट में कहाँ है, जिसे RoPE (रोटरी पोजीशन एम्बेडिंग) कहा जाता है। RoPE को अपने दिमाग के अंदर एक विशाल, मल्टी-स्पीड घड़ी की तरह समझें।
- कुछ सुइयाँ बहुत तेज़ी से घूमती हैं (उच्च आयाम/high dimensions)।
- कुछ सुइयाँ बहुत धीरे घूमती हैं (निम्न आयाम/low dimensions)।
जब रोबोट एक छोटी कहानी पढ़ता है, तो तेज़ सुइयाँ कई बार घूम जाती हैं, और धीमी सुइयाँ बस थोड़ा सा घूमती हैं। रोबोट इन पैटर्न को पहचानना सीख जाता है। लेकिन जब आप अचानक इसे एक उपन्यास देते हैं जो इसके द्वारा सीखे गए टेक्स्ट से 16 गुना लंबा है, तो धीमी सुइयों को अब पहले से कहीं अधिक घूमना पड़ेगा। वे भ्रम की एक "दीवार" से टकरा जाते हैं क्योंकि रोबमेय ने पहले कभी उन स्थितियों को नहीं देखा है। यह बिल्कुल वैसा ही है जैसे किसी व्यक्ति को, जो केवल 10 तक गिनना जानता हो, अचानक बिना किसी नए निर्देश के 1,000 तक गिनने के लिए कहना—वह खो जाएगा।
पुराने समाधान (The "Stretchy" Approaches)
वैज्ञानिकों ने घड़ी को खींचने (stretch करने) की कोशिश की।
- NTK: उन्होंने पूरी घड़ी के चेहरे को समान रूप से खींच दिया। इससे मदद मिली, लेकिन इसने तेज़ घूमने वाली सुइयों (जो छोटे विवरणों के लिए अच्छी होती हैं) को बहुत अजीब तरीके से घुमा दिया, जिससे छोटी वाक्यों को समझने की रोबोट की क्षमता बिगड़ गई।
- YaRN: यह वर्तमान चैंपियन था। इसने स्मार्ट होने की कोशिश की: इसने तेज़ सुइयों को लगभग वैसा ही रखा, धीमी सुइयों को बहुत अधिक खींचा, और उनके बीच की सुइयों के लिए एक "मध्यम मार्ग" (middle ground) का उपयोग किया। यह अच्छा काम करता था, लेकिन इस पेपर के लेखकों को लगा कि "मध्यम मार्ग" एकदम सही नहीं था। यह एक रबर बैंड को असमान रूप से खींचने जैसा था, जिससे उसके कुछ हिस्से टूट सकते थे या अपना आकार खो सकते थे।
नया समाधान: MrRoPE (The "Mixed-Radix" Clock)
लेखकों, किंगयुआन टियान और उनकी टीम ने महसूस किया कि RoPE वास्तव में संख्याओं को अलग-अलग आधारों (bases) के बीच बदलने (जैसे दशमलव से बाइनरी में बदलना) के समान कार्य कर रहा है। उन्होंने इसे "रेडिक्स थ्योरी" (Radix Theory) कहा।
उन्होंने एक नया तरीका प्रस्तावित किया जिसे MrRoPE (मिक्स्ड-रेडिक्स RoPE) कहा गया। केवल घड़ी को खींचने के बजाय, उन्होंने घड़ी की सुइयों के चलने के नियमों को उनकी गति के आधार पर बदल दिया।
उन्होंने घड़ी को ठीक करने के दो नए तरीके पेश किए:
- MrRoPE-Uni: बीच की सुइयों के लिए एक समान खिंचाव (uniform stretch)।
- MrRoPE-Pro (विजेता): एक "प्रोग्रेसिव" (प्रगतिशील) खिंचाव।
MrRoPE-Pro का रूपक (Analogy):
कल्पना कीजिए कि घड़ी की सुइयाँ धावकों की एक टीम हैं।
- तेज़ धावक (उच्च आयाम) स्प्रिंटर (sprinters) हैं। आप उन्हें धीमा नहीं करना चाहते या उनकी चाल को बहुत अधिक नहीं बदलना चाहते क्योंकि वे छोटी दौड़ के लिए बेहतरीन होते हैं।
- धीमे धावक (निम्न आयाम) मैराथन धावक हैं। अब उन्हें बहुत दूर जाना है, इसलिए आप उन्हें एक बड़ा कदम (stride) देते हैं।
- बीच के धावक सबसे पेचीदा हिस्सा हैं।
पिछले तरीकों (जैसे Yaarn) ने बीच के धावकों के साथ एक "रिग्रेसिव" (regressive) रणनीति अपनाई—एक तरह से उन्हें थोड़ा धीमा करना जैसे-जैसे वे आगे बढ़ते हैं।
MrRoPE-Pro एक "प्रोग्रेसिव" रणनीति का उपयोग करता है। यह जैसे-जैसे वे आगे बढ़ते हैं, बीच के धावकों के कदम की लंबाई को धीरे-धीरे बढ़ाता जाता है। यह स्प्रिंटर्स की लय को एकदम सही रखता है जबकि यह सुनिश्चित करता है कि मैराथन धावक चक्कर खाए बिना फिनिश लाइन तक पहुँच सकें। यह उन्हें एक कोमल, त्वरित बढ़ावा देने जैसा है।
जब उन्होंने इसका परीक्षण किया तो क्या हुआ?
टीम ने कई चुनौतियों पर इस नए "प्रोग्रेसिव क्लॉक" का परीक्षण किया:
"नीडल इन अ हेस्टैक" (Needle in a Haystack) टेस्ट: उन्होंने एक विशाल किताब (हेस्टैक) के अंदर एक विशिष्ट वाक्य (सुई/needle) छिपा दिया और रोबोट को उसे खोजने के लिए कहा।
- परिणाम: MrRoPE-Pro 128,000 शब्दों तक की किताबों में से सुई को 85% से अधिक सटीकता के साथ खोज सका। YaRN 64,000 शब्दों के बाद बुरी तरह विफल होने लगा। यह ऐसा था जैसे MrRoPE-Pro के पास एक सुपर-शार्प टॉर्चलाइट थी, जबकि YaRN की टॉर्च अंधेरे में टिमटिमाने लगी थी।
"इनफिनिट-बेंच" (Infinite-Bench) टेस्ट: इसने यह परीक्षण किया कि क्या रोबोट वास्तव में उस जानकारी का उपयोग करके सवालों के जवाब दे सकता है या बातचीत कर सकता है।
- परिणाम: MrRoPE-Pro ने न केवल सुई को ढूँढा; बल्कि इसने कहानी को समझा भी। इसने YaRN को भारी अंतर से पीछे छोड़ दिया (कभी-कभी दोगुना स्कोर) और अन्य रोबोट्स के बराबर या उनसे बेहतर प्रदर्शन किया जिन्हें लंबी किताबों के लिए विशेष रूप से प्रशिक्षित (fine-tuned) किया गया था। सबसे अच्छी बात? MrRoPE-Pro को किसी पुन: प्रशिक्षण (retraining) की आवश्यकता नहीं थी। यह गणित के नियमों को बदलकर तुरंत काम करने लगा।
निष्कर्ष (The Bottom Line)
पेपर का दावा है कि रोबोट के स्थिति-ट्रैकिंग सिस्टम को "नंबर बेस कन्वर्जन" के नजरिए से देखकर, उन्होंने इसकी घड़ी को खींचने का एक बेहतर तरीका खोज लिया है। MrRoPE-Pro एक "ट्रेन शॉर्ट, टेस्ट लॉन्ग" (कम में सीखो, ज्यादा में टेस्ट करो) वाला जादू है: आप एक रोबोट को छोटी टेक्स्ट पर प्रशिक्षित कर सकते हैं, और फिर बिना किसी अतिरिक्त लर्निंग के, केवल इस नए प्रोग्रेसिव स्ट्रेचिंग नियम को लागू करके, उसे विशाल उपन्यास पढ़ने और समझने के लिए तुरंत उपयोग कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।