YaRN: Efficient Context Window Extension of Large Language Models
YaRN, रोटरी पोज़िशन एम्बेडिंग्स (RoPE) का उपयोग करके लार्ज लैंग्वेज मॉडल्स के कॉन्टेक्स्ट विंडो को विस्तारित करने की एक कंप्यूट-कुशल विधि है, जिसके लिए पिछले तरीकों की तुलना में काफी कम टोकन और ट्रेनिंग स्टेप्स की आवश्यकता होती है और यह बेहतर प्रदर्शन एवं एक्सट्रपलेशन क्षमताओं को प्राप्त करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान सहायक है जो किताबें पढ़ने में माहिर है। हालाँकि, इस सहायक की एक विशिष्ट सीमा है: उसका एक "मानसिक व्हाइटबोर्ड" है जो एक बार में केवल 10 पेज की जानकारी रख सकता है। यदि आप उसे 11वाँ पेज देने की कोशिश करते हैं, तो वह जगह बनाने के लिए पहले पेज की सारी जानकारी तुरंत भूल जाता है।
आज के लार्ज लैंग्वेज मॉडल्स (LLMs) इसी तरह काम करते हैं। उनके पास एक "कॉन्टेक्स्ट विंडो" होती है—यानी एक सीमा कि वे एक बार में कितना टेक्स्ट "देख" और प्रोसेस कर सकते हैं।
पेपर "YaRN" वास्तव में उस मानसिक व्हाइटबोर्ड को अपग्रेड करने का एक ब्लूप्रिंट है, जिससे उस सहायक के पूरे मस्तिष्क को शुरू से फिर से प्रशिक्षित (retrain) किए बिना, उसके व्हाइटबोर्ड को बहुत बड़ा बनाया जा सके।
इसे तीन सरल रूपकों (metapots) के माध्यम से यहाँ समझाया गया है:
1. "रबर बैंड" की समस्या (पुराने तरीकों के साथ मुद्दा)
कल्पना कीजिए कि सहायक पन्ने पर शब्द कहाँ स्थित हैं, इसका पता रखने के लिए एक स्केल (रूलर) का उपयोग करता है (इसे 'पोजीशन एनकोडिंग' कहा जाता है)।
पिछले शोधकर्ताओं ने संदर्भ (context) को बढ़ाने के लिए एक "स्ट्रेच मेथड" (पोजीशन इंटरपोलेशन) का प्रयास किया। कल्पना कीजिए कि आप एक निशान वाले रबर बैंड को ले रहे हैं और उसे बहुत लंबी दूरी तक खींच रहे हैं। समस्या क्या है? जब आप रबर बैंड को खींचते हैं, तो उस पर बने निशान धुंधले और बिखरे हुए हो जाते हैं। सहायक अभी भी शब्दों को देख सकता है, लेकिन वह यह बताने की क्षमता खो देता है कि वे वास्तव में एक-दूसरे से कितनी दूर हैं। उन्हें दूरियों के लिए "धुंधली दृष्टि" (blurry vision) होने लगती है, और वे गलतियाँ करने लगते हैं।
2. "स्मार्ट ज़ूम" (YaNG का समाधान)
सब कुछ अंधाधुंध खींचने के बजाय, YaRN के रचनाकारों ने महसूस किया कि सभी जानकारी को एक ही तरह से खींचने की आवश्यकता नहीं है।
एक हाई-रेज़ोल्यूशन फोटोग्राफ के बारे में सोचें।
- बारीक विवरण (जैसे कि एक पत्ते की बनावट) बहुत महत्वपूर्ण होते हैं ताकि आप देख सकें कि आपके ठीक सामने क्या हो रहा है।
- बड़ी आकृतियाँ (जैसे कि एक पहाड़ की रूपरेखा) पूरे दृश्य को समझने के लिए महत्वपूर्ण होती हैं।
यदि आप पूरे पहाड़ को देखने के लिए ज़ूम आउट करते हैं, तो आपको छोटे पत्ते की बनावट पर ज़ूम आउट करने की आवश्यकता नहीं है; आपको बस इस बात को समायोजित करने की आवश्यकता है कि आप बड़ी आकृतियों को कैसे देखते हैं।
YaRN एक "स्मार्ट ज़ूम" की तरह काम करता है। यह "हाई-फ्रीक्वेंसी" जानकारी (बारीक, स्थानीय विवरण जो मॉडल को एक-दूसरे के ठीक बगल वाले शब्दों के बीच संबंध समझने में मदद करते हैं) को लगभग यथावत छोड़ देता है। साथ ही, यह "लो-फ्रीक्वेंसी" जानकारी (बड़ी तस्वीर की संरचना) को सुचारू रूप से समायोजित करता है ताकि मॉडल बहुत लंबे अनुक्रमों (sequences) को संभाल सके। यह एक आवर्धक लेंस (magnifying glass) से वाइड-एंगल लेंस में अपग्रेड करने जैसा है, बिना बारीक अक्षरों को देखने की क्षमता खोए।
3. "डिमर स्विच" (डायनेमिक स्केलिंग)
यह पेपर "डायनेमिक स्केलिंग" नामक चीज़ भी पेश करता है।
कल्पना कीजिए कि आपका सहायक एक लंबा स्क्रॉल (लपेटा हुआ कागज़) पढ़ रहा है। आमतौर पर, वे मान लेते हैं कि स्क्रॉल हमेशा 10 फीट लंबा होता है। यदि आप अचानक उन्हें 100 फीट का स्क्रॉल दे देते हैं, तो वे घबरा जाते हैं।
डायनेमिक स्केलिंग आपके सहायक को उनके फोकस के लिए एक "डिमर स्विच" देने जैसा है। जैसे-जैसे स्क्रॉल लंबा होता जाता है, सहायक स्वचालित रूप से अपने "फोकस की तीव्रता" (अटेंशन मैकेनिज्म के पीछे का गणित) को उस लंबाई के अनुसार समायोजित करता है जिसे वे वर्तमान में पढ़ रहे हैं। यह उन्हें एक लंबे दस्तावेज़ को सुचारू रूप से पढ़ना शुरू करने की अनुमति देता है, बजाय इसके कि वे एक ऐसी "दीवार" से टकरा जाएँ जहाँ वे अचानक सब कुछ समझना बंद कर दें।
यह क्यों मायने रखता है?
"वास्तविक दुनिया" में, यह एक बहुत बड़ी बात है क्योंकि:
- यह सस्ता और तेज़ है: मॉडल को लंबी किताबें पढ़ने के लिए "पुनः शिक्षित" करने में लाखों डॉलर खर्च करने के बजाय, YaRN हमें मौजूदा मॉडल को बहुत कम समय और पैसे के एक छोटे से हिस्से का उपयोग करके "ट्वीक" (सुधार) करने की अनुमति देता है (पेपर कहता है कि इसमें 10 गुना कम टोकन और 2.5 गुना कम स्टेप्स लगते हैं)।
- यह शक्तिशाली है: यह LLaMA जैसे मॉडल्स को विशाल दस्तावेज़, पूरा कोडबेस, या लंबे कानूनी अनुबंध पढ़ने की अनुमति देता है जो पहले उनके लिए "बहुत बड़े" थे।
संक्षेप में: YaRN AI को एक बहुत बड़ा, बहुत स्पष्ट "मानसिक व्हाइटबोर्ड" देता है, बिना पूर्ण मस्तिष्क प्रत्यारोपण (brain transplant) की महंगी लागत के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।