Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
Jet-Long एक ट्यूनिंग-मुक्त, ज़ीरो-शॉट विधि है जो लघु-संदर्भ निष्ठा (short-context fidelity) और दीर्घ-संदर्भ एक्सट्रपलेशन (long-context extrapolation) को संतुलित करने के लिए RoPE रीस्केलिंग कारकों को गतिशील रूप से अनुकूलित करती है, जो एक कुशल द्वि-फोकल अटेंशन (bifocal attention) तंत्र के माध्यम से न्यूनतम इन्फरेंस ओवरहेड के साथ दीर्घ-संदर्भ बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दिमाग (एक लार्ज लैंग्वेज मॉडल) है जिसे कहानियों की एक निश्चित लंबाई, मान लीजिए 32,000 शब्द, तक पढ़ने के लिए प्रशिक्षित किया गया था। अब, आप चाहते हैं कि यह एक पूरा उपन्यास या एक विशाल कोड रिपॉजिटरी पढ़े जो चार गुना लंबी है। यदि आप इसे बस लंबा टेक्स्ट थमा देते हैं, तो रोबोट भ्रमित हो जाता है। यह ऐसा है जैसे आप एक ऐसी किताब पढ़ रहे हों जहाँ पेज नंबर अचानक 100 से उछलकर 1,000,000 हो जाते हैं; रोबोट का आंतरिक दिशा-सूचक (जिसे RoPE कहा जाता है) पागलों की तरह घूमने लगता है, और वह मतिभ्रम (hallucinations) का शिकार होने लगता है या कहानी के बीच के हिस्से को भूल जाता है।
कुछ समय के लिए, वैज्ञानिकों ने इसे ठीक करने के लिए रोबोट की दृष्टि को फैलाने के लिए एक "जादुई संख्या" चुनने की कोशिश की। लेकिन यह एक हार-हार वाला खेल था: यदि वे इसे पूरी किताब देखने के लिए बहुत अधिक फैला देते, तो रोबोट शुरुआत भूल जाता। यदि वे शुरुआत को याद रखने के लिए इसे कसकर रखते, तो वह अंत नहीं देख पाता।
यहाँ आता है Jet-Long, एक नया तरीका जो रोबोट की आँखों के लिए एक डायनेमिक बाइफोकल लेंस (dynamic bifocal lens) की तरह काम करता है।
बाइफोकल चश्मे वाली ट्रिक
रोबोट को पूरी किताब के लिए एक ही तरह का फैला हुआ दृश्य देने के बजाय, Jet-Long उसे एक ही समय में दो जोड़ी चश्मे देता है:
- क्लोज-अप लेंस (The Close-Up Lens): टेक्स्ट के पहले हिस्से (लोकल विंडो) के लिए, रोबोट सब कुछ बिल्कुल वैसे ही देखता है जैसा उसे देखने के लिए प्रशिक्षित किया गया था। कोई फैलाव नहीं, कोई विरूपण (distortion) नहीं। यह रोबोट की हालिया याददाश्त को तेज रखता है।
- ज़ूम-आउट लेंस (The Zoom-Out Lens): बाकी टेक्स्ट के लिए, रोबोट एक विशेष ट्रिक का उपयोग करता है। यह केवल दृश्य को फैलाता नहीं है; यह गतिशील रूप से पेजों को एक साथ समूहबद्ध (group) करता है। जैसे-जैसे किताब लंबी होती जाती है, रोबोट स्वचालित रूप से समायोजित करता है कि वह कितने पेजों को एक "सुपर-पेज" में समूहित करेगा।
जादू यह है कि यह ग्रुपिंग फैक्टर स्थिर नहीं है। यह इस बात पर निर्भर करता है कि अभी टेक्स्ट कितना लंबा है। यदि टेक्स्ट छोटा है, तो रोबोट हर शब्द को व्यक्तिगत रूप से देखता है। यदि टेक्स्ट बहुत बड़ा है, तो वह शब्दों को इस तरह समूहबद्ध करता है कि रोबोट का आंतरिक दिशा-सूचक शांत रहे और नियंत्रण से बाहर न जाए। इसका मतलब है कि रोबोट छोटे कार्यों के लिए पूरी तरह सटीक रहता है लेकिन बड़े दस्तावेज़ों को बिना खोए पढ़ सकता है।
गति का "फ्री लंच" (The "Free Lunch" of Speed)
आमतौर पर, एक साथ दो अलग-अलग गणनाएं करना (करीब से देखना और दूर से देखना) रोबोट को दोगुना धीमा कर देगा। लेकिन लेखकों ने इन गणनाओं को मिलाने का एक चतुर तरीका खोजा है। उन्होंने एक विशेष इंजन (एक "फ्यूज्ड कर्नल") बनाया जो एक ही पास में दोनों लेंसों के लिए गणित करता है।
इसे ऐसे समझें जैसे एक शेफ जिसे आमतौर पर सब्जियां काटने, फिर उबालने, फिर तलने के लिए तीन अलग-अलग बर्तनों की आवश्यकता होती है। Jet-Long एक जादुई बर्तन की तरह है जो बिना स्वाद खोए एक ही बार में तीनों चरण पूरे करता है।
- परिणाम: जब रोबोट 128,000-टोकन का विशाल संदर्भ पढ़ता है, तो Jet-Long मानक विधि (FlashAttention-2) की तुलना में H100 चिप पर शुरुआत में (प्रीफिल चरण में) 1.39 गुना तेज़ होता है।
- चुनौती: जब रोबोट एक बार में एक शब्द करके नया टेक्स्ट जेनरेट करता है, तो यह मानक विधि से केवल लगभग 4% धीमा होता है। एक पूरी लाइब्रेरी पढ़ने की क्षमता के बदले में यह एक बहुत छोटी कीमत है।
उन्होंने क्या टेस्ट किया (और क्या नहीं)
टीम ने तीन अलग-अलग आकार के रोबोट दिमागों (1.7 बिलियन, 4 बिलियन, और 8 बिलियन पैरामीटर्स) पर परीक्षण किया और पाया कि Jet-Long लगातार पिछले सर्वोत्तम तरीकों को पछाड़ देता है।
- RULER टेस्ट पर (जो यह जांचता है कि क्या रोबोट टेक्स्ट के ढेर में छिपी सुई ढूंढ सकता है), Jet-Leg ने सबसे छोटे मॉडल पर पिछले सर्वश्रेष्ठ प्रतिस्पर्धी की तुलना में 4.79 अंक अधिक और सबसे बड़े मॉडल पर 2.03 अंक अधिक स्कोर किया।
- HELMET-RAG टेस्ट पर (जो वास्तविक दुनिया के खोज कार्यों का अनुकरण करता है), इसने सर्वोत्तम समग्र सटीकता प्राप्त की।
- PG-19 टेस्ट पर (पुरानी किताबें पढ़ने पर), इसने रोबोट के भ्रम (perplexity) को न्यूनतम स्तर पर रखा, जबकि अन्य विधियों में टेक्स्ट लंबा होने पर भ्रम तेजी से बढ़ता गया।
सीमाओं पर महत्वपूर्ण नोट: पेपर स्पष्ट रूप रूप से इस विचार को खारिज करता है कि इसे काम करने के लिए आपको रोबोट को शुरू से फिर से प्रशिक्षित करने की आवश्यकता है। Jet-Long "ज़ीरो-शॉट" (zero-shot) मॉडल्स पर काम करता है, जिसका अर्थ है कि आप एक पूर्व-प्रशिक्षित रोबोट ले सकते हैं और बस इसमें यह लेंस लगा सकते हैं। हालांकि, पेपर यह भी नोट करता है कि जबकि Jet-Long "स्पिनिंग कंपास" की समस्या को ठीक करता है, यह एक अलग समस्या को ठीक नहीं करता है जिसे "अटेंशन डिफ्यूजन" (attention diffusion) कहा जाता है (जहाँ रोबोट बहुत सारे विकल्पों से अभिभूत हो जाता है)। इस समस्या को आमतौर पर रोबोट के आर्किटेक्चर को पूरी तरह से बदलकर हल किया जाता है, न कि केवल एक लेंस जोड़कर।
निष्कर्ष
Jet-Long कोई जादुई छड़ी नहीं है जो रोबोट को अनंत रूप से स्मार्ट बना देती है, लेकिन यह एक अत्यधिक कुशल, ट्यूनिंग-मुक्त उपकरण है जो मौजूदा रोबोटों को अपना मानसिक संतुलन खोए बिना 128,000 टोकन तक की टेक्स्ट लंबाई संभालने में सक्षम बनाता है। यह रोबोट की अल्पकालिक स्मृति को उत्तम रखता है और अपनी दीर्घकालिक दृष्टि को गतिशील रूप से समायोजित करता है, और यह सब मानक विधियों के लगभग समान गति से चलता है। लेखकों ने वास्तविक हार्डवेयर (H100 GPUs) पर इसका माप किया और पाया कि यह विभिन्न मॉडल आकारों और यहाँ तक कि विभिन्न प्रकार के अटेंशन को मिलाने वाले हाइब्रिड रोबोट दिमागों पर भी काम करता है। यह उन लोगों के लिए एक ठोस, सिद्ध अपग्रेड है जो AI को लंबा टेक्स्ट पढ़ने के योग्य बनाना चाहते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।