PERK: Long-Context Reasoning as Test-Time Learning
यह शोध पत्र PERK को प्रस्तुत करता है, जो एक पैरामीटर-कुशल ढांचा है जो लंबी संदर्भों (long contexts) को लो-रैंक एडेप्टर में एनकोड करने के लिए नेस्टेड मेटा-लर्निंग लूप्स के माध्यम से टेस्ट-टाइम ग्रेडिएंट अपडेट का उपयोग करता है, और विभिन्न मॉडल स्केल्स में लॉन्ग-कॉन्टेक्स्ट रीजनिंग कार्यों में मानक फाइन-ट्यूनिंग और विशिष्ट मॉडलों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
लार्ज लैंग्वेज मॉडल्स (LLMs) शक्तिशाली उपकरण हैं जिन्होंने विशाल मात्रा में टेक्स्ट का अध्ययन करके पढ़ना और लिखना सीखा है। वे पैटर्न खोजने और तब उत्तर देने में उत्कृष्ट होते हैं जब जानकारी उनके ठीक सामने होती है। हालाँकि, इन मॉडल्स के सामने एक महत्वपूर्ण बाधा तब आती है जब आवश्यक जानकारी किसी विशाल टेक्स्ट के ढेर में दबी होती है, जैसे कि एक किताब जितनी लंबी दस्तावेज़ या एक लंबा ट्रांसक्रिप्ट। जैसे-जैसे टेक्स्ट लंबा होता जाता है, मॉडल्स अक्सर अप्रासंगिक शोर (noise) को अनदेखा करने और समस्या को हल करने के लिए आवश्यक विशिष्ट तथ्य को खोजने में संघर्ष करते हैं। यह कठिनाई कई मॉडल्स की उस प्रवृत्ति के कारण और भी बढ़ जाती है जहाँ वे टेक्स्ट के बिल्कुल शुरुआत या बिल्कुल अंत पर बहुत अधिक ध्यान केंद्रित करते हैं, जबकि बीच में छिपे विवरणों का ट्रैक खो देते हैं। शोधकर्ता लंबे समय से ऐसे तरीके खोजने की कोशिश कर रहे हैं जिनसे इन मॉडल्स को बिना उन्हें शून्य से फिर से प्रशिक्षित (retrain) किए, ऐसे "लॉन्ग-कॉन्टेक्स्ट" कार्यों को संभालने में मदद मिल सके, क्योंकि यह एक ऐसी प्रक्रिया है जो अक्सर अत्यधिक महंगी और समय लेने वाली होती है।
ICLR 2026 कॉन्फ्रेंस में प्रस्तुत एक नए अध्ययन में, EPFL के शोधकर्ताओं ने PERK नामक एक समाधान प्रस्तावित किया है, जिसका अर्थ है 'पैरामीटर एफिशिएंट रीजनिंग ओवर नॉलेज' (Parameter Efficient Reasoning over Knowledge)। मॉडल को एक साथ एक विशाल दस्तावेज़ पढ़ने के लिए मजबूर करने के बजाय, PERK पढ़ने की क्रिया को एक सीखने की प्रक्रिया के रूप में मानता है जो प्रश्न पूछे जाने के ठीक उसी क्षण होती है। कल्पना कीजिए कि एक छात्र, एक मोटी पाठ्यपुस्तक और एक विशिष्ट प्रश्न प्राप्त करने पर, नोट्स लिखने के लिए पृष्ठों को जल्दी से स्कैन करता है और नोटपैड पर संक्षिप्त नोट्स लिखता है। एक बार जब वे नोट्स लिख लिए जाते हैं, तो छात्र उस पाठ्यपुस्तक को रख सकता है और केवल उन नोट्स का उपयोग करके प्रश्न का उत्तर दे सकता है। PERK भी इसी तरह काम करता है। जब एक लंबा दस्तावेज़ प्रस्तुत किया जाता है, तो मॉडल पूरे टेक्स्ट को अपनी सक्रिय मेमोरी में नहीं रखता है। इसके बजाय, यह टेक्स्ट के सबसे महत्वपूर्ण हिस्सों को अपनी आंतरिक सेटिंग्स के एक छोटे, कुशल सेट में संकुचित (compress) करने के लिए एक संक्षिप्त, आंतरिक शिक्षण चरण का उपयोग करता है। ये समायोजन एक विशेष मेमोरी मॉड्यूल की तरह कार्य करते हैं, जो लंबे दस्तावेज़ के सार को संग्रहीत करते हैं। एक बार जब यह "नोटपैड" बन जाता है, तो मूल टेक्स्ट को हटा दिया जाता है, और मॉडल सामग्री के बारे में प्रश्न पूछने के लिए अपनी नई, अपडेटेड सेटिंग्स का उपयोग करता है।
शोधकर्ताओं ने एक प्रशिक्षण पद्धति विकसित की है जो मॉडल को प्रभावी ढंग से इस संपीड़न (compression) और पुनर्प्राप्ति (retrieval) को करने के लिए सिखाती है। उन्होंने दो स्तरों वाले लर्निंग तकनीक का उपयोग किया। पहले स्तर में, मॉडल टेक्स्ट के एक हिस्से को अपनी मेमोरी सेटिंग्स में तेजी से एनकोड करना सीखता है। दूसरे स्तर में, मॉडल यह सीखता है कि उन सेटिंग्स का उपयोग करके सटीक उत्तर कैसे दिए जाएं। इस प्रक्रिया को कुशल बनाए रखने और कंप्यूटर को मेमोरी की कमी से बचाने के लिए, मॉडल अपने कुल पैरामीटर्स के एक बहुत ही छोटे हिस्से को अपडेट करता है—विशेष रूप से, एक हल्का एड-ऑन घटक जिसे 'लो-रैंक एडेप्टर' (low-rank adapter) कहा जाता है। यह मॉडल को उसके मूल ज्ञान आधार को बदले बिना संदर्भ से सीखने की अनुमति देता है। शोधकर्ताओं ने विभिन्न चुनौतीपूर्ण कार्यों पर इस दृष्टिकोण का परीक्षण किया, जिसमें हजारों पृष्ठों के टेक्स्ट के भीतर छिपा हुआ एक विशिष्ट तथ्य खोजना, कई सूचनाओं को जोड़ने की आवश्यकता वाले जटिल प्रश्नों के उत्तर देना, और समान दिखने वाले रिकॉर्ड की लंबी सूचियों से डेटा निकालना शामिल था।
परिणामों ने दिखाया कि PERK उन मानक तरीकों की तुलना में काफी बेहतर प्रदर्शन करता है जहाँ मॉडल्स को बाद में उत्तर देने के लिए सीधे लंबे टेक्स्ट पर प्रशिक्षित किया जाता है। Qwen-2.5 मॉडल पर किए गए परीक्षणों में, PERK ने इन मानक दृष्टिकोणों की तुलना में सटीकता में 20 प्रतिशत तक सुधार किया। यह तरीका तब भी मजबूत साबित हुआ जब मॉडल को उन टेक्स्ट को संभालने के लिए कहा गया जो उसके प्रशिक्षण के दौरान देखे गए टेक्स्ट से बहुत लंबे थे, जिससे यह 64,000 और यहाँ तक कि 128,000 टोकन के कॉन्टेक्स्ट में भी सफलतापूर्वक सामान्यीकरण (generalize) कर सका। इसके अलावा, PERK ने सूचना की स्थिति (position) को अनदेखा करने की एक अनूठी क्षमता प्रदर्शित की। जबकि अन्य मॉडल्स अक्सर विफल हो जाते हैं जब प्रासंगिक तथ्य को टेक्स्ट के शुरुआत या अंत से हटाकर बीच में रखा जाता है, PERK ने जानकारी कहीं भी होने के बावजूद उच्च सटीकता बनाए रखी। यह सुझाव देता है कि टेक्स्ट को एक निश्चित स्थिति के बजाय एक लचीली मेमोरी संरचना में एनकोड करके, मॉडल अधिक विश्वसनीय रूप से तर्क (reasoning) कर सकता है। यह दृष्टिकोण विभिन्न मॉडल आकारों में लगातार काम आया, 0.5 बिलियन पैरामीटर्स वाले बहुत छोटे मॉडल्स से लेकर 8 बिलियन वाले बड़े मॉडल्स तक, और इसने लंबे कॉन्टेक्स्ट के लिए विशेष रूप से डिज़ाइन किए गए विशाल मॉडल्स के प्रदर्शन की बराबरी की या उनसे बेहतर प्रदर्शन किया।
सटीकता के अलावा, अध्ययन ने इस पद्धति की दक्षता पर भी प्रकाश डाला। क्योंकि मॉडल टेक्स्ट को छोटे, प्रबंधनीय टुकड़ों में प्रोसेस करता है और एनकोडिंग के बाद मूल टेक्स्ट को हटा देता है, इसलिए इसे अत्यंत लंबे दस्तावेज़ों को संभालने के लिए बहुत कम कंप्यूटर मेमोरी की आवश्यकता होती है। उन परीक्षणों में जहाँ मानक तरीके 128,000 टोकन पर मेमोरी सीमा के कारण क्रैश हो गए थे, PERK ने कार्य करना जारी रखा, सूचना को बहुत कम समय में और बहुत कम मेमोरी का उपयोग करके प्रोसेस किया। शोधकर्ताओं ने निष्कर्ष निकाला कि लॉन्ग-कॉन्टेक्स्ट रीजनिंग को 'टेस्ट-टाइम लर्निंग टास्क' के रूप में पुनर्गठित करके, जहाँ मॉडल ऑन-द-फ्लाई अपनी मेमोरी को अनुकूलित करता है, पारंपरिक प्रशिक्षण की भारी कम्प्यूटेशनल लागत के बिना बेहतर प्रदर्शन प्राप्त करना संभव है। यह दृष्टिकोण बड़े भाषा मॉडल्स को वास्तविक दुनिया में पाए जाने वाली विशाल और जटिल जानकारी को संभालने में अधिक सक्षम बनाने के लिए एक आशाजनक मार्ग प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।