← नवीनतम पेपर
💬 NLP

The Emergence of Relevance Through Axiomatic Attention Patterns During LoRA Fine-Tuning

यह शोधपत्र प्रदर्शित करता है कि रीरैंकिंग (reranking) के लिए LoRA फाइन-ट्यूनिंग मुख्य रूप से एक संक्षिप्त मिड-नेटवर्क क्षेत्र में अटेंशन (attention) को संशोधित करके व्याख्या योग्य प्रासंगिकता पैटर्न—जैसे कि दुर्लभता संवेदनशीलता और क्वेरी-दस्तावेज़ इंटरेक्शन—विकसित करके प्रदर्शन को बढ़ाता है, और इस विशिष्ट क्षेत्र में अटेंशन अपडेट को प्रतिबंधित करने से पूर्ण फाइन-ट्यूनिंग के आधे से अधिक लाभ प्राप्त होते हैं।

मूल लेखक: Matthew Perlman, Atharva Nijasure, James Allan

प्रकाशित 2026-08-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matthew Perlman, Atharva Nijasure, James Allan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल युग में, खोज इंजन (search engines) विशाल पुस्तकालयों की तरह कार्य करते हैं जहाँ सबसे कठिन कार्य कोई पुस्तक ढूँढना नहीं है, बल्कि लाखों के बीच से वह एक सही पृष्ठ ढूँढना है। इसे हल करने के लिए, आधुनिक प्रणालियाँ एक दो-चरणीय प्रक्रिया का उपयोग करती हैं: एक पहला चरण जो संभावित उत्तरों को इकट्ठा करने के लिए एक विस्तृत जाल फैलाता है, और दूसरा, अधिक सावधानीपूर्वक चरण जिसे "रीरैंकिंग" (reranking) कहा जाता है जो उन उत्तरों को इस आधार पर क्रमबद्ध करता है कि वे वास्तव में प्रश्न के साथ कितनी अच्छी तरह मेल खाते हैं। वर्षों से, इस काम के लिए सबसे शक्तिशाली उपकरण बड़े भाषा मॉडल (large language models) रहे हैं, जो विशाल मात्रा में टेक्स्ट पर प्रशिक्षित विशाल कंप्यूटर प्रोग्राम हैं। इन मॉडलों को खोज परिणामों को क्रमबद्ध करने में बेहतर बनाने के लिए, शोधकर्ता "लो-रैंक अडैप्टेशन" (low-rank adaptation) या LoRA नामक तकनीक का उपयोग करते हैं। इसे एक सामान्य-उद्देश्य वाले विशेषज्ञ को एक विशिष्ट कार्य के लिए विशेषज्ञ नोट्स का एक विशेष सेट देने के तरीके के रूप में समझें, बिना उनके पूरे मस्तिष्क को फिर से लिखे। जबकि यह विधि अविश्वसनीय रूप से अच्छा काम करती है, एक रहस्य बना हुआ है: मॉडल की जटिल मशीनरी के भीतर ठीक कहाँ यह नया विशेषज्ञता जड़ जमाती है, और मॉडल किन विशिष्ट नियमों का पालन करना सीखता है?

मैसाचुसेट्स विश्वविद्यालय एमherst के शोधकर्ताओं के एक दल ने इस छिपे हुए परिदृश्य का मानचित्रण करने का बीड़ा उठाया। उन्होंने रीरैंकिंग के लिए डिज़ाइन किए गए एक विशिष्ट मॉडल पर ध्यान केंद्रित किया और दो मौलिक प्रश्न पूछे। पहला, मॉडल का आंतरिक नेटवर्क का कौन सा हिस्सा वास्तव में भारी काम करता है जब वह दस्तावेजों को रैंक करना सीखता है? दूसरा, क्या मॉडल उन समान संकेतों पर ध्यान देना सीखता है जिनका उपयोग मानव सूचना विशेषज्ञों ने दशकों से किया है, जैसे कि विशिष्ट शब्दों का मिलान करना या दुर्लभ शब्दों पर ध्यान देना? मॉडल की सीखने की प्रक्रिया के विभिन्न अनुभागों को व्यवस्थित रूप से चालू और बंद करके, उन्होंने पाया कि मॉडल अपने पूरे ढांचे में समान रूप से रैंकिंग कौशल नहीं सीखता है। इसके बजाय, सबसे महत्वपूर्ण शिक्षण नेटवर्क के बीच में एक सघन, विशिष्ट क्षेत्र में होता है।

शोधकर्ताओं ने पाया कि यदि वे मॉडल को इस मध्य भाग को छोड़कर हर जगह अपने आंतरिक नोट्स को अपडेट करने की अनुमति देते, तो मॉडल का प्रदर्शन काफी गिर जाता। इसके विपरीत, यदि वे अपडेट को केवल इस मध्य भाग तक सीमित रखते और शेष मॉडल को अपरिवर्तित छोड़ देते, तो भी मॉडल उस सुधार का आधे से अधिक हिस्सा प्राप्त कर लेता जो पूरे सिस्टम को अपडेट करने पर देखा गया था। यह सुझाव देता है कि मॉडल अपने सबसे महत्वपूर्ण रैंकिंग व्यवहारों को एक छोटे, समर्पित क्षेत्र में केंद्रित करता है, न कि उन्हें पूरे सिस्टम में फैला देता है। यह ऐसा ही है जैसे मॉडल के पास एक विशिष्ट कार्यशाला (workshop) हो जहाँ सबसे महत्वपूर्ण समायोजन किए जाते हैं, जबकि बाकी कारखाना पहले की तरह ही कार्य करता रहता है।

इस महत्वपूर्ण क्षेत्र में मॉडल वास्तव में क्या सीख रहा था, इसे समझने के लिए, टीम ने प्रशिक्षण के दौरान मॉडल के 'अटेंशन' (attention) के बदलाव का परीक्षण किया। उन्होंने क्लासिक सूचना पुनर्प्राप्ति (information retrieval) के सिद्धांतों के साथ संरेखित विशिष्ट पैटर्न की तलाश की, जैसे कि "दुर्लभता संवेदनशीलता" (rarity sensitivity), जिसका अर्थ है उन शब्दों पर अधिक ध्यान देना जो कम बार दिखाई देते हैं क्योंकि वे अक्सर अधिक जानकारीपूर्ण होते हैं, और "दस्तावेज़-प्रश्न अंतःक्रिया" (document-query interaction), जिसका अर्थ है कि खोज प्रश्न के शब्दों का उत्तर पाठ के शब्दों के साथ कैसे संबंध है, इस पर ध्यान केंद्रित करना। अध्ययन से पता चला कि जैसे-जैसे मॉडल सीख रहा था, वह इन दुर्लभ शब्दों और प्रश्न एवं उत्तर के बीच के संबंधों की ओर अधिक ध्यान केंद्रित करने लगा। ये परिवर्तन यादृच्छिक (random) नहीं थे; वे ठीक उन्हीं मध्य परतों में हुए जहाँ प्रदर्शन में सुधार सबसे मजबूत था।

सीखने के स्थान और सीखने के प्रकार के बीच का संबंध चौंकाने वाला था। वे क्षेत्र जहाँ मॉडल ने अपने रैंकिंग स्कोर में सबसे अधिक सुधार किया, वे बिल्कुल वही क्षेत्र थे जहाँ इसने इन सार्थक, प्रासंगिकता-आधारित संकेतों पर ध्यान केंद्रित करना सीखा। शोधकर्ताओं ने दुर्लभ, महत्वपूर्ण शब्दों को पहचानने की मॉडल की क्षमता और दस्तावेजों को सही ढंग से रैंक करने की इसकी क्षमता के बीच एक मजबूत कड़ी पाई। यह सुझाव देता है कि मॉडल केवल पैटर्न को याद नहीं कर रहा है, बल्कि वह सूचना पुनर्प्राप्ति के स्थापित सिद्धांतों को प्रतिबिंबित करने वाला एक संरचित, तार्किक दृष्टिकोण अपना रहा है। जबकि मॉडल ने सरल शब्द-दर-शब्द मिलान पर अधिक ध्यान केंद्रित करना नहीं सीखा, लेकिन इसने प्रश्न और दस्तावेज़ सामग्री के बीच की अंतःक्रिया को महत्व देना सीखा, जो एक प्रभावी खोज का आधार है।

यह कार्य इस बात की स्पष्ट खिड़की प्रदान करता है कि कृत्रिम बुद्धिमत्ता (AI) जटिल कार्यों को कैसे सीखती है। यह दिखाता है कि जब एक बड़े भाषा मॉडल को खोज रीरैंकिंग जैसे विशिष्ट कार्य के लिए फाइन-ट्यून किया जाता है, तो वह एक साथ अपना पूरा मन नहीं बदलता है। इसके बजाय, यह अपने नेटवर्क के एक केंद्रित क्षेत्र में नए, अत्यधिक विशिष्ट व्यवहार स्थापित करता है। ये व्यवहार रहस्यमय या अराजक नहीं हैं; वे प्रासंगिकता के पहचाने जाने योग्य सिद्धांतों पर आधारित हैं, जैसे कि दुर्लभ जानकारी को महत्व देना और एक प्रश्न तथा उत्तर के बीच के संबंध को समझना। यह पहचानकर कि ये परिवर्तन ठीक कहाँ और कैसे होते हैं, यह अध्ययन अधिक कुशल और व्याख्या योग्य (interpretable) खोज प्रणालियों की ओर एक मार्ग प्रदान करता है, जो यह सिद्ध करता है कि अत्यंत जटिल डिजिटल मस्तिष्क भी यह सीखने के लिए कि क्या महत्वपूर्ण है, एक तार्किक मानचित्र का पालन करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →