reward-lens: A Mechanistic Interpretability Library for Reward Models
यह शोध पत्र "reward-lens" का परिचय देता है, जो एक ओपन-सोर्स लाइब्रेरी है जो रिवॉर्ड हेड के वेट वेक्टर (weight vector) को एक केंद्रीय अक्ष के रूप में उपयोग करके रिवॉर्ड मॉडल्स के लिए मैकेनिस्टिक इंटरप्रिटेबिलिटी टूल्स को अनुकूलित करती है, यह प्रकट करते हुए कि लीनियर एट्रिब्यूशन विधियाँ कॉज़ल पैचिंग प्रभावों (causal patching effects) की भविष्यवाणी करने में विफल रहती हैं और इस प्रकार एक ऐसे ढांचे को प्रेरित करती हैं जो इस विसंगति को एक बग के बजाय एक मौलिक गुण के रूप में मानता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक बहुत ही स्मार्ट रोबोट बनाया है जो मानवीय फीडबैक सुनकर मदद करना सीखता है। इस रोबोट को सिखाने के लिए, आप केवल उसे "अच्छा काम किया" या "बुरा काम किया" नहीं कहते। इसके बजाय, आप एक रिवॉर्ड मॉडल (Reward Model) का उपयोग करते हैं। इस रिवॉर्ड मॉडल को एक सख्त, अदृश्य जज की तरह समझें जो हर उत्तर को एक संख्या (स्कोर) देता है, इस आधार पर कि वह मानवीय प्राथमिकताओं से कितनी अच्छी तरह मेल खाता है। यदि रोबोट को उच्च स्कोर मिलता है, तो वह वही करता रहता है जो उसने किया था; यदि उसे कम स्कोर मिलता है, तो वह कुछ और करने की कोशिश करता है।
समस्या यह है: हमें वास्तव में पता नहीं है कि वह जज कैसे सोचता है।
वर्षों से, वैज्ञानिकों के पास जेनरेटिव (generative) AI मॉडल्स (जो कहानियाँ या कोड लिखते हैं) के दिमाग के अंदर झाँकने के लिए एक टूलकिट रहा है। वे देख सकते हैं कि अगले शब्द का निर्णय लेने के लिए कौन से न्यूरॉन्स सक्रिय हो रहे हैं। लेकिन यह टूलकिट उन मॉडल्स के लिए बनाया गया था जो शब्दों की एक सूची आउटपुट करते हैं। हालाँकि, रिवॉर्ड मॉडल शब्दों की सूची आउटपुट नहीं करता; यह एक एकल संख्या (single number) आउटपुट करता है। यह एक पेंटिंग को देखने के लिए डिज़ाइन किए गए सूक्ष्मदर्शी (microscope) का उपयोग करके स्याही की एक अकेली बूंद की जांच करने जैसा है। उपकरण फिट नहीं बैठे।
समाधान: "रिवर्ड-लेंस" (Reward-Lens)
यह पेपर reward-lens पेश करता है, जो एक नया लाइब्रेरी (सॉफ्टवेयर टूल्स का एक सेट) है जिसे विशेष रूप से इन "एकल-संख्या" जजों के अंदर देखने के लिए डिज़ाइन किया गया है।
यहाँ मुख्य विचार है, जिसे एक उपमा (analogy) के माध्यम से समझाया गया है:
कल्पना कीजिए कि AI का मस्तिष्क 32 कमरों (लेयर्स) वाला एक लंबा गलियारा है। प्रत्येक कमरे में, जानकारी को प्रोसेस किया जाता है और अगले कमरे में भेजा जाता है। गलियारे के बिल्कुल अंत में, एक जज का डेस्क (Judge's Desk) (रिवॉर्ड हेड) है। जज अंतिम संदेश को देखता है और एक स्कोर लिखता है। लेखक ने महसूस किया कि जज के डेस्क का एक विशिष्ट "दिशा" (direction) होती है जिसकी उसे परवाह होती है। यह ऐसा है जैसे जज के पास "अच्छाई" की दिशा में इशारा करने वाला एक विशिष्ट वेक्टर (तीर) है।
- पुराना तरीका: वैज्ञानिकों ने यह पूछकर गलियारे को देखने की कोशिश की, "अगला शब्द क्या होगा?" (जो स्कोर के लिए तर्कसंगत नहीं है)।
- नया तरीका (Reward-Lens): यह लाइब्रेरी पूछती है, "इस विशेष कमरे में मौजूद संदेश अंतिम स्कोर को कितना ऊपर या नीचे धकेलता है?"
यह हर कदम को जज के "अच्छाई वाले तीर" (Good Arrow) पर प्रोजेक्ट करके ऐसा करती है। यह वैज्ञानिकों को यह देखने की अनुमति देता है कि मस्तिष्क में ठीक कहाँ "अच्छाई" की गणना की जा रही है।
यह लाइब्रेरी क्या करती है (टूलकिट)
पेपर में इस लाइब्रेरी के भीतर कई उपकरण वर्णित हैं, जिनमें से प्रत्येक का एक सरल उद्देश्य है:
द रिवॉर्ड लेंस (एक्स-रे - The X-Ray):
- उपमा: कल्पना कीजिए कि आप फिल्म के हर फ्रेम को देख रहे हैं ताकि यह देख सकें कि नायक कब विलेन से लड़ने का निर्णय लेता है।
- कार्य: यह दिखाता है कि AI की प्रोसेसिंग में ठीक कब (किस लेयर में) उच्च या निम्न स्कोर देने का निर्णय लिया जाता है। लेखकों ने पाया कि कुछ मॉडल्स के लिए, यह निर्णय बहुत देर से (अंतिम कमरों में) होता है, जबकि अन्य के लिए, यह पहले और अधिक अराजक रूप से होता है।
कंपोनेंट एट्रिब्यूशन (स्कोरकार्ड - Component Attribution):
- उपमा: अंतिम परीक्षा के ग्रेड को यह देखने के लिए तोड़ना कि कितने अंक निबंध, गणित और बहुविकल्पीय प्रश्नों से आए।
- कार्य: यह गणना करता है कि AI के मस्तिष्क के प्रत्येक विशिष्ट भाग ने अंतिम स्कोर में कितना योगदान दिया।
- बड़ा आश्चर्य: लेखकों ने एक बड़ा अंतर पाया। वे हिस्से जो दिखने में सबसे अधिक काम कर रहे थे (एट्रिब्यूशन के आधार पर), वास्तव में सही उत्तर प्राप्त करने के लिए आवश्यक नहीं थे। यदि आप "शीर्ष" भागों को बंद कर देते, तो स्कोर में बहुत कम बदलाव आता। यदि आप "निचले" भागों को बंद कर देते, तो स्कोर गिर जाता। इसका मतलब है कि केवल स्कोरकार्ड देखना भ्रामक है।
एक्टिवेशन पैचिंग (स्वैप टेस्ट - Activation Patching):
- उपमा: एक "अच्छे" उत्तर के मस्तिष्क कोशिका को एक "बुरे" उत्तर में बदलकर यह देखना कि क्या यह बुरे को ठीक करता है।
- कार्य: यह एक "कारण-और-प्रभाव" (cause-and-effect) परीक्षण है। यह स्कोर बदलने के लिए एक पसंदीदा और एक नापसंद उत्तर के बीच AI की प्रोसेसिंग के हिस्सों को भौतिक रूप से बदलता है। यह जानने का एकमात्र तरीका है कि वास्तव में क्या मायने रखता है।
हैकिंग डिटेक्टर (झूठ पकड़ने वाला यंत्र - The Hacking Detector):
- उपमा: यह परीक्षण करना कि क्या जज चापलूसी, लंबे शब्दों या फैंसी फॉर्मेटिंग से आसानी से धोखा खा जाता है।
- कार्य: यह जाँचता है कि क्या AI "चाटुकारिता" (sycophancy - गलत होने पर भी उपयोगकर्ता से सहमत होना) या "लंबाई पूर्वाग्रह" (length bias - यह सोचना कि लंबे उत्तर बेहतर होते हैं) को पुरस्कृत करता है।
- निष्कर्ष: दो अलग-अलग मॉडल्स ने बहुत अलग व्यवहार किया। एक मॉडल चापलूसी और लंबे उत्तरों को नापसंद करता था; दूसरे ने उन्हें पुरस्कृत किया।
कॉन्सेप्ट एनालिसिस (विचार डिटेक्टर - Concept Analysis):
- उपमा: यह जाँच करना कि क्या AI के दिमाग में "विनम्र होने" या "आत्मविश्वासी होने" का कोई विशिष्ट "विचार" बना हुआ है।
- कार्य: यह खोजता है कि क्या AI के पास "सहमति" या "शब्दों की अधिकता" (verbosity) जैसे कॉन्सेप्ट्स के लिए एक रैखिक "वेक्टर" है और यह जाँचता है कि क्या जज उन कॉन्सेप्ट्स को पुरस्कृत करता है।
मुख्य निष्कर्ष
इस पेपर का सबसे महत्वपूर्ण निष्कर्ष थोड़ा बुरा समाचार है, लेकिन यह ईमानदार बुरा समाचार है: आप "स्कोरकार्ड" (एट्रिब्यूशन) पर भरोसा नहीं कर सकते कि वास्तव में क्या महत्वपूर्ण है।
जेनरेटिव AI (कहानियाँ लिखने) की दुनिया में, स्कोरकार्ड और कारण-प्रभाव परीक्षण आमतौर पर सहमत होते थे। लेकिन रिवॉर्ड मॉडल्स के लिए, वे असहमत थे। मस्तिष्क के वे हिस्से जो सबसे अधिक काम करते हुए दिखते थे, वे अक्सर केवल "अतिरिक्त" (redundant) थे (उन्हें बिना स्कोर बदले हटाया जा सकता था), जबकि वे हिस्से जो शांत दिखते थे, वे वास्तव में महत्वपूर्ण "भार वहन करने वाले" (load-bearing) स्तंभ थे।
यह क्यों मायने रखता है
लेखकों ने इस लाइब्रेरी को वैज्ञानिकों को गलत धारणाएं बनाने से रोकने के लिए बनाया है। इससे पहले, लोग रिवॉर्ड मॉडल को देख सकते थे, मस्तिष्क के एक विशिष्ट हिस्से को सक्रिय होते देख सकते थे, और कह सकते थे, "आहा! सुरक्षा तर्क यहीं रहता है!" और उसे ठीक करने की कोशिश कर सकते थे। यह पेपर कहता है, "रुको, यह एक भटकाव (red herring) हो सकता है। सुनिश्चित करने के लिए आपको 'स्वैप टेस्ट' (पैचिंग) करना होगा।"
यह लाइब्रेरी अब किसी के लिए भी उपयोग के लिए उपलब्ध है ताकि:
- यह देखा जा सके कि AI के मस्तिष्क में प्राथमिकताएँ कब बनती हैं।
- यह पता लगाया जा सके कि क्या AI चापलूसी या फॉर्मेटिंग से धोखा खा रहा है।
- यह समझा जा सके कि विभिन्न AI मॉडल अलग-अलग सुरक्षा निर्णय क्यों लेते हैं।
संक्षेप में, reward-lens पहला ऐसा चश्मा है जो हमें स्पष्ट रूप से देखने देता है कि हमारे AI के अंदर का "जज" वास्तव में कैसे सोचता है, जो यह प्रकट करता है कि मस्तिष्क पहले की तुलना में अधिक जटिल और भ्रामक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।