reward-lens: A Mechanistic Interpretability Library for Reward Models
यह शोध पत्र "reward-lens" का परिचय देता है, जो एक ओपन-सोर्स लाइब्रेरी है जो रिवॉर्ड हेड के वेट वेक्टर (weight vector) को एक केंद्रीय अक्ष के रूप में उपयोग करके रिवॉर्ड मॉडल्स के लिए मैकेनिस्टिक इंटरप्रिटेबिलिटी टूल्स को अनुकूलित करती है, यह प्रकट करते हुए कि लीनियर एट्रिब्यूशन विधियाँ कॉज़ल पैचिंग प्रभावों (causal patching effects) की भविष्यवाणी करने में विफल रहती हैं और इस प्रकार एक ऐसे ढांचे को प्रेरित करती हैं जो इस विसंगति को एक बग के बजाय एक मौलिक गुण के रूप में मानता है।