Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability
यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में प्रासंगिक पूर्वाग्रह का मूल्यांकन करने के लिए एक स्तरीय 'मोरल सेंसिटिविटी इंडेक्स' (नैतिक संवेदनशीलता सूचकांक) प्रस्तुत करता है, जो विभिन्न आर्किटेक्चरों में विशिष्ट व्यवहार संबंधी हस्ताक्षरों को प्रकट करता है और यांत्रिक रूप से यह प्रमाणित करता है कि तर्क संबंधी आसवन (रीज़निंग डिस्टिलेशन), बढ़ी हुई क्षमता के बावजूद अनजाने में आपराधिक पूर्वाग्रह सर्किटों को पुन: सक्रिय कर सकता है।