Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training
यह शोध पत्र प्रदर्शित करता है कि सहायक डेटा (helpfulness data) पर भाषा मॉडलों को पोस्ट-ट्रेनिंग देना, कोडिंग-केंद्रित प्रशिक्षण की तुलना में मिड-ट्रेन्ड पशु करुणा मूल्यों और सामान्य नैतिक तर्क को महत्वपूर्ण रूप से कम कर देता है, जबकि यह भी प्रकट करता है कि ये करुणा मूल्य डोमेन-विशिष्ट पोस्ट-ट्रेनिंग से प्राप्त तर्क सुधारों की तुलना में भाषाओं के बीच अधिक मजबूती से एनकोडेड हैं।