Debiasing Reward Models via Causally Motivated Inference-Time Intervention
यह शोध पत्र एक कारण-प्रेरित (causally motivated) इन्फरेंस-टाइम हस्तक्षेप का प्रस्ताव करता है जो रिवॉर्ड मॉडल्स में पूर्वाध-सहसंबंधित न्यूरॉन सक्रियणों को दबाकर प्रतिक्रिया की लंबाई जैसे अप्रासंगिक लक्षणों के प्रति संवेदनशीलता को कम करता है, जिससे छोटे मॉडल्स बिना किसी समझौते के अत्याधुनिक 70B मॉडल्स के तुलनीय अलाइनमेंट प्रदर्शन प्राप्त करने में सक्षम होते हैं।