The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation
यह शोध पत्र "रिस्पॉन्स होमोजेनाइजेशन" (प्रतिक्रिया समरूपीकरण) को RLHF-प्रशिक्षित भाषा मॉडलों में एक महत्वपूर्ण अलाइनमेंट टैक्स के रूप में पहचानता है जो सैंपलिंग-आधारित अनिश्चितता अनुमान को अप्रभावी बनाता है, यह प्रदर्शित करता है कि टोकन एंट्रॉपी एक मजबूत संकेत बनी रहती है और चयनात्मक भविष्यवाणी सटीकता में सुधार करने के लिए एक लागत-कुशल कैस्केड रणनीति का प्रस्ताव करता है।