Instrument Effects in Language-Model Honesty Evaluation: An Auditable Single-System Demonstration
यह शोध पत्र यह प्रदर्शित करता है कि भाषा-मॉडल की ईमानदारी का मूल्यांकन उपकरण डिजाइन के विकल्पों—जैसे कि निर्णय व्याकरण (verdict grammar), प्रकटीकरण स्पष्टता और रन स्थिरता—के प्रति अत्यधिक संवेदनशील है, न कि निश्चित मॉडल प्रवृत्तियों को दर्शाता है, जिससे भविष्य के आकलन के लिए एक कठोर, ऑडिट योग्य अखंडता प्रोटोकॉल का समर्थन मिलता है।