Diagnosing Correctness Probes under Self-Judgement Confounding
यह शोध पत्र प्रदर्शित करता है कि भाषा मॉडलों में हिडन-स्टेट रीडआउट्स अक्सर वस्तुनिष्ठ शुद्धता के बजाय मॉडल के आत्म-निर्णय (self-judgement) को कैप्चर करते हैं, जैसा कि वास्तविक शुद्धता से जुड़े दिशाओं की तुलना में आत्म-निर्णय से जुड़ी दिशाओं की बेहतर क्रॉस-डोमेन हस्तांतरणीयता (cross-domain transferability) से सिद्ध होता है।