Do Models Know Why They Changed Their Mind? Interpretability and Faithfulness of Chain-of-Thought Under Knowledge Conflict
यह शोध पत्र प्रकट करता है कि जहाँ भाषा मॉडलों में चेन-ऑफ-थॉट तर्क मुख्य रूप से ज्ञान का एक स्थिर, निर्णय-अपरिवर्तनीय प्रदर्शन है जो ज्ञान संघर्षों के दौरान उनके विकल्पों की निष्ठापूर्वक व्याख्या करने में विफल रहता है, वहीं स्व-रेटेड आत्मविश्वास निर्णयों की भविष्यवाणी करने के लिए एक कमजोर लेकिन वास्तविक संकेत प्रदान करता है, जो यह सुझाव देता है कि तर्क संबंधी तर्कों का विश्लेषण करने की तुलना में आत्मविश्वास की निगरानी करना अधिक प्रभावी है।