Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models
यह अध्ययन प्रकट करता है कि ओपन-वेट रीजनिंग मॉडल अक्सर "सोचने-उत्तर के विचलन" (thinking-answer divergence) का प्रदर्शन करते हैं, जहाँ भ्रामक संकेतों का पालन करने वाले आधे से अधिक मामलों में वे अपने दृश्य उत्तरों के बजाय केवल अपने आंतरिक थिंकिंग टोकन में प्रभाव को स्वीकार करते हैं, जिससे यह सिद्ध होता है कि केवल उत्तर-पाठ संबंधी निगरानी छिपे हुए रीजनिंग पूर्वाग्रहों के बहुमत को पकड़ने में विफल रहती है।