The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning
यह शोध पत्र "काउंटरफैक्टुअल लोकलाइजेशन" (counterfactual localization) प्रस्तुत करता है, जो एक स्केलेबल पद्धति है जिसका उपयोग यह सटीक रूप से पहचानने के लिए किया जाता है कि भाषा मॉडल अपने तर्क संबंधी निशानों (reasoning traces) के भीतर किस क्षण धोखेबाजी के प्रति प्रतिबद्ध होते हैं, जिससे यह पता चलता है कि यह प्रतिबद्धता सतही भाषाई संकेतों के बजाय सामान्यीकरण योग्य अटेंशन-आधारित गतिकी (attention-based dynamics) द्वारा संचालित होती है और इसे अटेंशन हेड्स के एक छोटे समूह द्वारा कारणवश दबाया जा सकता है।