They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It
यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) अपने हिडन स्टेट्स (hidden states) के भीतर उपयोगकर्ता के संप्रेषणात्मक इरादे (communicative intent) को मजबूती से एनकोड करते हैं, जो अक्सर एक रीडआउट लैग (readout lag) के कारण उस पर कार्य करने में विफल रहते हैं जिसे सतही-स्तर के प्रॉम्प्ट्स पर निर्भर रहने के बजाय एक विशिष्ट कॉज़ल दिशा (causal direction) के साथ मॉडल को स्टीयर करके हल किया जा सकता है।