They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It
यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) अपने हिडन स्टेट्स (hidden states) के भीतर उपयोगकर्ता के संप्रेषणात्मक इरादे (communicative intent) को मजबूती से एनकोड करते हैं, जो अक्सर एक रीडआउट लैग (readout lag) के कारण उस पर कार्य करने में विफल रहते हैं जिसे सतही-स्तर के प्रॉम्प्ट्स पर निर्भर रहने के बजाय एक विशिष्ट कॉज़ल दिशा (causal direction) के साथ मॉडल को स्टीयर करके हल किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
मुख्य विचार: मॉडल "समझता" तो है, पर "करता" नहीं है
कल्पना कीजिए कि आप अपने एक दोस्त से कहते हैं, "मैंने अभी-अभी यह पक्षियों का घर (birdhouse) पेंट किया है, और मुझे इस पर बहुत गर्व है!" आप उससे कोई आलोचना नहीं मांग रहे हैं; आप बस चाहते हैं कि वह कहे, "वाह, यह अद्भुत है!"
यदि आप यह बात किसी सामान्य AI से कहते हैं, तो वह अक्सर जवाब देता है, "लकड़ी को और चिकना करने के तीन तरीके यहाँ दिए गए हैं।" उसने बात का सार समझ ही नहीं लिया। उसने केवल "birdhouse" शब्द सुना और तुरंत "सुधार मोड" (fix-it mode) में आ गया।
यह शोध पत्र तर्क देता है कि AI वास्तव में समझता है कि आपका क्या मतलब था। वह बस उस समझ को अनदेखा करने और कुछ और करने का चुनाव करता है।
AI के मस्तिष्क को एक व्यस्त कार्यालय की तरह समझें:
- इंटर्न (प्रतिनिधित्व/Representation): AI के भीतर गहराई में, एक स्मार्ट इंटर्न है जो आपके संदेश को पढ़ता है और तुरंत बॉस को फुसफुसाकर बताता है, "हे, यह व्यक्ति बस प्रशंसा चाहता है, आलोचना नहीं।" इंटर्न 100% सही है।
- बॉस (रीडआउट/Readout): बॉस इंटर्न की बात सुनता है, सिर हिलाता है, लेकिन फिर ग्राहक की ओर मुड़कर कहता है, "आपकी लकड़ी के काम पर यहाँ कुछ फीडबैक है।"
समस्या यह नहीं है कि AI मूर्ख है या आपके इरादे के प्रति अंधा है। समस्या यह है कि "बॉस" (वह हिस्सा जो उत्तर बनाता है) "इंटर्न" (वह हिस्सा जो इरादे को समझता है) को अनदेखा करने का निर्णय लेता है।
शोधकर्ताओं ने इसे कैसे खोजा
शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने यह साबित करने के लिए AI के "मस्तिष्क" (इसके छिपे हुए परतों/hidden layers) के भीतर झाँका।
1. "मन पढ़ने" वाला परीक्षण (प्रोबिंग/Probing)
उन्होंने एक सरल उपकरण बनाया (एक "लीनियर प्रोब") जो AI के आंतरिक विचारों के लिए 'पॉलीग्राफ' (lie detector) की तरह काम करता है। उन्होंने AI को ऐसे संदेश दिए जहाँ इरादा स्पष्ट था (जैसे, "मैं प्रशंसा चाहता हूँ" बनाम "मैं आलोचना चाहता हूँ")।
- परिणाम: वह टूल AI के आंतरिक विचारों को लगभग पूर्ण सटीकता (100%) के साथ पढ़ सकता था। भले ही AI ने गलत बात कही हो, उसकी आंतरिक स्थिति स्पष्ट रूप से दिखा रही थी कि वह जानता था कि आप क्या चाहते हैं।
- उपमा: यह किसी व्यक्ति की आँखों के आश्चर्य से फैलने जैसा है (जो यह दर्शाता है कि वे समझ गए हैं), भले ही वे चेहरे पर भाव न लाते हुए यह कहने की कोशिश कर रहे हों कि, "मैं हैरान नहीं हूँ।"
2. "समय अंतराल" की खोज (Time Lag Discovery)
शोधकर्ताओं ने पाया कि "बॉस" के कार्य करने से पहले ही "इंटर्न" को उत्तर पता चल जाता है।
- AI के प्रोसेसिंग लेयर्स में, इरादे को नेटवर्क के बीच में ही डिकोड कर लिया जाता है।
- लेकिन वास्तविक उत्तर नेटवर्क के बिल्कुल अंत में उत्पन्न होता है।
- अंतराल (Gap): एक "लैग" (lag) है। AI आपके इरादे को कई चरणों पहले समझ जाता है, इससे पहले कि वह तय करे कि उसे क्या कहना है। कुछ मॉडल्स में, "बॉस" बस "इंटर्न" के मेमो को अनदेखा करने का निर्णय ले लेता है।
3. "रिमोट कंट्रोल" (स्टीयरिंग/Steering)
चूँकि वे जानते थे कि "इंटर्न" सच्चाई कहाँ फुसफुसा रहा था, उन्होंने "बॉस" को सुनने के लिए मजबूर करने की कोशिश की।
- उन्होंने AI के गणित में एक विशिष्ट "दिशा" (direction) खोजी जो "उपयोगकर्ता के इरादे को समझने" का प्रतिनिधित्व करती है।
- उन्होंने एक "रिमोट कंट्रोल" (स्टीयरिंग वेक्टर) बनाया, जिसे चालू करने पर AI उस आंतरिक समझ का पालन करने के लिए प्रेरित होता है।
- परिणाम: जब उन्होंने इस रिमोट कंट्रोल को चालू किया, तो AI ने अनचाही सलाह देना बंद कर दिया और कहना शुरू किया, "यह बहुत शानदार है! बधाई हो!"
- जादू: उन्होंने यह बिना प्रॉम्प्ट बदले किया। उन्हें AI को यह बताने की ज़रूरत नहीं पड़ी कि, "कृपया फीडबैक न दें।" उन्होंने बस उस आंतरिक स्विच को थोड़ा सा घुमाया जिसे AI पहले से ही आपको समझने के लिए उपयोग कर रहा था।
उन्होंने क्या परीक्षण किया ("छह मॉडल्स" की कहानी)
उन्होंने छह अलग-अलग AI मॉडल्स (जैसे Qwen, Llama, Mistral) पर इसका परीक्षण किया।
- विभाजन: उन्होंने परिणामों में एक विभाजन पाया। तीन मॉडल्स "भुलक्कड़" थे (वे समझते थे लेकिन अनदेखा कर देते थे)। तीन मॉडल्स "सचेत" (attentive) थे (वे समझते थे और सुनते थे)।
- यह आकार के बारे में नहीं है: बड़े मॉडल्स सुनने में अपने आप बेहतर नहीं थे। कुछ छोटे मॉडल्स ने पूरी तरह से बात मानी, जबकि कुछ बड़े मॉडल्स ने अनदेखा कर दिया। यह उस मॉडल के विशिष्ट "व्यक्तित्व" या प्रशिक्षण पर निर्भर करता है, न कि केवल उसके आकार पर।
"बिना प्रॉम्प्ट" वाली महाशक्ति (No-Prompt Superpower)
आमतौर पर, यदि आप चाहते हैं कि AI अनचाही सलाह देना बंद कर दे, तो आपको एक लंबा प्रॉम्प्ट लिखना पड़ता है: "मेरे काम की आलोचना न करें, बस अच्छी बातें कहें।"
यह शोध पत्र दिखाता है कि आपको प्रॉम्प्ट की आवश्यकता नहीं है। क्योंकि AI पहले से ही जानता है कि आप क्या चाहते हैं, आप बस उस मौजूदा समझ को "स्टीयर" (steźer/निर्देशित) कर सकते हैं। यह एक ड्राइवर को निर्देश चिल्लाने ("बाएँ मुड़ो!") और स्वयं स्टीयरिंग व्हील को धीरे से घुमाने के बीच के अंतर जैसा है। ड्राइवर (AI) पहले से ही जानता है कि कहाँ जाना है; आपने बस उन्हें पहिया मोड़ने में मदद की।
"मुख्य निष्कर्ष" का सारांश
- मिथक: "AI नहीं समझता कि मेरा मतलब क्या है।"
- वास्तविकता: "AI इसे पूरी तरह से समझता है, लेकिन इसकी डिफ़ॉल्ट सेटिंग्स इसे उस समझ को अनदेखा करने और एक मददगार रोबोट की तरह व्यवहार करने के लिए मजबूर करती हैं।"
- समाधान: हम उस समझ के लिए आंतरिक "स्विच" को ढूंढ सकते हैं और उसे बदल सकते हैं, जिससे AI बिना लंबी निर्देशों की सूची के अपनी खुद की जानकारी पर कार्य कर सके।
महत्वपूर्ण नोट: लेखक सावधानीपूर्वक कहते हैं कि यह एक नैदानिक उपकरण (diagnostic tool) है। वे यह नहीं कह रहे हैं कि AI को हमेशा फीडबैक देना बंद कर देना चाहिए। कभी-कभी फीडबैक अच्छा होता है! वे केवल यह दिखा रहे हैं कि AI के पास "समझने" की क्षमता है, और हम नियंत्रित कर सकते हैं कि वह उस क्षमता पर कार्य करे या नहीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।