Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States
यह शोध पत्र यह प्रदर्शित करता है कि जबकि LLM हिडन स्टेट्स (hidden states) पर लीनियर प्रोब्स (linear probes), निगमनात्मक (deductive), आगमनात्मक (inductive) और अपगमनात्मक (abductive) तर्क कार्यों के बीच अंतर करने में उच्च सटीकता प्राप्त करते हैं, यह पृथक्करण तर्क के विशिष्ट कम्प्यूटेशनल निरूपणों के बजाय पूरी तरह से कार्य प्रारूप के भ्रमों (task format confounds) द्वारा संचालित होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
मुख्य प्रश्न: क्या AI के दिमाग में अलग-अलग "मोड्स" (Modes) होते हैं?
कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक शेफ (Chef) खाना कैसे बनाता है। आप देखते हैं कि जब वे सलाद बनाते हैं, तो वे हरा एप्रन पहनते हैं, और जब वे स्टेक ग्रिल करते हैं, तो वे लाल एप्रन पहनते हैं। आप अनुमान लगा सकते हैं, "आह! हरा एप्रन मतलब वे 'सलाद रणनीति' का उपयोग कर रहे हैं, और लाल एप्रन मतलब वे 'स्टेक रणनीति' का उपयोग कर रहे हैं।"
शोधकर्ता बिल्कुल यही काम लार्ज लैंग्वेज मॉडल्स (LLMs) के साथ कर रहे हैं। वे AI की "हिडन स्टेट्स" (उसकी आंतरिक मस्तिष्क गतिविधि) को देखते हैं और एक सरल टेस्ट, जिसे लीनियर प्रोब (Linear Probe) कहा जाता है, का उपयोग यह देखने के लिए करते हैं कि क्या AI अलग-अलग "तर्क मोड" (जैसे कि निगमन/Deductive, आगमन/Inductive, और अपोहन/Abductive) के बीच स्विच करता है—ठीक वैसे ही जैसे एक शेफ एप्रन बदलता है।
लंबे समय तक, डेटा एकदम सटीक लग रहा था। "हरा एप्रन" (Deductive कार्य) और "लाल एप्रन" (Inductive कार्य) AI के मस्तिष्क के बिल्कुल अलग हिस्सों में थे। शोधकर्ताओं ने सोचा, "बहुत बढ़िया! AI ने अलग-अलग प्रकार की सोच के लिए अलग-अलग आंतरिक सर्किट बना लिए हैं।"
यह शोध पत्र कहता है: "रुकिए। आप सोच को नहीं देख रहे हैं; आप केवल वर्दी (Uniform) को देख रहे हैं।"
जाँच: वास्तव में क्या हो रहा है?
शोधकर्ताओं ने तीन अलग-अलग प्रकार की तर्क पहेलियों (Logic Puzzles) का उपयोग करके AI (विशेष रूप से Qwen3-14B नामक मॉडल) का बारीकी से निरीक्षण किया:
- Deductive (निगमन): तर्क संबंधी पहेलियाँ (जैसे गणित का कोई प्रमाण)।
- Inductive (आगमन): विज्ञान से जुड़े प्रश्न (पैटर्न खोजना)।
- Abductive (अपोहन): रहस्य सुलझाना (सबसे अच्छा स्पष्टीकरण अनुमान लगाना)।
उन्होंने पाया कि AI की मस्तिष्क गतिविधि प्रत्येक प्रकार के लिए पूरी तरह से अलग दिख रही थी। लेकिन उन्हें संदेह हुआ कि यह एक धोखा हो सकता है।
"वर्दी" का भ्रम (The "Uniform" Confusion)
इसे इस तरह समझें:
- Deductive पहेलियाँ एक ऐसी वेबसाइट से आई थीं जहाँ हर प्रश्न में 4 संभावित उत्तर और एक लंबी कहानी होती है।
- Inductive पहेलियाँ एक दूसरी वेबसाइट से आई थीं जहाँ हर प्रश्न में भी 4 संभावित उत्तर होते हैं लेकिन वैज्ञानिक शब्दों का उपयोग होता है।
- Abductive पहेलियाँ एक तीसरी वेबसाइट से आई थीं जहाँ हर प्रश्न में केवल 2 संभावित उत्तर होते हैं और वह बहुत छोटा होता है।
शोधकर्ताओं ने महसूस किया कि AI अनिवार्य रूप से अपनी सोचने की शैली नहीं बदल रहा था। इसके बजाय, वह केवल प्रश्न के फॉर्मेट (Format) पर प्रतिक्रिया दे रहा था। यह ऐसा ही था जैसे शेफ हरा एप्रन इसलिए नहीं पहनता क्योंकि वह सलाद बना रहा है, बल्कि इसलिए क्योंकि जिस रसोई में सलाद बनाया जा रहा है, वह हरी रंग की है।
तीन परीक्षण (जासूसी का काम)
अपने सिद्धांत को सिद्ध करने के लिए, शोधकर्ताओं ने तीन विशिष्ट परीक्षण चलाए:
1. "वर्दी उतारने" वाला परीक्षण (Residual Analysis)
उन्होंने AI की मस्तिष्क गतिविधि ली और गणितीय रूप से फॉर्मेट के विवरणों (जैसे कितने उत्तर थे, टेक्स्ट कितना लंबा था, और प्रश्न किस वेबसाइट से आया था) को "धो दिया" (Wash out)।
- परिणाम: एक बार जब उन्होंने "वर्दी" (फॉर्मेट) को हटा दिया, तो "हरा एप्रन" और "लाल एप्रन" गायब हो गए। तीनों कार्यों के लिए मस्तिष्क की गतिविधि बिल्कुल एक जैसी हो गई। वह सटीक अलगाव खत्म हो गया और रैंडम चांस (Random Chance) के स्तर पर आ गया।
- उपमा: यदि आप हरा और लाल एप्रन हटा दें, तो शेफ सलाद बना रहा हो या स्टेक, वह बिल्कुल एक जैसा ही दिखता है।
2. "व्यवहार की जाँच" (Trace-Mode Agreement)
उन्होंने उन शब्दों को देखा जो AI ने समस्याओं को हल करते समय लिखे थे। क्या AI ने वास्तव में एक लॉजिक पज़ल बनाम एक मिस्ट्री (रहस्य) को हल करते समय अलग तरह से व्यवहार किया?
- परिणाम: नहीं। AI ने तीनों प्रकार की समस्याओं को सही ढंग से हल किया (86% सटीकता), लेकिन जिस तरह से उसने समाधान बताया, वह सभी के लिए लगभग एक जैसा था। उसने अपनी रणनीति नहीं बदली; उसने सब कुछ के लिए एक ही "सुपर-रणनीति" का उपयोग किया।
- उपमा: शेफ टमाटर काटने के लिए भी वही चाकू कौशल और काटने का तरीका इस्तेमाल करता है और गाजर काटने के लिए भी। वे "टमाटर तकनीक" बनाम "गाजर तकनीक" का उपयोग नहीं कर रहे हैं।
3. "धक्का देने" वाला परीक्षण (Causal Steering)
शोधकर्ताओं ने AI के मस्तिष्क को एक विशिष्ट दिशा में "धकेला" ताकि उसे "Deductive Mode" या "Inductive Mode" में काम करने के लिए मजबूर किया जा सके। उन्होंने इसकी तुलना एक रैंडम दिशा में धकेलने से की।
- परिणाम: उसे "Deductive" दिशा में धकेलना, रैंडम दिशा में धकेलने से बेहतर काम नहीं कर सका। मस्तिष्क की ज्यामिति (Geometry) वास्तव में सोचने की शैली को नियंत्रित नहीं करती थी।
- उपमा: शेफ को एप्रन बदलने के लिए धक्का देकर मजबूर करने से उसके द्वारा बनाया जाने वाला खाना नहीं बदला। एप्रन का रंग केवल एक संयोग था, कारण नहीं।
निष्कर्ष
यह शोध पत्र निष्कर्ष निकालता है कि इन परीक्षणों में उच्च सटीकता यह सिद्ध नहीं करती कि AI के पास अलग-अलग आंतरिक तर्क सर्किट (Reasoning Circuits) हैं।
जब शोधकर्ता विभिन्न प्रकार के तर्क के लिए अलग-अलग डेटासेट का उपयोग करते हैं (जो कि एक मानक प्रक्रिया है), तो AI डेटासेट के फॉर्मेट (वर्दी) को पहचानना सीख जाता है, न कि कार्य के तर्क को। AI के मस्तिष्क में जो "विशिष्ट ज्यामिति" (Distinct Geometry) शोधकर्ता देखते हैं, वह केवल प्रश्न के फॉर्मेट का प्रतिबिंब है, न कि किसी विशेष सोचने के मोड का।
मुख्य बात (The Takeaway):
सिर्फ इसलिए कि एक AI का मस्तिष्क अलग-अलग कार्यों के लिए अलग दिखता है, इसका मतलब यह नहीं है कि वह अलग तरह से सोच रहा है। हो सकता है कि वह केवल एक अलग वर्दी पहने हुए हो। AI के तर्क करने के तरीके को वास्तव में समझने के लिए, हमें फॉर्मेट को हटाकर देखना होगा कि क्या वास्तव में सोच बदलती है। इस मामले में, AI सभी प्रकार की लॉजिक समस्याओं को हल करने के लिए एक शक्तिशाली, समान रणनीति का उपयोग करता है, न कि विशेष मोड के बीच स्विच करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।