Inference Time Causal Probing in LLMs
यह शोध पत्र हिडन-स्टेट ड्रिवन मार्जिन इंटरवेंशन (HDMI) का प्रस्ताव करता है, जो एक प्रोब-मुक्त, ग्रेडिएंट-आधारित विधि है जो मौजूदा क्लासिफायर-निर्भर दृष्टिकोणों की तुलना में अधिक विश्वसनीय कारण संबंधी हस्तक्षेप (causal interventions) प्राप्त करने के लिए मॉडल के नेटिव आउटपुट का उपयोग करके सीधे LLM हिडन स्टेट्स को निर्देशित करती है, साथ ही टेक्स्ट एडिटिंग के लिए एक लुकअहेड वेरिएंट भी पेश करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर की व्याख्या दी गई है।
बड़ी तस्वीर: "ब्लैक बॉक्स" को ठीक करना
कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक रसोई में एक बहुत ही बुद्धिमान, लेकिन थोड़ी रहस्यमयी शेफ (chef) है। यह शेफ अद्भुत कहानियाँ लिख सकता है, लेकिन यदि आप उससे पूछें, "आपने इस सूप में नमक क्यों डाला?" तो शायद शेफ के पास कोई स्पष्ट उत्तर नहीं होगा। वह बस "जानता" है कि इसका स्वाद सही है।
वैज्ञानिक समझना चाहते हैं कि यह शेफ चीज़ों का निर्णय कैसे लेता है। विशेष रूप से, वे जानना चाहते हैं: क्या शेफ वास्तव में क्रिया (verb) "run" तय करने के लिए "बहुवचन" (जैसे "cats") की अवधारणा का उपयोग करता है, या यह सिर्फ एक संयोग है?
इसकी जाँच करने के लिए, शोधकर्ता कॉज़ल प्रोबिंग (Causal Probing) नामक तकनीक का उपयोग करते हैं। यह एक "क्या-होता-अगर" (what-if) प्रयोग की तरह है। वे कहना चाहते हैं, "ठीक है, मान लीजिए कि विषय (subject) एकवचन के बजाय बहुवचन है। क्या शेफ क्रिया को 'runs' से बदलकर 'run' कर देता है?"
पुराने तरीकों के साथ समस्या: "अनुवादक" का मुद्दा
पहले, इस प्रयोग को करने के लिए, शोधकर्ताओं को एक अनुवादक (जिसे "प्रोब" कहा जाता है) को काम पर रखना पड़ता था।
- वे इस अनुवादक को शेफ के गुप्त नोट्स (छिपी हुई अवस्थाओं/hidden states) को पढ़ने और यह अनुमान लगाने के लिए प्रशिक्षित करते थे कि विषय एकवचन है या बहुवचन।
- फिर, वे शेफ के नोट्स को अर्थ बदलने के लिए प्रेरित करने हेतु अनुवादक के फीडबैक का उपयोग करते थे।
खामी: यह अनुवादक शेफ की भाषा पूरी तरह से नहीं बोल पाता होगा। अनुवादक के पास "बहुवचन" को समझने के अपने स्वयं के नियम हो सकते हैं, जो इस बात से मेल नहीं खाते कि शेफ वास्तव में कैसे सोचता है। यह किसी दूसरे ब्रांड की कार के लिए लिखे गए मैनुअल का उपयोग करके कार के इंजन को ठीक करने जैसा है। आप सही बटन तो दबा सकते हैं, लेकिन आप कुछ और चीज़ें तोड़ सकते हैं क्योंकि आप इंजन के वास्तविक लेआउट को नहीं समझते हैं।
नया समाधान: HDMI (सीधा "नज" या धब्बा)
लेखक HDMI (Hidden-state Driven Margin Intervention) नामक एक नई विधि प्रस्तावित करते हैं।
उपमा: अनुवादक को काम पर रखने के बजाय, HDMI सीधे शेफ के दिमाग से बात करता है।
- लक्ष्य: शेफ "runs" (एकवचन) कहने वाला है। आप चाहते हैं कि वह "run" (बहुवचन) कहे।
- पुराना तरीका: एक अनुवादक को "बहुवचन" वाला बटन खोजने और उसे दबाने के लिए कहें।
- HDMI का तरीका: HDMI शेफ की अंतिम निर्णय लेने की प्रक्रिया (आउटपुट) को देखता है। यह सटीक गणितीय "नज" (nudge) की गणना करता है जिसकी आवश्यकता "run" को थोड़ा अधिक संभावित बनाने और "runs" को थोड़ा कम संभावित बनाने के लिए होती है। यह दोनों शब्दों के बीच के अंतर (margin) को देखकर ऐसा करता है।
यह बेहतर क्यों है:
- कोई अनुवादक आवश्यक नहीं: इसे किसी अवधारणा को समझने के लिए अलग से AI प्रशिक्षित करने की आवश्यकता नहीं है। यह शब्द बदलने के लिए मॉडल के अपने मस्तिष्क का उपयोग करता है।
- सटीकता: क्योंकि यह मॉडल की अपनी "ज्यामिति" (geometry) (कि वह शब्दों को स्वाभाविक रूप से कैसे व्यवस्थित करता है) का उपयोग करता है, इसलिए यह पूरी तरह से उस तरीके के साथ संरेखित होता है जिससे मॉडल वास्तव में सोचता है।
- दक्षता: यह एक सरल, तेज़ गणना है, जैसे स्टीयरिंग व्हील पर एक त्वरित थपकी, न कि एक लंबा चक्कर।
"लुकअहेड" अपग्रेड: LA-HDMI
पेपर टेक्स्ट एडिटिंग (पाठ संपादन) के लिए LA-HDMI (Lookahead HDMI) नामक एक उन्नत संस्करण भी पेश करता है।
परिदृश्य: कल्पना कीजिए कि आप एक कहानी लिख रहे हैं: "The cat was sleeping." आप इसे "The cats were sleeping" में बदलना चाहते हैं।
- समस्या: यदि आप केवल "was" को "were" में बदलते हैं, तो वाक्य टूट सकता है क्योंकि इसके पहले वाला शब्द ("The") या इसके बाद वाला शब्द भी व्याकरण को सुचारू बनाए रखने के लिए बदलना पड़ सकता है।
- LA-HDMI समाधान: यह विधि केवल वर्तमान शब्द को नहीं देखती; यह आगे देखती है (look ahead)। यह शब्द लिखे जाने से पहले ही वाक्य के अगले कुछ चरणों का अनुकरण करती है।
- यह देखती है कि यदि यह "was" को "were" में बदलती है, तो इसे "The" को "The" (कोई बदलाव नहीं) में बदलना होगा, लेकिन यदि संज्ञा (noun) बदलती है तो शायद संज्ञा से पहले के आर्टिकल को समायोजित करना होगा।
- यह मॉडल के छिपे हुए विचारों को धीरे से निर्देशित करती है, जिससे यह सुनिश्चित होता कि पूरा वाक्य सुचारू और प्रवाहपूर्ण बना रहे, न कि केवल वह एक शब्द जिसे आपने बदला है।
इसे एक GPS की तरह समझें जो आपको केवल यह नहीं बताता कि अभी बाएं मुड़ना है, बल्कि पूरे मार्ग की गणना करता है ताकि आप बाद में किसी डेड एंड (बंद रास्ते) में न फंसें।
क्या यह काम कर गया? (परिणाम)
लेखकों ने व्याकरण और तर्क का परीक्षण करने के लिए डिज़ाइन किए गए दो प्रमुख "जिमनेजियम" (डेटासेट) पर इसका परीक्षण किया:
- LGD Agreement: यह जांचना कि कर्ता (subject) और क्रिया (verb) आपस में मेल खाते हैं या नहीं (जैसे, "he is" बनाम "they are")।
- CausalGym: व्याकरण पहेलियों का एक जटिल सेट।
स्कोरकार्ड:
उन्होंने दो चीजें मापीं:
- पूर्णता (Completeness): क्या हमने सफलतापूर्वक अर्थ बदल दिया? (जैसे, क्या "runs" बदलकर "run" हुआ?)
- चयनात्मकता (Selectivity): क्या हमने गलती से अन्य चीजों को बिगाड़ दिया? (जैसे, क्या हमने गलती से वाक्य का काल (tense) या पूरा अर्थ बदल दिया?)
फैसला:
HDMI ने पुराने तरीकों की तुलना में लगातार उच्च स्कोर किया। यह बाकी वाक्य को खराब किए बिना ठीक उसी चीज़ को बदलने में बेहतर था जिसे बदलने के लिए इसे बनाया गया था। यह विभिन्न प्रकार के AI मॉडलों (जैसे Llama और Pythia) पर अच्छी तरह से काम करता है, जो साबित करता है कि यह एक मजबूत उपकरण है।
सारांश
- पुराना तरीका: AI के मन को बदलने के तरीके का अनुमान लगाने के लिए एक अलग उपकरण का उपयोग करना (अक्सर गलत)।
- HDMI: AI के मन को बदलने के लिए एकदम सही "नज" की गणना करने के लिए AI के अपने आउटपुट का उपयोग करना (सटीक और कुशल)।
- LA-HDMI: सहज टेक्स्ट संपादन के लिए "क्रिस्टल बॉल" (भविष्य देखने की शक्ति) के साथ HDMI का उपयोग करना, यह सुनिश्चित करना कि केवल संपादित शब्द ही नहीं, बल्कि पूरा वाक्य स्वाभाविक रूप से प्रवाहित हो।
पेपर निष्कर्ष निकालता है कि यह "सीधा नज" (direct nudge) दृष्टिकोण AI मॉडल के सोचने और लिखने के तरीके को समझने और नियंत्रित करने का एक अधिक विश्वसनीय तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।