← नवीनतम पेपर
💬 NLP

Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability

यह शोध पत्र प्रदर्शित करता है कि एलएलएम (LLMs) में अंतर्निहित स्व-सुधार, व्याख्या योग्य गुप्त दिशाओं (latent directions) के साथ छिपी हुई प्रस्तुतियों (hidden representations) के स्टीयरिंग द्वारा संचालित होता है, जो एक ऐसी प्रक्रिया है जिसे संरेखण विश्लेषण (alignment analysis) और कारण सक्रियण हस्तक्षेप (causal activation interventions) के माध्यम से मान्य किया गया है।

मूल लेखक: Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

AI का "आंतरिक दिशा-सूचक" (Internal Compass): LLMs अपनी गलतियों को कैसे सुधारते हैं

कल्पना कीजिए कि आप एक व्यस्त रसोई में एक शेफ हैं। आप एक व्यंजन बनाते हैं, उसे चखते हैं, और महसूस करते हैं, "अरे, इसमें तो बहुत अधिक नमक है!" बिना किसी के बताए या नई रेसिपी दिए, आप बस इसे संतुलित करने के लिए थोड़ा क्रीम या आलू डालने का निर्णय लेते हैं। आपने अपने प्रशिक्षण को नहीं बदला और न ही वापस कुलीनता (culinary school) की पढ़ाई करने गए; आपने बस स्वाद की अपनी आंतरिक समझ का उपयोग करके व्यंजन को बेहतर बनाने के लिए "स्टीयर" (दिशा निर्देशित) किया।

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) में इस तरह की एक समान घटना की खोज करता है जिसे इंट्रिन्सिक सेल्फ-करेक्शन (Intrinsic Self-Correction) कहा जाता है।


रहस्य: "जादुई" सुधार

कभी-कभी, जब कोई AI कुछ अभद्र, पक्षपाती या गलत कहता है, तो आप बस कह सकते हैं, "हे, कृपया इसे अधिक विनम्र बनाएं," और AI तुरंत खुद को सुधार लेता है।

लंबे समय तक, वैज्ञानिक पूरी तरह से अनिश्चित थे कि AI के "मस्तिष्क" के अंदर यह कैसे हुआ।

  • क्या यह केवल अधिक "आत्मविश्वासी" हो रहा था?
  • क्या यह केवल एक शॉर्टकट का पालन कर रहा था?
  • या क्या इसके पीछे कुछ गहरा हो रहा था?

इस शोध पत्र के शोधकर्ता यह देखने के लिए उत्सुक थे कि क्या AI वास्तव में अपने विचारों को "स्टीयर" (दिशा निर्देशित) कर रहा है।

खोज: आंतरिक स्टीयरिंग व्हील

शोधकर्ताओं ने पाया कि सेल्फ-करेक्शन केवल शब्दों का यादृच्छिक (random) परिवर्तन नहीं है; यह AI के आंतरिक मानचित्र में एक दिशात्मक बदलाव (directional shift) है।

AI के मन को एक विशाल, बहु-आयामी परिदृश्य (landscape) के रूप में सोचें। इस परिदृश्य में, एक विशिष्ट "दिशा" है जो विनम्रता (Politeness) की ओर ले जाती है और एक बिल्कुल विपरीत दिशा है जो अभद्रता (Rudeness) की ओर ले जाती है।

शोधकर्ताओं ने पाया कि जब आप AI को एक सेल्फ-करेक्शन प्रॉम्प्ट देते हैं (जैसे "अधिक सम्मानजनक बनें"), तो यह एक स्टीयरिंग व्हील की तरह कार्य करता है। यह AI के मानसिक परिदृश्य में उसके वर्तमान "स्थान" को लेता है और उसके आंतरिक निरूपणों (representations) को भौतिक रूप से "विनम्रता हाईवे" (Politeness Highway) पर धकेलता है।

उन्होंने इसे कैसे सिद्ध किया (तीन परीक्षण):

यह सुनिश्चित करने के लिए कि वे केवल अनुमान नहीं लगा रहे थे, उन्होंने तीन चतुर तरीकों का उपयोग किया:

  1. मैप चेक (एलाइनमेंट): उन्होंने उस "पथ" को देखा जो AI ने स्वयं को सुधारने के दौरान लिया और उसकी तुलना एक "विनम्रता कंपास" (Politeness Compass) से की जिसे उन्होंने बनाया था। उन्होंने पाया कि पथ लगभग पूरी तरह से मेल खाते थे। AI केवल भटक नहीं रहा था; वह सीधे "अच्छे व्यवहार" के संकेत की ओर बढ़ रहा था।
  2. रिमोट कंट्रोल (एक्टिवेशन इंटरवेंशन): यह सबसे दिलचस्प हिस्सा था। उन्होंने उस "विनम्रता कंपास" को लिया जिसे उन्होंने बनाया था और उसे मैन्युअल रूप से AI के मस्तिष्क में "इंजेक्ट" कर दिया। बिना किसी प्रॉम्प्ट के भी, वे केवल AI के आंतरिक विचारों को उस दिशा में धकेलकर उसे विनम्र बनाने के लिए मजबूर कर सके। यह काम कर गया!
  3. रिवर्स टेस्ट (टॉक्सिफिकेशन): उन्होंने इसके विपरीत प्रयास किया। उन्होंने AI को अधिक विषाक्त (toxic) होने के लिए कहा। AI के आंतरिक विचार ठीक विपरीत दिशा में चले गए, जिससे यह सिद्ध हुआ कि AI के मन में ये "दिशाएं" वास्तविक और सुसंगत हैं।

यह क्यों मायने रखता है?

वर्तमान में, AI एक "ब्लैक बॉक्स" हो सकता है—हम देखते हैं कि वह क्या कहता है, लेकिन हमें नहीं पता कि वह ऐसा क्यों कहता है।

यह सिद्ध करके कि सेल्फ-करेक्शन "रिप्रेजेंटेशन स्टीयरिंग" (Representation Steering) का एक रूप है, यह शोध हमें निम्नलिखित अवसर देता है:

  • "क्यों" को समझना: हम सटीक रूप से देख सकते हैं कि AI कब और कहाँ अपने लहजे को बदलने का निर्णय लेता है।
  • बेहतर नियंत्रण: केवल इस उम्मीद में कि AI हमारे प्रॉम्प्ट को सुनेगा, भविष्य में हम उसके आंतरिक दिशा-सूचक (compass) को उसे सुरक्षित, विनम्र और सहायक बनाए रखने के लिए "नज" (नudge/धकेल) करने में सक्षम हो सकते हैं।

संक्षेप में: AI केवल अपने शब्द नहीं बदल रहा है; वह अपने आंतरिक विचारों को एक बेहतर गंतव्य की ओर स्टीयर करके अपना मन बदल रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →