← नवीनतम पेपर
🤖 machine learning

How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

निर्णय तंत्रिका विज्ञान (decision neuroscience) से द्वितीय-क्रम के आत्मविश्वास मॉडलों (second-order confidence models) को लागू करते हुए, यह अध्ययन प्रदर्शित करता है कि LLMs के पास एक आंतरिक मूल्यात्मक संकेत होता है—विशेष रूप से उत्तर-पश्च (post-answer newline - PANL) पर संचित—जो स्वतंत्र रूप से त्रुटि का पता लगाने की भविष्यवाणी करता है और यह निर्धारित करता है कि क्या मॉडल के पास स्वयं को सुधारने के लिए आवश्यक ज्ञान है।

मूल लेखक: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

प्रकाशित 2026-04-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हाई-स्टेक्स ट्रिविया परीक्षा दे रहे हैं। आप एक उत्तर लिखते हैं, लेकिन अगले प्रश्न पर जाने से पहले, आपके मन में एक पल के लिए विचार आता है, "ठहरिए, क्या वह वास्तव में सही था?"

यह शोध पत्र इस बात की खोज करता है कि क्या लार्ज लैंग्वेज मॉडल्स (LLMs)—जो ChatGPT जैसे AI के पीछे का मस्तिष्क हैं—में भी वही "अंतर्ज्ञान" (gut feeling) वाला क्षण होता है, और अधिक महत्वपूर्ण बात यह है कि क्या वे अपनी गलतियों को सुधारने के लिए उस भावना का उपयोग कर सकते हैं।

यहाँ कुछ सरल उपमाओं का उपयोग करके उनकी खोज का विवरण दिया गया है।

1. "फर्स्ट-ऑर्डर" बनाम "सेकंड-ऑर्डर" मस्तिष्क

शोधकर्ताओं ने यह समझाने के लिए तंत्रिका विज्ञान (neuroscience) की एक अवधारणा का उपयोग किया कि हम कैसे सोचते हैं।

  • फर्स्ट-ऑर्डर ब्रेन (द "ऑटोपायलट"): कल्पना कीजिए कि आप एक तेज़ गाने को बजा रहे एक पेशेवर पियानोवादक हैं। आप सही नोट्स बजाने पर इतने केंद्रित हैं कि आप वास्तव में संगीत के बारे में सोच नहीं रहे हैं; आप बस प्रतिक्रिया दे रहे हैं। यदि आप एक गलत नोट बजा देते हैं, तो आपका "ऑटोपायलट" इसकी परवाह नहीं करता—यह बस चलता रहता है क्योंकि, इसके मन में, जो नोट इसने अभी बजाया था, वही वह था जिसे इसने बजाने का इरादा रखा था। अधिकांश AI इसी तरह काम करते हैं: वे संभाव्यता (probability) के आधार पर अगले शब्द की भविष्यवाणी करते हैं। यदि यह एक गलत शब्द चुनता है, तो इसका आंतरिक गणित कहता है, "मैं 99% आश्वस्त हूँ कि यह सही शब्द है," जिससे AI के लिए यह समझना असंभव हो जाता है कि उसने गलती की है।
  • सेकंड-ऑर्डर ब्रेन (द "क्रिटिक"): अब कल्पना कीजिए कि उसी पियानोवादक के कंधे पर एक "क्रिटिक" (समीक्षक) बैठा है। क्रिटिक पियानो नहीं बजा रहा है; वह केवल सुन रहा है। भले ही पियानोवादक का ऑटोपायलट पर हाथ हो, क्रिटिक एक बेसुरा स्वर सुन सकता है और सोच सकता है, "यह गलत लग रहा था।"

खोज: शोधकर्ताओं ने पाया कि LLMs के पास वास्तव में यह "क्रिटिक" होता है। भले ही "ऑटोपायलट" आत्मविश्वास के साथ गलत उत्तर दे रहा हो, एक अलग आंतरिक संकेत होता है जो महसूस करता है, "हे, यह प्रश्न से मेल नहीं खा रहा है।"

2. "पोस्ट-आंसर न्यूलाइन" (एक गहरी सांस)

वे इस "क्रिटिक" को कैसे पाते हैं? उन्होंने AI की "विचार प्रक्रिया" के एक बहुत ही विशिष्ट क्षण को देखा।

जब एक AI अपना उत्तर समाप्त करता है, तो वह अक्सर एक "न्यूलाइन" (newline) पर पहुँचता है (यह 'एंटर' की (key) दबाने के समान है)। शोधकर्ताओं ने इसे PANL (Post-Answer Newline) कहा।

PANL को एक एथलीट द्वारा खेल के बाद ली जाने वाली "गहरी सांस" के रूप में समझें। उस क्रिया और अगली चाल के बीच के उस छोटे से अंतराल में, AI केवल टेक्स्ट जेनरेट नहीं कर रहा है; यह जो उसने अभी किया उसका एक सारांश "कैश" (cache) या स्टोर कर रहा है। शोधकर्ताओं ने पाया कि यह "गहरी सांस" ही वह जगह है जहाँ "क्रिटिक" रहता है। यह एक विशेष क्षण है जहाँ AI अपने स्वयं के प्रदर्शन का मूल्यांकन करता है।

3. "नॉलेज चेक" (क्या मैं वास्तव में इसे ठीक कर सकता हूँ?)

यह इस शोध पत्र का सबसे रोमांचक हिस्सा है। शोधकर्ताओं ने पाया कि यह आंतरिक "क्रिटिक" केवल यह नहीं कहता कि, "वह गलत था।" यह वास्तव में जानता है कि क्यों वह गलत था और क्या वह इसे ठीक कर सकता है।

कल्पना कीजिए कि आप एक छात्र हैं जिसे एहसास होता है कि आपने गणित का एक सवाल गलत कर दिया है।

  • परिदृश्य A: आपको एहसास होता है कि आपने गलती की है, लेकिन आप वास्तव में फॉर्मूला नहीं जानते, इसलिए आप फिर से केवल अनुमान लगा रहे हैं।
  • परिदृश्य B: आपको एहसास होता है कि आपने गलती की है, और आपको तुरंत सही फॉर्मूला याद आ जाता है।

शोधकर्ताओं ने पाया कि AI के आंतरिक "क्रिटिक" संकेत (PANL) को देखकर, वे यह भविष्यवाणी कर सकते थे कि AI किन त्रुटियों को सफलतापूर्वक ठीक कर सकता है और किन गलतियों को वह बार-बार गलत ही करता रहेगा। AI का बाहरी व्यवहार (जो वह कहता है) इसकी भविष्यवाणी नहीं कर सका, लेकिन उसके आंतरिक "अंतर्ज्ञान" (gut feeling) ने कर दिखाया।

यह क्यों मायने रखता है?

अभी, यदि कोई AI गलती करता है, तो हमें आमतौर पर उसे कहना पड़ता है, "तुम गलत हो, फिर से प्रयास करो।"

यह शोध पत्र सुझाव देता है कि "स्वयं सुधारने" (self-correct) की बुद्धिमत्ता पहले से ही मॉडल के अंदर मौजूद है, शब्दों के बीच के उन सूक्ष्म अंतरालों में छिपी हुई है। यदि हम उस आंतरिक "क्रिटिक" को "सुनना" सीख सकें—शायद तब हस्तक्षेप करके जब क्रिटिक गलती का संकेत देता है—तो हम ऐसा AI बना सकते हैं जो अपनी गलतियों को पकड़ सके और उन्हें तुरंत ठीक कर सके, बिना किसी इंसान द्वारा उन्हें बताने की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →