← नवीनतम पेपर
💬 NLP

Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning

यह शोध पत्र चेन-ऑफ-थॉट रीजनिंग (Chain-of-Thought reasoning) में एक दो-चरणीय एंट्रॉपी संरचना को प्रकट करता है—जिसमें अनिश्चितता अन्वेषण चरण (uncertainty exploration phase) और उच्च-अतिरेक आत्मविश्वास चरण (high-redundancy confidence phase) शामिल हैं—और संक्रमण बिंदु का पता लगाने के लिए CUSUM एल्गोरिदम का लाभ उठाता है, जो अर्ली-एग्जिट दक्षता (early-exit efficiency) और टेस्ट-टाइम स्केलिंग सटीकता (test-time scaling accuracy) दोनों में महत्वपूर्ण सुधार करने वाला एक प्रशिक्षण-मुक्त ढांचा सक्षम करता है।

मूल लेखक: Ting Xu, Xu He, Yupu Lu, Jiankai Sun, Dong Li, Wai Lam, Jianye Hao

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ting Xu, Xu He, Yupu Lu, Jiankai Sun, Dong Li, Wai Lam, Jianye Hao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस को रहस्य सुलझाते हुए देख रहे हैं। कभी-कभी वह जासूस अपराध स्थल के आसपास घूमता है, अजीबोगरीब सिद्धांतों को आजमाता है, गलत रास्तों की जांच करता है, और लगातार अपना विचार बदलता रहता है। यह अनिश्चितता क्षेत्र (Uncertainty Region) है। अन्य समय में, उसे अचानक एक "आहा!" वाला क्षण मिलता है, वह अपराधी को पकड़ लेता है, और अपनी अंतिम रिपोर्ट लिखना शुरू कर देता है। यह विश्वास क्षेत्र (Confidence Region) है।

यह शोध पत्र एक वैज्ञानिक की तरह है जिसने एक जासूस (AI) पर "मन पढ़ने वाला" सेंसर लगाया है ताकि यह माप सके कि वह अपने सोचने की प्रक्रिया के हर एक कदम पर कितना भ्रमित या आश्वस्त है। उन्होंने क्या पाया, इसका सरल विवरण यहाँ दिया गया है:

1. सोचने का दो-चरणीय नृत्य (Two-Phase Dance of Thinking)

शोधकर्ताओं ने पाया कि AI केवल सोचने के साथ धीरे-धीरे स्मार्ट नहीं होता है। इसके बजाय, इसकी सोच दो अलग-अलग चरणों में होती है:

  • चरण 1: अराजकता (Uncertainty Region): AI खोजबीन कर रहा है। वह कई अलग-अलग रास्ते आज़मा रहा है, और उसका "आत्मविश्वास मीटर" (जिसे एंट्रॉपी कहा जाता है) ऊँचा और अस्थिर है। यह एक छात्र की तरह है जो परीक्षा में उत्तरों का अनुमान लगा रहा है।
  • चरण 2: स्पष्टता (Confidence Region): अचानक, AI को सही रास्ता मिल जाता है। आत्मविश्वास का मीटर तेजी से गिरता है और स्थिर हो जाता है। AI ने उत्तर ढूंढ लिया है और अब वह बस उसे लिख रहा है।

बड़ा आश्चर्य: AI अक्सर चरण 2 के बहुत शुरुआती हिस्से में ही सही उत्तर ढूंढ लेता है, लेकिन वह उसके बाद लंबे समय तक बोलता रहता है। यह एक छात्र की तरह है जो गणित की समस्या को 30 सेकंड में हल कर देता है लेकिन फिर भी एक मिनट तक लिखता रहता है, जैसे "इसलिए, उत्तर 36 है... और 36 एक सम संख्या भी है... और 36 एक वर्ग भी है..."। शोध पत्र इसे उच्च अतिरेक (High Redundancy) कहता है।

2. "CUSUM" डिटेक्टर: एक स्मार्ट स्टॉपवॉच

उस क्षण को पकड़ने के लिए जब AI "अनुमान लगाने" से "जानने" की ओर स्विच करता है, लेखकों ने CUSUM नामक एक विशेष उपकरण बनाया है।

  • उपमा: एक तराजू की कल्पना करें। हर बार जब AI एक ऐसा कदम उठाता है जो दिखता है कि वह अभी भी अनुमान लगा रहा है, तो तराजू थोड़ा एक तरफ झुक जाता है। हर बार जब वह एक ऐसा कदम उठाता है जो दिखता है कि वह सुनिश्चित है, तो तराजू दूसरी तरफ झुक जाता है।
  • जादू: CUSUM टूल इन छोटे-छोटे झुकावों को जोड़ता है। जब "निश्चित" वाले झुकाव एक विशिष्ट रेखा को पार करने के लिए पर्याप्त जमा हो जाते हैं, तो टूल चिल्लाकर कहता है, "रुकिए! AI ने उत्तर ढूंढ लिया है!"
  • यह क्यों खास है: अन्य तरीकों के विपरीत जो बहुत जल्दी रुक सकते हैं (जब AI केवल थोड़े समय के लिए शांत होता है) या बहुत देर से (समय बर्बाद करते हुए), यह टूल उस सटीक स्पष्टता के क्षण को पहचानने के लिए गणितीय रूप से सबसे कुशल तरीका है।

3. इस टूल का उपयोग करने के दो तरीके

शोधकर्ताओं ने दिखाया कि यह टूल AI को दो तरह से बेहतर बना सकता है:

  • "अर्ली एग्जिट" (समय बचाना):
    कल्पना कीजिए कि आप बस का इंतज़ार कर रहे हैं। यदि आप देखते हैं कि बस स्टॉप पर आकर रुक गई है, तो आपको बस के पार्क होने, दरवाजे खोलने और यात्रियों के उतरने का इंतज़ार करने की ज़रूरत नहीं है। आप बस उसमें चढ़ सकते हैं।
    इसी तरह, जब CUSUM टूल देखता है कि AI "विश्वास क्षेत्र" में प्रवेश कर चुका है, तो वह AI को तुरंत सोचना बंद करने के लिए कहता है। यह बिना उत्तर गलत किए सोचने के समय (टोकन्स) को काफी बचा लेता है। परीक्षणों में, उन्होंने सटीकता बनाए रखते हुए सोचने के समय को लगभग 11% कम कर दिया।

  • "बेस्ट गेस" पिकर (सटीकता में सुधार):
    कभी-कभी, आप किसी समस्या को 10 बार हल करने के लिए AI को कहते हैं ताकि यह देखा जा सके कि कौन सा उत्तर सबसे अधिक बार आता है (इसे "सेल्फ-कंसिस्टेंसी" कहा जाता है)। आमतौर पर, आप केवल वोटों की गिनती करते हैं।
    लेकिन इस नए टूल के साथ, आप केवल वोटों की गिनती नहीं करते; आप उन 10 प्रयासों में से प्रत्येक के दौरान AI कितना "निश्चित" था, इसकी जांच करते हैं। यदि एक प्रयास में एक सहज, आत्मविश्वासी "आहा!" वाला क्षण (उच्च CUSUM स्कोर) था और दूसरे प्रयास में एक अस्त-व्यस्त, भ्रमित अनुमान था, तो आप आत्मविश्वासी वाले पर अधिक भरोसा करते हैं। यह अंतिम उत्तर को और भी सटीक बनाता है, खासकर जब आप AI को कई बार प्रयास करने के लिए कहते हैं।

4. उन्होंने वास्तव में क्या टेस्ट किया

शोधकर्ताओं ने तीन अलग-अलग AI मॉडल (छोटे से मध्यम-बड़े तक) पर कठिन गणित और विज्ञान के प्रश्नों (जैसे हाई स्कूल गणित प्रतियोगिताएं और स्नातक स्तर की विज्ञान क्विज़) का उपयोग करके परीक्षण किया।

  • परिणाम: उनका तरीका सटीकता खोए बिना समय बचाने में मौजूदा तरीकों से बेहतर था।
  • परिणाम: जब AI कई बार प्रयास करता है, तो सही उत्तर चुनने में उनका तरीका बेहतर था।

उन्होंने क्या दावा नहीं किया

  • उन्होंने यह नहीं कहा कि यह चिकित्सा निदान या वास्तविक दुनिया के सुरक्षा-महत्वपूर्ण निर्णयों के लिए काम करता है।
  • उन्होंने यह नहीं कहा कि यह AI को नई चीजें सीखने में "स्मार्ट" बनाता है; यह केवल इसे बात खत्म करने में मदद करता है।
  • उन्होंने यह दावा नहीं किया कि यह हर प्रकार के कार्य के लिए काम करता है, केवल उन्हीं तर्क कार्यों के लिए जिनका उन्होंने परीक्षण किया (गणित, विज्ञान, तर्क)।

संक्षेप में: शोध पत्र ने पाया कि AI की सोच में भ्रम से निश्चितता की ओर एक स्पष्ट "स्विच" होता है। उन्होंने उस स्विच को तुरंत खोजने के लिए एक गणित-आधारित डिटेक्टर बनाया है, जिससे हम AI को जल्दी रोक सकते हैं (पैसा/समय बचाना) या उसके सबसे अच्छे प्रयासों पर अधिक भरोसा कर सकते हैं (बेहतर उत्तर प्राप्त करना)।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →