← नवीनतम पेपर
🤖 AI

Valid \ne Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

यह शोध पत्र वैध लेकिन अक्षम तर्क (reasoning) के संबंध में मौजूदा चेन-ऑफ-थॉट इवैल्यूएटर्स में एक महत्वपूर्ण ब्लाइंड स्पॉट की पहचान करता है, और कई बेंचमार्क्स में सटीकता बनाए रखते हुए टोकन खपत को महत्वपूर्ण रूप से कम करने के लिए प्रशिक्षण-मुक्त CAID मेट्रिक और PACE कंप्रेशन रणनीति पेश करता है।

मूल लेखक: Daeyeop Lee, Hwanjo Yu

प्रकाशित 2026-07-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daeyeop Lee, Hwanjo Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस को रहस्य सुलझाते हुए देख रहे हैं। जासूस बुद्धिमान है, लेकिन उसकी एक अजीब आदत है: अपराधी को पकड़ने से पहले, वह जो कुछ भी सोच रहा होता है, उसे लिख डालता है। वह एक ही सुराग को तीन बार दोहराता है, एक साधारण "खिड़की की ओर देखो" वाले कदम को दस छोटे-छोटे सूक्ष्म चरणों में तोड़ देता है, और कभी-कभी यह कहने के लिए वापस आता है, "रुको, मैंने खिड़की की ओर देख लिया था," ताकि वह सुनिश्चित कर सके।

जासूस सही उत्तर तक पहुँच जाता है, इसलिए हम कहते हैं, "बहुत बढ़िया!" लेकिन यहाँ एक पेंच है: वह जासूस उन बातों को कहने के लिए बैटरी पावर और कागज का भारी मात्रा में उपयोग कर रहा है जो वास्तव में मामले को आगे नहीं बढ़ाती हैं।

यह बिल्कुल वही है जो द्येयप ली और ह्वानजो यू ने हमारे पसंदीदा बुद्धिमान एआई (AI) बॉट्स के बारे में खोजा, जिन्हें लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है। उन्होंने पाया कि हालांकि ये मॉडल "चेन-ऑफ-थॉट" (सोचने की चरण-दर-चरण प्रक्रिया) नामक विधि का उपयोग करके कठिन पहेलियों को हल करने में माहिर हैं, लेकिन वे अक्सर "ओवर-रीज़निंग" (अत्यधिक तर्क) का शिकार होते हैं। वे ऐसे चरण उत्पन्न करते हैं जो तकनीकी रूप से सत्य और तार्किक तो हैं, लेकिन पूरी तरह से बेकार की बातें (fluff) हैं। यह एक शेफ की तरह है जो एक प्याज को काटता है, फिर उसे फिर से काटता है, फिर उसे धूल में बदलने के लिए काटता है, सिर्फ यह साबित करने के लिए कि वह ऐसा कर सकता है।

"वैध लेकिन बेकार" वाला अंधा धब्बा (The "Valid but Useless" Blind Spot)

लेखकों ने महसूस किया कि इन एआई जासूसों को परखने वाले वर्तमान "रेफरी" मुख्य बिंदु को समझने में चूक रहे हैं। ये रेफरी सख्त गणित के शिक्षकों की तरह हैं जो केवल यह जाँचते हैं: "क्या यह चरण सत्य है?" यदि एआई कहता है, "आकाश नीला है," और आकाश वास्तव में नीला है, तो शिक्षक उसे गोल्ड स्टार दे देता है।

लेकिन लेखकों ने एक अलग सवाल पूछा: "क्या यह चरण वास्तव में आवश्यक है?"

उन्होंने RIV-GSM8K नामक एक विशेष परीक्षण बनाया ताकि रेफरी को चकमा दिया जा सके। उन्होंने सामान्य तर्क चरणों को लिया और उसमें गुप्त रूप से पांच प्रकार के "बेकार केपन" (fluff) को इंजेक्ट किया:

  1. सरल दोहराव (Simple Duplication): एक चरण को ठीक वैसा ही कॉपी-पेस्ट करना।
  2. पैराफ्रेज़ (Paraphrase): एक ही बात को अलग शब्दों में कहना।
  3. विखंडन (Decompose): एक सरल चरण को दस छोटे, उबाऊ चरणों में तोड़ना।
  4. वृत्ताकार तर्क (Circular Reasoning): एक ही बात को फिर से कहने के लिए एक लूप में घूमना।
  5. अप्रासंगिक (Irrelevant): एक ऐसा तथ्य जोड़ना जो सत्य तो है लेकिन समस्या से उसका कोई लेना-देना नहीं है।

चौंका देने वाला परिणाम: शीर्ष स्तर के एआई रेफरी (जैसे ReasonEval और Qwen2.5-Math-PRM) इस बेकार केपन को पहचानने में बहुत खराब थे। वे इन बेकार चरणों में से लगभग 70% से 96% को बरकरार रखते रहे, उन्हें उच्च स्कोर देते रहे क्योंकि चरण "तथ्यात्मक रूप से सत्य" थे। पेपर दिखाता है कि "सही" होने का मतलब "कुशल" होना नहीं है।

नया जासूस: CAID

इसे ठीक करने के लिए, लेखकों ने CAID (कॉन्टेक्स्ट-अवेयर इंफॉर्मेशन डेंसिटी) नामक एक नया टूल बनाया। CAID को एक अत्यंत सूक्ष्म संपादक के रूप में समझें जो केवल यह नहीं देखता कि एक वाक्य सत्य है या नहीं, बल्कि यह पूछता है, "क्या यह वाक्य वास्तव में कहानी को आगे बढ़ाता है?"

CAID बेकार केपन को खोजने के लिए चार संकेतों को देखता है:

  1. लोकल सिमिलैरिटी (Local Similarity): क्या यह चरण ठीक पिछले चरण की नकल कर रहा है?
  2. ग्लोबल गोल एलाइनमेंट (Global Goal Alignment): क्या यह चरण मूल प्रश्न से भटक रहा है?
  3. इन्फॉर्मेशन डेंसिटी (Information Density): क्या यह चरण एक लंबा, उबाऊ पैराग्राफ है जिसे एक छोटा, सटीक वाक्य बनाया जा सकता था?
  4. सिमेंटिक डेल्टा (Semantic Delta): क्या इस चरण ने वास्तव में स्थिति को बदला, या इसने बस पहिए घुमाए?

CAID एक "ट्रेनिंग-फ्री" मीट्रिक है, जिसका अर्थ है कि इसे हजारों उदाहरणों के साथ सिखाने की आवश्यकता नहीं है। यह यह मापने के लिए गणित का उपयोग करता है कि एक चरण कितनी "नई जानकारी" लाता है। यदि कोई चरण केवल "झाग" (जैसे बीयर पर दिखने वाला झाग जो खुद बीयर नहीं है) है, तो CAिड उसे पहचान लेता है।

सफाई दल: PACE

एक बार जब CAID बेकार केपन को पहचान लेता है, तो लेखक इसे साफ करने के लिए PACE (प्रूनिंग एंड कम्प्रेशन फॉर एफिशिएंसी) नामक एक रणनीति का उपयोग करते हैं। PACE दो काम करता है:

  • प्रून (Prune - छाँटना): यह उन चरणों को हटा देता है जो पूरी तरह से बेकार हैं (जैसे अप्रासंगिक तथ्य)।
  • मर्ज (Merge - मिलाना): यह उन चरणों को लेता है जो सत्य तो हैं लेकिन बहुत अधिक शब्दजाल वाले हैं और उन्हें एक संक्षिप्त, स्पष्ट संस्करण में सिकोड़ देता है।

परिणाम:
जब उन्होंने तीन अलग-अलग प्रकार की पहेलियों (गणित, सामान्य ज्ञान और विज्ञान) पर PACE का परीक्षण किया, तो परिणाम प्रभावशाली थे। PACE ने शब्दों (टोकन) की संख्या को 31% से 53% तक कम कर दिया जबकि सटीकता लगभग वैसी ही बनी रही।

  • गणित की समस्याओं (GSM8K) पर, इसने शब्दों को 31.0% बचाया जबकि सटीकता में केवल 0.91% की मामूली गिरावट आई।
  • सामान्य ज्ञान के प्रश्नों (StrategyQA) पर, इसने शब्दों को भारी मात्रा में 52.9% बचाया जबकि सटीकता में केवल 0.37% की गिरावट आई।
  • विज्ञान की चुनौतियों (ARC-Challenge) पर, इसने शब्दों को 43.6% कम करते हुए स्कोर में 0.94% का सुधार भी किया।

यह क्या खारिज करता है

लेखक बहुत सावधान थे कि यह केवल एक भाग्यशाली दुर्घटना या एक साधारण ट्रिक नहीं थी।

  • यह केवल "रैंडम डिलीशन" नहीं है: उन्होंने चरणों को यादृच्छिक रूप से हटाने का प्रयास किया, और एआई का स्कोर गिर गया। यह साबित करता है कि PACE स्मार्ट तरीके से किन चरणों को काटता है, न कि केवल अंधे होकर काटता है।
  • यह केवल "उत्तर रखना" नहीं है: उन्होंने केवल अंतिम चरण को हटाने का प्रयास किया, और स्कोर गिर गया। यह साबित करता है कि एआई को उत्तर खोजने के लिए बीच के चरणों की आवश्यकता होती है; वह केवल अनुमान नहीं लगा सकता।
  • यह केवल "बेहतर रेफरी" नहीं है: उन्होंने पुराने, मजबूत रेफरी (PRMs) का उपयोग करके काटने का प्रयास किया, और उन रेफरी ने केवल 5% से 7% शब्दों को ही काट पाए। यह साबित करता है कि पुराने रेफरी अक्षमता के प्रति अंधे हैं, जबकि CAID इसे स्पष्ट रूप से देखता है।

निचोड़ (The Bottom Line)

पेपर सुझाव देता है कि आज एआई से दिखने वाले रीजनिंग चेन अक्सर "वैध लेकिन अक्षम" चरणों से भरे होते हैं। हम एआई की गहनता की प्रशंसा कर रहे थे, जबकि वास्तव में, वह केवल बहुत अधिक बातें कर रहा था।

CAID और PACE का उपयोग करके, हम "झाग" को हटा सकते हैं और बहुत तेज़ी से "बीयर" (वास्तविक तर्क) तक पहुँच सकते हैं। लेखक नोट करते हैं कि यह वर्तमान में एक "पोस्ट-हॉक" फिक्स (एआई द्वारा लिखने के बाद सफाई करना) है, इसलिए यह अभी वास्तविक समय में एआई को तेज़ सोचने में मदद नहीं करता है। लेकिन यह सुझाव देता है कि यदि हम एआई को इन स्वच्छ, सघन तर्क श्रृंखलाओं पर प्रशिक्षित करते हैं, तो हम भविष्य में अधिक स्मार्ट, तेज़ और कुशल मॉडल प्राप्त कर सकते हैं।

संक्षेप में: वैध होने का मतलब आवश्यक होना नहीं है। कभी-कभी, किसी समस्या को हल करने का सबसे अच्छा तरीका इतना अधिक बोलना बंद करना होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →