Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution
यह शोध पत्र स्टेपवाइज कॉन्फिडेंस एट्रिब्यूशन (SCA) प्रस्तुत करता है, जो ब्लैक-बॉक्स LLMs में बहु-चरणीय तर्क विफलताओं का निदान करने के लिए एक ढांचा है, जो सर्वसम्मति संरचनाओं के आधार पर चरण-स्तरीय आत्मविश्वास स्कोर असाइन करने के लिए इंफॉर्मेशन बॉटलनेक सिद्धांत को लागू करता है, जिससे पारंपरिक उत्तर-स्तर की प्रतिक्रिया की तुलना में अधिक प्रभावी आत्म-सुधार सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने एक बहुत बुद्धिमान, लेकिन थोड़े बिखरे हुए स्वभाव के मित्र से कोई जटिल गणितीय समस्या हल करने या किसी पेचीदा सवाल का जवाब देने के लिए कह रहे हैं। वे केवल अंतिम उत्तर नहीं देते; वे अपनी पूरी विचार प्रक्रिया, चरण-दर-चरण, एक जासूस की तरह मामले को सुलझाते हुए लिखते हैं।
समस्या:
कभी-कभी, आपका मित्र गलती से सही उत्तर पा लेता है, या वे अपनी तर्क प्रक्रिया के बीच में एक छोटी सी गलती के कारण गलत उत्तर प्राप्त करते हैं। समस्या यह है कि जब वे आपको अंतिम परिणाम सौंपते हैं, तो आप आसानी से यह नहीं बता सकते कि वे कहाँ गलत हुए। क्या उन्होंने पहले चरण में गलती की? अंतिम चरण में? या वे बस भाग्यशाली थे?
वर्तमान तरीके ऐसे हैं जैसे आप अपने मित्र से पूछ रहे हों, "क्या आपका उत्तर सही है?" वे केवल यह कह सकते हैं कि "हाँ" या "नहीं" उनके अंतिम उत्तर के बारे में। वे आपकी नोटबुक के उस विशिष्ट वाक्य की ओर इशारा नहीं कर सकते जहाँ उनका तर्क टूट गया था।
समाधान: स्टेपवाइज कॉन्फिडेंस एट्रिब्यूशन (SCA)
इस शोध पत्र के लेखकों ने एक नया टूल बनाया है जिसे स्टेपवाइज कॉन्फिडेंस एट्रिब्यूशन (SCA) कहा जाता है। इसे एक "लॉजिक स्पॉटर" (तर्क पहचानने वाला) के रूप में सोचें जो आपके मित्र के चरण-दर-चरण नोट्स को पढ़ता है और हर एक वाक्य के साथ एक कॉन्फिडेंस स्कोर (विश्वास स्कोर) लगा देता है।
- उच्च विश्वास (हरा टिक): "यह चरण ठोस दिखता है। यह इस समस्या को हल करने के लिए अन्य बुद्धिमान लोगों द्वारा किए जाने वाले तरीकों से मेल खाता है।"
- कम विश्वास (लाल झंडा): "रुको जरा। यह चरण अजीब लग रहा है। यह एक सही समाधान के पैटर्न में फिट नहीं बैठता। संभवतः यहीं गलती हुई है।"
यह कैसे काम करता है? ("कंसेंसस" या सर्वसम्मति की उपमा)
इसका असली रहस्य कंसेंसस (Consensus) है। कल्पना कीजिए कि आपने 20 अलग-अलग बुद्धिमान मित्रों को एक ही समस्या हल करने के लिए कहा।
- भले ही वे अपने चरणों को अलग क्रम में लिखें या अलग शब्दों का उपयोग करें, सभी सही समाधानों में कुछ प्रमुख "लैंडमार्क" या "एंकर" साझा होंगे। उदाहरण के लिए, एक गणित की समस्या में, सभी को कुल राशि की गणना करने से पहले पेंसिल की लागत की गणना करनी ही होगी।
- उनका सिस्टम सभी 20 समाधानों को देखता है। यह उन "साझा आधारों" को खोजता है जिन पर वे सभी लोग सहमत थे जिन्होंने सही उत्तर दिया था।
- यदि आपके मित्र का समाधान इन सामान्य लैंडमार्क्स का अनुसरण करता है, तो सिस्टम उन चरणों को उच्च विश्वास स्कोर देता है।
- यदि आपका मित्र एक अजीब रास्ते पर निकल जाता है या किसी आवश्यक लैंडमार्क को छोड़ देता है, तो सिस्टम उसे कम विश्वास के रूप में चिह्नित करता है।
दो उपकरण जो उन्होंने बनाए
यह पेपर इस "स्पॉटिंग" (पहचानने) के दो तरीके पेश करता है:
- NIBS (द "वर्ड मैचर"): यह एक सरल और तेज़ टूल है। यह केवल शब्दों और अर्थ को देखता है। यदि कोई चरण "सही" समूह के चरणों जैसा लगता है, तो उसे उच्च स्कोर मिलता है। यह ऐसा है जैसे यह जांचना कि क्या किसी रेसिपी का एक वाक्य हजारों अन्य सफल रेसिपी के चरणों से मेल खाता है।
- GIBS (द "मैप रीडर"): यह अधिक उन्नत और फैंसी टूल है। यह केवल शब्दों को नहीं देखता; यह तर्क की संरचना को देखता है। यह तर्क को एक मानचित्र (ग्राफ) में बदल देता है जहाँ चरण तीर के माध्यम से एक-दूसरे से जुड़े होते हैं, जो दिखाते हैं कि एक दूसरे की ओर कैसे ले जाता है। फिर यह उस "साझा मानचित्र" को खोजता है जो सभी सही समाधानों में समान है। यदि आपके मित्र के मानचित्र में एक ऐसा पुल है जो सामान्य मानचित्र में मौजूद नहीं है, तो GIBS उसे चिह्नित कर देता है। यह उन जटिल समस्याओं के लिए बेहतर है जहाँ चरणों का क्रम बहुत महत्वपूर्ण होता है।
यह क्यों मायने रखता है? ("सेल्फ-करेक्शन" का जादू)
यह पेपर दिखाता है कि यह केवल गलतियाँ खोजने के बारे में नहीं है; यह उन्हें ठीक करने के बारे में भी है।
- पुराना तरीका: आप अपने मित्र से कहते हैं, "आपका अंतिम उत्तर गलत है। फिर से प्रयास करें।" वे अक्सर केवल अलग तरीके से अनुमान लगाते हैं या वही गलती दोबारा करते हैं क्योंकि उन्हें पता नहीं होता कि वे क्यों विफल हुए।
- नया तरीका: आप अपने मित्र से कहते हैं, "आपका अंतिम उत्तर गलत है। साथ ही, चरण 3 और चरण 5 को देखें; हमारे सिस्टम को लगता है कि वे चरण डगमगा रहे हैं।"
- परिणाम: जब इस पेपर में परीक्षण किया गया, तो AI मॉडल अपने स्वयं के गलतियों को बहुत बेहतर तरीके से सुधार पाए (13.5% तक अधिक सफल) जब उन्हें केवल अंतिम उत्तर बताने के बजाय विशिष्ट कमजोर चरणों की ओर इशारा किया गया।
संक्षेप में
यह पेपर हमें बिना "ब्लैक बॉक्स" खोले उसके अंदर देखने का एक तरीका देता है। सही समाधानों के "कंसेंसस" के विरुद्ध AI के तर्क चरणों की तुलना करके, यह सिस्टम सटीक रूप से पहचान सकता है कि तर्क कहाँ टूट रहा है। यह एक अस्पष्ट "आप गलत हैं" को एक सहायक "आप यहाँ पटरी से उतर गए हैं" में बदल देता है, जिससे AI को अपनी विशिष्ट गलतियों से सीखने और खुद को सुधारने में मदद मिलती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।