Local Causal Attribution of Chain-of-Thought Reasoning
यह शोध पत्र AttriCoT को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स एल्गोरिदम है जो चेन-ऑफ-थॉट रीजनिंग के व्यक्तिगत घटकों पर स्थानीय कारण संबंधी एट्रिब्यूशन (local causal attribution) करने के लिए एक स्ट्रक्चरल कॉज़ल मॉडल का निर्माण करता है, जो मॉडल व्यवहार के प्रति बेहतर निष्ठा (faithfulness) प्रदर्शित करता है और विभिन्न मॉडलों एवं डोमेन में विशिष्ट विचार संरचनाओं को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक बड़ा लैंग्वेज मॉडल (जैसे कि एक सुपर-स्मार्ट एआई) एक कठिन गणित की समस्या या तर्क संबंधी पहेली को हल कर रहा है। केवल उत्तर देने के बजाय, यह पहले एक लंबा "सोचने की प्रक्रिया" (thought process) लिखता है, जो चरण-दर-चरण होती है। इसे चेन-ऑफ-थॉट (CoT) कहा जाता है।
इस सोचने की प्रक्रिया (Chain of Thought) को एक जासूस की नोटबुक की तरह समझें। जासूस केस सुलझाने से पहले सुराग, सिद्धांत और गणनाएँ लिखता है। लेकिन समस्या यह है: कभी-कभी जासूस अपनी नोटबुक में ऐसी चीजें लिख देता है जो सुनने में तो तार्किक लगती हैं, लेकिन वास्तव में उन्हें केस सुलझाने में मदद नहीं करतीं। शायद उन्होंने किसी 'रेड हेरिंग' (भटकाने वाले सुराग) के बारे में एक लंबी कहानी लिख दी, या शायद उन्होंने किसी महत्वपूर्ण सुराग को अनदेखा कर दिया। हम यह जानना चाहते हैं कि: नोटबुक के कौन से विशिष्ट नोट्स वास्तव में अंतिम समाधान का कारण बने?
यह शोध पत्र इस प्रश्न का उत्तर देने के लिए एक नया उपकरण AttriCoT पेश करता है।
समस्या: "नकली" तर्क (Fake Reasoning)
वर्तमान में, हमें वास्तव में यह नहीं पता कि एआई जो टेक्स्ट लिख रहा है, क्या वह वास्तव में उसके सही उत्तर तक पहुँचने का असली कारण है। कभी-कभी एआई किस्मत से सही उत्तर का अनुमान लगा लेता है, और फिर उसे सही ठहराने के लिए एक नकली, विस्तृत कहानी लिख देता है। अन्य मामलों में, वह अपने दिमाग में एक कदम छोड़ सकता है लेकिन उसे लिख देता है।
वैज्ञानिकों ने यह पता लगाने की कोशिश की है कि:
- एआई से पूछकर: "हे, तुम्हारी सोचने की प्रक्रिया का कौन सा हिस्सा सबसे महत्वपूर्ण था?" (यह एक छात्र से अपना होमवर्क खुद ग्रेड करने के लिए कहने जैसा है; वे झूठ बोल सकते हैं या भ्रमित हो सकते हैं)।
- हिस्सों को मिटाकर और परिणाम देखकर: यदि आप सोचने की प्रक्रिया से एक वाक्य हटा देते हैं, तो क्या एआई गलत उत्तर देगा? यह एक अच्छा विचार है, लेकिन हर एक वाक्य के लिए ऐसा करना बहुत अधिक कंप्यूटर पावर लेता है, जैसे कि यह देखने के लिए कि कौन सी ईंट छत को थामे हुए है, घर को ईंट-दर-ईंट फिर से बनाना।
समाधान: AttriCoT (द "कॉज़ल डिटेक्टिव")
शोधकर्ताओं ने AttriCoT बनाया है, जो एक विधि है जो एआई के विचारों के लिए एक फॉरेंसिक अकाउंटेंट की तरह कार्य करती है।
उपमा: रेसिपी टेस्ट (The Recipe Test)
कल्पना कीजिए कि आप यह पता लगाने की कोशिश कर रहे हैं कि एक जटिल केक रेसिपी में कौन से सामग्रियां वास्तव में केक का स्वाद अच्छा बनाती हैं।
- पुराना तरीका: आप प्रत्येक सामग्री का परीक्षण करने के लिए एक पूरा नया केक बनाते हैं। यदि रेसिपी में 50 सामग्रियां हैं, तो आप 50 केक बनाते हैं। यह धीमा और महंगा है।
- AttriCoT का तरीका: आप एक बार केक बनाते हैं। फिर, आप एक विशेष गणितीय ट्रिक का उपयोग करते हैं यह सिम्युलेट करने के लिए कि क्या होगा यदि आपने चीनी, या आटा, या अंडे को हटा दिया होता, बिना हर बार नया केक बनाए। आप मापते हैं कि जब आप यह दिखावा करते हैं कि कोई सामग्री गायब है, तो "स्वाद स्कोर" (एआई का आत्मविश्वास) कितना गिर जाता है।
AttriCoT कैसे काम करता है (3 चरण):
- "क्या-होता-अगर" (What-If) गेम: यह एक विशिष्ट चेन-ऑफ-थॉट (एआई की नोटबुक) को लेता है और इसे छोटे टुकड़ों में तोड़ देता है जिन्हें "यूनिट्स" (वाक्य या वाक्यांश) कहा जाता है। फिर यह "क्या-होटा-अगर" परिदृश्यों की एक सूची बनाता है: "क्या होगा यदि हम यूनिट 1 को हटा दें?" "क्या होगा यदि हम यूनिट 2 को हटा दें?"
- त्वरित जाँच (Quick Check): पूरे एआई को फिर से चलाने (पूरा केक दोबारा बनाने) के बजाय, यह एक बहुत ही तेज़, हल्का चेक चलाता है यह देखने के लिए कि एक यूनिट गायब होने पर अगले चरण में एआई का आत्मविश्वास कितना कम हो जाता है।
- मैथ मैप (Math Map): यह बिंदुओं को जोड़ने के लिए एक सरल गणितीय सूत्र (एक लीनियर मॉडल) का उपयोग करता है। यह प्रत्येक जोड़ी (pair) के लिए एक स्कोर की गणना करता है। उदाहरण के लिए, यह कह सकता है कि: "स्टेप 3, स्टेप 7 के लिए 80% जिम्मेदार था, लेकिन स्टेप 2 का स्टेप 7 पर लगभग कोई प्रभाव नहीं था।"
उन्होंने क्या पाया
शोधकर्ताओं ने इसका परीक्षण 5 अलग-अलग प्रकार की पहेलियों (गणित, तर्क, विज्ञान) और 4 अलग-अलग एआई मॉडलों पर किया।
- यह अधिक सटीक है: AttriCoT अन्य तरीकों की तुलना में वास्तविक महत्वपूर्ण चरणों को खोजने में बहुत बेहतर था। जब उन्होंने यह जांचा कि एक "प्रमुख" चरण को हटाने से वास्तव में एआई का उत्तर टूट गया या नहीं, तो AttriCoT के अनुमान सबसे विश्वसनीय थे।
- यह कुशल है: इसे एआई को हजारों बार चलाने की आवश्यकता नहीं थी। इसे केवल उतनी बार चलाने की आवश्यकता थी जितने कि सोचने की प्रक्रिया में चरण थे। यह इसे लंबे, जटिल तर्क श्रृंखलाओं के लिए उपयोग करने के लिए पर्याप्त तेज़ बनाता है।
- नई अंतर्दृष्टि (New Insights): AttriCoT द्वारा उत्पन्न "स्कोर" को देखकर, उन्होंने दिलचस्प पैटर्न पाए:
- शुरुआत और अंत सबसे अधिक मायने रखते हैं: शुरुआती विचार (जहाँ एआई प्रश्न पढ़ता है) और अंतिम विचार (जहाँ वह उत्तर की दोबारा जाँच करता है) का सबसे अधिक प्रभाव पड़ता है।
- पीछे देखना (Looking Back): एक कठिन समस्या को हल करने के बीच में, एआई अक्सर मूल प्रश्न को दोबारा पढ़ने के लिए वापस जाता है ताकि यह सुनिश्चित हो सके कि वह कोई विवरण भूल नहीं गया है।
- अलग-अलग मॉडल, अलग-अलग आदतें: कुछ मॉडल पूरी प्रक्रिया के दौरान मूल प्रश्न पर बहुत अधिक निर्भर रहते हैं, जबकि अन्य अपने पिछले चरणों पर अधिक निर्भर होते हैं।
मुख्य निष्कर्ष (The Bottom Line)
यह शोध पत्र यह दावा नहीं करता है कि यह एआई को ठीक करता है या इसे स्मार्ट बनाता है। इसके बजाय, यह हमें एआई के "ब्लैक बॉक्स" तर्क के अंदर देखने के लिए एक टॉर्च (flashlight) देता है। यह हमें चरण-दर-चरण देखने की अनुमति देता है कि एआई के सोचने के कौन से हिस्से वास्तव में उत्तर की ओर ले गए और कौन से हिस्से केवल शोर (noise) थे। यह हमें यह समझने में मदद करता है कि क्या एआई वास्तव में तर्क कर रहा है या बस चलते-चलते चीजें बना रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।