Barriers to Counterfactual Credit Attribution for Autoregressive Models
यह शोध पत्र ऑटोरेग्रेसिव जनरेटिव मॉडल्स में काउंटरफैक्चुअल क्रेडिट एट्रिब्यूशन (CCA) को लागू करने की चुनौतियों की जांच करता है, यह प्रदर्शित करते हुए कि CCA ऑटोरेग्रेसिव रूप से संयोजित होने में विफल रहता है और CCA को संतुष्ट करने के लिए मौजूदा मॉडल्स को रेट्रोफिट करने के लिए आउटपुट लंबाई के घातीय (exponential) क्वेरी जटिलता की आवश्यकता होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शेफ हैं जिसने अभी-अभी एक स्वादिष्ट नया सूप बनाया है। पुराने दिनों में, यदि आप किसी विशिष्ट किसान के गुप्त मसाले का उपयोग करते थे, तो आप स्वाभाविक रूप से कहते, "यह सूप किसान जॉन के मसाले की वजह से बहुत अच्छा स्वाद देता है।" आप जहाँ श्रेय दिया जाना चाहिए, वहाँ श्रेय देते हैं।
लेकिन अब, कल्पना कीजिए कि आपके पास एक जादुई "सूप बॉट" (Soup Bot) है। आप इसे सामग्री की एक सूची (एक डेटाबेस) खिलाते हैं, और यह सूप तैयार कर देता है। समस्या यह है कि बॉट एक 'ब्लैक बॉक्स' है। यह सब कुछ इतनी अच्छी तरह से मिला देता है कि आप यह नहीं बता सकते कि किस विशिष्ट सामग्री ने सूप के स्वाद को इस तरह प्रभावित किया। यदि आप यह नहीं बता सकते कि किस चीज़ ने प्रभाव डाला, तो आप किसानों को श्रेय नहीं दे सकते। यह शोध पत्र तर्क देता है कि हमें बॉट को यह कहने के लिए मजबूर करने की आवश्यकता है कि, "मैंने किसान जॉन के मसाले का उपयोग किया है," जब वह मसाला वास्तव में रेसिपी के लिए आवश्यक था।
लेखक इसे "काउंटरफैक्चुअल क्रेडिट एट्रिब्यूशन" (Counterfactual Credit Attribution - CCA) कहते हैं। यह एक फैंसी तरीका है यह कहने का: "यदि हम सूची में से किसान जॉन का मसाला निकाल दें, तो क्या सूप का स्वाद अभी भी वैसा ही रहेगा?" यदि उत्तर है "नहीं, स्वाद अलग होगा," तो बॉट को किसान जॉन को श्रेय देना ही होगा।
यह शोध पत्र दो स्वाभाविक तरीकों की खोज करता है जिनसे हम यह "श्रेय देने वाला बॉट" बना सकते हैं और पाता है कि दोनों ही एक बड़ी दीवार से टकरा जाते हैं।
1. "चरण-दर-चरण" दृष्टिकोण (ऑटोरिग्रेसिव मॉडल)
अधिकांश आधुनिक AI (जैसे कि यह सारांश लिख रहा है) एक ऐसे व्यक्ति की तरह काम करता है जो एक बार में एक शब्द लिखते हुए कहानी लिखता है। वह एक शब्द चुनता है, फिर अगला, फिर अगला।
विचार: शायद हम बॉट को प्रत्येक व्यक्तिगत शब्द के लिए श्रेय देने के लिए सिखा सकते हैं। यदि वह एक ऐसा शब्द चुनता है जो किसान जॉन के मसाले पर निर्भर है, तो वह उसे श्रेय देता है। फिर, हम उन सभी शब्दों को जोड़कर पूरा सoup बना देते हैं।
समस्या: शोध पत्र सिद्ध करता है कि यह काम नहीं करता।
- उपमा: कल्पना कीजिए कि आप ब्लॉकों से एक मीनार बना रहे हैं। आपके पास एक नियम है: "हर बार जब आप एक ब्लॉक रखते हैं, तो आपको यह जांचना होगा कि क्या वह स्थिर है।" आप हर एक ब्लॉक के लिए इस नियम का पूरी तरह से पालन करते हैं। लेकिन जब आप पीछे हटकर देखते हैं, तो पूरी मीनार ढह जाती है।
- वास्तविकता: लेखक दिखाते हैं कि भले ही बॉट प्रत्येक शब्द उत्पन्न करने के लिए श्रेय देने में एकदम सटीक हो, फिर भी अंतिम कहानी (पूरी श्रृंखला) श्रेय देने में विफल हो सकती है। "श्रेय" शब्दों के ढेर लगने के साथ खो जाता या विकृत हो जाता है। यह घर बनाने की कोशिश करने जैसा है जहाँ आप केवल व्यक्तिगत ईंटों की स्थिरता की जाँच करते हैं; पूरी संरचना फिर भी गिर सकती है।
2. "रिट्रोफिट" दृष्टिकोण (बाद में श्रेय जोड़ना)
विचार: क्या होगा यदि हमारे पास पहले से ही एक ऐसा बॉट है जो सूप बनाने में बहुत अच्छा है लेकिन श्रेय देने में बहुत बुरा है? क्या हम इसके चारों ओर एक "रैपर" (wrapper) लगा सकते हैं? यह रैपर बॉट को सूप बनाते हुए देखेगा और बाद में निर्णय लेगा, "ठीक है, मैं एक नोट जोड़ दूँगा कि 'श्रेय: किसान जॉन'।"
समस्या: शोध पत्र सिद्ध करता है कि यह गणनात्मक रूप से असंभव है (या कम से कम इतना कठिन है कि यह असंभव ही है)।
- उपमा: कल्पना कीजिए कि आपके पास एक लॉक तिजोरी है जो एक यादृच्छिक (random) 100-अंकों का कोड बनाती है। आप तिजोरी पर एक लेबल लगाना चाहते हैं जिसमें लिखा हो, "यह कोड संख्या 7 से प्रभावित था।" ऐसा करने के लिए, आपको तिजोरी के अंदर झांकना होगा यह देखने के लिए कि क्या वास्तव में संख्या 7 का उपयोग किया गया था।
- वास्तविकता: लेखक दिखाते हैं कि यह पता लगाने के लिए कि क्या बॉट को वास्तव में अपने आउटपुट को उत्पन्न करने के लिए एक विशिष्ट डेटा (जैसे किसान जॉन का मसाला) की आवश्यकता थी, आपको बॉट को खरबों-खरबों बार सूप उत्पन्न करने के लिए कहना होगा (एक्सपोनेंशियल रूप से कई क्वेरीज़)। यह समुद्र तट पर रेत के एक विशिष्ट कण को खोजने के लिए हर एक कण को एक-एक करके खोदने जैसा है। भले ही आप केवल एक "काफी अच्छा" अनुमान लगाना चाहते हों, गणित कहता है कि आपको अभी भी लगभग पूरा समुद्र तट खोदना होगा।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हमारे सामने वर्तमान में एक बड़ी बाधा है।
- हम केवल क्रेडिट देने वाले AI को हर छोटे कदम (शब्द-दर-शब्द) पर श्रेय देने वाला बनाकर नहीं बना सकते।
- हम मौजूदा AI को बाद में एक क्रेडिट देने वाली परत जोड़कर आसानी से ठीक नहीं कर सकते क्योंकि इसमें असंभव मात्रा में काम करना होगा।
लेखक एक अजीब दुष्प्रभाव की ओर भी इशारा करते हैं: इस "क्रेडिट सिस्टम" के सख्त नियमों को पूरा करने के लिए, बॉट को उन सामग्रियों को भी श्रेय देने के लिए मजबूर किया जा सकता है जिन्होंने सूप के स्वाद को बहुत कम बदला है। यह एक किसान को नमक के एक दाने के लिए धन्यवाद देने के लिए मजबूर होने जैसा है जिसने स्वाद को वास्तव में नहीं बदला, बस इसलिए क्योंकि गणित कहता है कि आपको इसकी आवश्यकता हो सकती थी।
संक्षेप में: AI को उसके स्रोतों को विश्वसनीय और कुशलता से श्रेय देने के लिए बनाना हमारी सोच से कहीं अधिक कठिन है, और इसके दो सबसे स्पष्ट समाधान काम नहीं करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।