On the Importance and Evaluation of Narrativity in Natural Language AI Explanations
यह शोध पत्र तर्क देता है कि मानव समझ को बेहतर समर्थन देने के लिए प्राकृतिक भाषा AI स्पष्टीकरणों को एक कथात्मक संरचना (नैरेटिव स्ट्रक्चर) अपनानी चाहिए, चार प्रमुख आयामों में कथात्मक गुणवत्ता का मूल्यांकन करने के लिए सात नए स्वचालित मेट्रिक्स का प्रस्ताव करता है, और मानक फीचर सूचियों से परे XAI आउटपुट की व्याख्यात्मक शक्ति में सुधार करने के लिए पीढ़ी संबंधी नियम (जेनरेशन रूल्स) पेश करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक रहस्यमय मशीन ने आपके ऋण (loan) आवेदन को क्यों खारिज कर दिया।
पुराना तरीका (वर्णनात्मक स्पष्टीकरण):
मशीन आपको एक छपा हुआ दस्तावेज़ थमाती है। इसमें लिखा है:
- "क्रेडिट राशि: खराब।"
- "आयु: अच्छी।"
- "आवास: खराब।"
- "लिंग: तटस्थ।"
यह एक किराने की रसीद की तरह है। यह आपको बताता है कि आपने क्या सामान खरीदा, लेकिन यह नहीं बताता कि आपने उन्हें क्यों खरीदा या वे एक-दूसरे से कैसे जुड़े हैं। यह तथ्यों की एक स्थिर सूची है। आपको कहानी समझने के लिए अपने दिमाग का सारा भारी काम खुद करना पड़ता है: "ओह, मुझे लगता है कि उच्च क्रेडिट राशि समस्या थी, लेकिन मेरी आयु ने थोड़ा मदद की?" यह शुष्क, दोहराव वाला और समझने में कठिन है।
नया तरीका (कथात्मक स्पष्टीकरण):
मशीन आपको एक छोटी कहानी देती है। यह कहती है:
"मशीन ने सबसे पहले आपकी उच्च क्रेडिट मांग को देखा, जो जोखिम भरा लगा। लेकिन फिर, इसने आपकी कम आयु को देखा, जिसने एक सुरक्षा कवच की तरह काम किया और निर्णय को 'अच्छे' की ओर वापस खींच लिया। आपकी किराए पर रहने की स्थिति ने वित्तीय चिंता को थोड़ा कम कर दिया, और आपके लिंग ने एक छोटा सा सकारात्मक स्पर्श जोड़ा। क्योंकि ये अच्छे कारक शुरुआती जोखिम से अधिक प्रभावी रहे, इसलिए मशीन ने 'हाँ' कहने का निर्णय लिया।"
यह एक कहानी है। इसमें एक शुरुआत, एक मध्य और एक अंत है। यह बताता है कि चीजें क्यों हुईं, न कि केवल यह कि क्या हुआ।
वह समस्या जिसे यह शोध पत्र हल करता है
लेखक, माटेउज़ सेड्रो और डेविड मार्टेंस ने देखा कि आज के अधिकांश AI स्पष्टीकरण "रसीद मोड" (सूची) में फंसे हुए हैं। वे AI को "कहानी मोड" में ले जाना चाहते हैं।
लेकिन पेचीदा बात यह है: आप यह कैसे माप सकते हैं कि एक AI अच्छी कहानी सुना रहा है या नहीं?
वर्तमान में, कंप्यूटर टेक्स्ट की गुणवत्ता की जांच करने के लिए मानक गणित का उपयोग करते हैं। वे देखते हैं कि:
- परप्लेक्सिटी (Perplexity): टेक्स्ट कितना अनुमानित है? (क्या यह उबाऊ और दोहराव वाला है?)
- शब्द गणना (Word Count): कितने अलग-अलग शब्दों का उपयोग किया गया है?
लेखक तर्क देते हैं कि ये उपकरण कहानियों के लिए बेकार हैं।
- "बकवास" (Gibberish) का लूपहोल: आप एक ही शब्दों को बार-बार दोहराकर निरर्थक टेक्स्ट लिखकर इन उपकरणों को धोखा दे सकते हैं। एक कंप्यूटर सोच सकता है, "वाह, यह टेक्स्ट बहुत अनुमानित है और इसमें सामान्य शब्दों का उपयोग किया गया है, इसलिए यह उच्च गुणवत्ता वाला होना चाहिए!" लेकिन एक इंसान कहेगा, "इसका कोई अर्थ नहीं है।"
- "रसीद" का लूपहोल: एक उबाऊ तथ्यों की सूची भी इन परीक्षणों में अच्छा स्कोर कर सकती है क्योंकि यह व्याकरण की दृष्टि से सही है, भले ही वह कहानी बताने में विफल रही हो।
समाधान: "स्टोरी डिटेक्टिव" (कहानी के जासूस) टूल्स
लेखकों ने विशेष रूप से एक वास्तविक कहानी को पकड़ने के लिए सात नए टूल्स (मीट्रिक्स) बनाए हैं। वे उन चार "सुपरपावर्स" की तलाश करते हैं जो एक वृत्तांत (narrative) को सफल बनाते हैं:
धागा (निरंतर संरचना - The Thread):
- उपमा: कल्पना कीजिए कि ऊन का एक गोला है। कहानी में, यदि आप एक धागे को खींचते हैं, तो पूरा गोला हिलता है। एक सूची में, धागे कटे हुए और फर्श पर पड़े होते हैं।
- परीक्षण: लेखक वाक्यों को आगे-पीछे (shuffle) करते हैं। यदि टेक्स्ट बिखर जाता है और भ्रमित करने वाला हो जाता है, तो वह एक वास्तविक कहानी थी (अच्छा!)। यदि टेक्स्ट अभी भी समझ में आता है, तो वह केवल एक सूची थी (बुरा!)।
कारण-और-प्रभाव की श्रृंखला (The Cause-and-Effect Chain):
- उपमा: डोमिनो प्रभाव। "क्योंकि पहला डोमिनो गिरा, इसलिए दूसरा गिरा।"
- परीक्षण: कंप्यूटर "क्योंकि," "इसलिए," और "परिणामस्वरूप" जैसे शब्दों को स्कैन करता है। यह जाँचता है कि क्या कहानी वास्तव में बताती है कि कुछ क्यों हुआ, बजाय इसके कि केवल तथ्य बताए।
प्रवाह (भाषाई प्रवाह - The Flow):
- उपमा: एक चिकड़ी नदी बनाम एक पथरीला रास्ता।
- परीक्षण: क्या टेक्स्ट स्वाभाविक रूप से बहता है, या यह ऐसा लगता है जैसे कोई रोबोट मैनुअल पढ़ रहा हो? यह जाँचता है कि क्या टेक्स्ट एक ही वाक्यांशों को दोहराने (जैसे "विशेषता है... विशेषता है...") से बचता है।
शब्दावली (शब्द विविधता - The Vocabulary):
- उपमा: एक चित्रकार द्वारा रंगों के पूरे पैलेट के उपयोग बनाम केवल ग्रे रंग का उपयोग।
- परीक्षण: कहानियाँ चीजों के बदलने के तरीके का वर्णन करने के लिए कई अलग-अलग क्रियाओं (action words) का उपयोग करती हैं। सूचियाँ केवल स्थिर संज्ञाओं (nouns) का उपयोग करती हैं। नए टूल्स यह जाँचते हैं कि क्या AI सक्रिय और विविध भाषा का उपयोग कर रहा है।
उन्होंने क्या पाया
लेखकों ने इन नए टूल्स का परीक्षण कई AI सिस्टमों पर किया जो स्पष्टीकरण उत्पन्न करते हैं।
- पुराने टूल्स विफल रहे: मानक कंप्यूटर परीक्षण एक सहायक कहानी और एक उबाऊ सूची के बीच अंतर नहीं कर सके। कभी-कभी, उबाऊ सूची का स्कोर भी अधिक रहा!
- नए टूल्स सफल रहे: सात नए "स्टोरी डिटेक्टिव" टूल्स ने आसानी से अच्छी कहानियों को बुरे सूचियों से अलग कर दिया। वे बता सके कि कौन सा AI वास्तव में क्यों समझा रहा था और कौन सा केवल किराने की रसीद पढ़ रहा था।
- सुधार: उन्होंने AI को "कहानी के नियम" (जैसे, "एक शुरुआत से शुरू करें, जोड़ने वाले शब्दों का उपयोग करें, कारण समझाएं") भी दिए। जब उन्होंने ये नियम AI को दिए, तो AI ने बहुत बेहतर कहानियाँ लिखना शुरू कर दिया।
मुख्य निष्कर्ष
यदि हम लोगों को AI पर भरोसा दिलाना चाहते हैं, तो हम उन्हें केवल डेटा की स्प्रेडशीट नहीं दे सकते। हमें उन्हें एक कहानी देनी होगी।
यह शोध पत्र AI स्टोरीटेलर बनाने के लिए एक मार्गदर्शिका की तरह है। यह हमें बताता है:
- सूचियाँ पर्याप्त नहीं हैं; हमें वृत्तांतों (narratives) की आवश्यकता है।
- पुराने कंप्यूटर परीक्षण एक अच्छी कहानी को पहचानने के लिए बहुत मंद बुद्धि हैं।
- हमारे पास कहानी कहने की क्षमता को मापने के लिए नए, स्मार्ट परीक्षण हैं।
- यदि हम AI को इन कहानी के नियमों का पालन करना सिखाते हैं, तो स्पष्टीकरण मनुष्यों के लिए समझना बहुत आसान हो जाएगा।
संक्षेप में: AI को केवल यह न बताएं कि क्या हुआ; उससे पूछें कि क्यों हुआ उसकी कहानी सुनाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।