← नवीनतम पेपर
🤖 AI

Evaluation Cards for XAI Metrics

एक्सप्लेनेबल एआई (XAI) विधियों के मूल्यांकन में मानकीकरण और पारदर्शिता की कमी को दूर करने के लिए, यह शोध पत्र "XAI इवैल्यूएशन कार्ड" प्रस्तावित करता है, जो कि एक दस्तावेज़ीकरण टेम्पलेट है जिसे किसी भी नए XAI मीट्रिक के लिए लक्षित गुणों, धारणाओं और सत्यापन साक्ष्य जैसे महत्वपूर्ण विवरणों को व्यवस्थित रूप से रिकॉर्ड करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Rokas Gipiškis, Olga Kurasova

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rokas Gipiškis, Olga Kurasova

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी दुनिया में हैं जहाँ हर कोई "ब्लैक बॉक्स" मशीनें (AI मॉडल) बनाता है जो निर्णय लेती हैं। इन मशीनों को भरोसेमंद बनाने के लिए, लोगों ने "एक्सप्लेनेशन टूल्स" (XAI) का आविष्कार किया जो हमें यह बताने की कोशिश करते हैं कि मशीन ने एक विशिष्ट निर्णय क्यों लिया।

लेकिन समस्या यह है: कोई भी इन एक्सप्लेनेशन टूल्स को ग्रेड देने के तरीके पर सहमत नहीं है।

कुछ शोधकर्ता कहते हैं, "मेरा टूल महान है क्योंकि यह तेज़ है!" दूसरा कहता है, "नहीं, मेरा बेहतर है क्योंकि यह सटीक है!" वे एक ही चीज़ को मापने के लिए अलग-अलग पैमाने इस्तेमाल कर रहे हैं, और वे आपको यह भी नहीं बता रहे हैं कि वे किस तरह का पैमाना इस्तेमाल कर रहे हैं। यह जानना असंभव बना देता है कि वास्तव में सबसे अच्छा एक्सप्लेनेशन टूल कौन सा है।

यह पेपर एक सरल समाधान प्रस्तावित करता है: XAI इवैल्यूएशन कार्ड (XAI Evaluation Card)।

इस कार्ड के बारे में ऐसे सोचें जैसे भोजन के लिए एक पोषण लेबल (Nutrition Label) या नई कार के लिए एक स्पेसिफिकेशन शीट (Spec Sheet)। जिस तरह आप बिना यह जाने कार नहीं खरीदेंगे कि उसकी ईंधन दक्षता, सुरक्षा रेटिंग और इंजन का प्रकार क्या है, वैसे ही आपको एक AI एक्सप्लेनेशन पर भरोसा नहीं करना चाहिए जब तक कि उसके साथ एक मानकीकृत कार्ड न हो जो आपको ठीक से बताए कि वह क्या मापता है और कहाँ काम करता है।

यहाँ बताया गया है कि यह पेपर इसे कैसे विभाजित करता है:

1. समस्या: एक अस्त-व्यस्त रसोई (A Messy Kitchen)

लेखकों ने दर्जनों हालिया अध्ययनों को देखा और तीन मुख्य गड़बड़ियाँ पाईं:

  • भ्रमित करने वाले नाम: दो अलग-अलग टूल्स के नाम एक ही हो सकते हैं लेकिन वे पूरी तरह से अलग चीजें मापते हैं। या, दो टूल्स जो बिल्कुल एक ही चीज़ माप रहे हैं, उनके नाम पूरी तरह से अलग हो सकते हैं। यह ऐसा है जैसे किसी को "चम्मच" को "कांटा" कहना सिर्फ इसलिए क्योंकि उसे वह नाम पसंद है।
  • गलत टेस्ट ड्राइव: अधिकांश शोधकर्ता इन टूल्स का परीक्षण केवल कंप्यूटर-आधारित गणितीय परीक्षणों (फंक्शनली-ग्राउंडेड) का उपयोग करके करते हैं। वे शायद ही कभी वास्तविक मनुष्यों या वास्तविक दुनिया की स्थितियों के साथ इनका परीक्षण करते हैं, भले ही वास्तव में वही चीज़ मायने रखती है जो विश्वास (trust) के लिए ज़रूरी है।
  • गायब मैनुअल: कई शोधकर्ता एक नया तरीका प्रस्तावित करते हैं जिससे स्पष्टीकरण (explanations) को मापा जा सके, लेकिन वे वास्तविक कोड साझा नहीं करते हैं। यह रेसिपी बेचने जैसा है बिना यह बताए कि सामग्री क्या है या बनाने के चरण क्या हैं।

2. समाधान: मेट्रिक्स के लिए "ID कार्ड"

इसे ठीक करने के लिए, लेखकों ने एक टेम्पलेट बनाया जिसे XAI इवैल्यूएशन कार्ड कहा जाता है। हर बार जब कोई AI एक्सप्लेनेशन को टेस्ट करने का नया तरीका आविष्कार करता है, तो उन्हें इस कार्ड को भरना होगा। इसमें चार मुख्य भाग हैं:

  • भाग I: पहचान (नाम का टैग)

    • यह क्या पूछता है: इस मेट्रिक का नाम क्या है? यह किस विशिष्ट गुण को माप रहा है (जैसे "ईमानदारी" या "स्थिरता")? क्या इसका परीक्षण कंप्यूटर पर, मनुष्यों पर, या वास्तविक कार्य परिवेश में किया गया है?
    • उपमा: यह दवा की बोतल पर लगे लेबल की तरह है जो कहता है, "यह सिरदर्द के इलाज के लिए है, पेट दर्द के लिए नहीं, और यह केवल वयस्कों के लिए है।"
  • भाग II: दायरा और संदर्भ (कहाँ और कब)

    • यह क्या पूछता है: यह किस प्रकार के AI मॉडल पर काम करता है? किस प्रकार के डेटा पर? क्या यह एक विशिष्ट निर्णय के लिए काम करता है या पूरे सिस्टम के लिए? हम क्या धारणाएँ (assumptions) बना रहे हैं?
    • उपमा: यह टायर पर दिए गए "अत्यधिक गर्मी में उपयोग न करें" चेतावनी की तरह है। यह आपको बताता है कि यह टूल कहाँ मान्य है और कहाँ यह विफल हो सकता है।
  • भाग III: कार्यान्वयन और सत्यापन (प्रमाण)

    • यह क्या पूछता है: क्या कोड दूसरों द्वारा जांच के लिए उपलब्ध है? क्या आपने यह परीक्षण किया है कि टूल स्थिर (stable) है? क्या इस बात का जोखिम है कि कोई उच्च स्कोर प्राप्त करने के लिए टेस्ट में "चीटिंग" कर सकता है बिना वास्तव में AI को बेहतर बनाए?
    • उपमा: यह क्रैश-टेस्ट वीडियो और वारंटी की तरह है। यह साबित करता है कि टूल वास्तव में काम करता है और आपको चेतावनी देता है कि क्या कोई इसके परिणाम फर्जी दिखा सकता है।
  • भाग IV: संबंध और सीमाएं (फैमिली ट्री)

    • यह क्या पूछता है: यह टूल अन्य टूल्स की तुलना में कैसा है? यदि यह दूसरे टूल से असहमत है, तो हमें किस पर भरोसा करना चाहिए? यह टूल कहाँ विफल होता है?
    • उपमा: यह एक कार समीक्षा की तरह है जो कहती है, "यह कार हाईवे पर बेहतरीन है, लेकिन इसे ऑफ-रोडिंग के लिए न ले जाएं, और यह मॉडल X से धीमी है।"

3. यह क्यों महत्वपूर्ण है

लेखकों का तर्क है कि यदि पूरा AI समुदाय इन कार्डों का उपयोग करने के लिए सहमत हो जाता है, तो यह भ्रम को समाप्त कर देगा।

  • अब अनुमान लगाने की ज़रूरत नहीं: आप बिल्कुल जान पाएंगे कि कोई मेट्रिक क्या मापता है।
  • बेहतर तुलना: आप अंततः टूल A और टूल B की निष्पक्ष रूप से तुलना कर सकते हैं क्योंकि वे एक ही "पोषण लेबल" का उपयोग कर रहे हैं।
  • अधिक ईमानदारी: शोधकर्ताओं को यह स्वीकार करना होगा कि उनके टूल्स कहाँ विफल होते हैं और उन्हें कैसे "गेम" (manipulate) किया जा सकता है।

निचोड़ (The Bottom Line)

यह पेपर कोई नया AI टूल या AI को समझाने का नया तरीका नहीं बनाता है। इसके बजाय, यह एक मानकीकृत रिपोर्टिंग फॉर्म बनाता है। यह एक विनम्र लेकिन शक्तिशाली विचार है: इससे पहले कि हम AI स्पष्टीकरणों के मूल्यांकन को ठीक कर सकें, हमें विवरण छिपाना बंद करना होगा। इस "इवैल्यूएशन कार्ड" को भरने के लिए शोधकर्ताओं को मजबूर करके, हम अंततः इस बारे में ईमानदार और स्पष्ट बातचीत शुरू कर सकते हैं कि हम वास्तव में किन AI स्पष्टीकरणों पर भरोसा कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →