← नवीनतम पेपर
🤖 machine learning

ShapBPT: Image Feature Attributions Using Data-Aware Binary Partition Trees

यह शोध पत्र ShapBPT प्रस्तुत करता है, जो एक नवीन व्याख्यात्मक एआई (explainable AI) विधि है जो पदानुक्रमित शापली मानों (hierarchical Shapley values) की गणना करने के लिए डेटा-जागरूक बाइनरी पार्टीशन ट्रीज़ का लाभ उठाता है, जिससे इमेज डेटा के लिए कुशल, रूपात्मक रूप से संरेखित और मानव-पसंदीदा पिक्सेल-स्तरीय फीचर एट्रिब्यूशन्स उत्पन्न होते हैं।

मूल लेखक: Muhammad Rashid, Elvio G. Amparore, Enrico Ferrari, Damiano Verda

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Rashid, Elvio G. Amparore, Enrico Ferrari, Damiano Verda

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट AI रोबोट है जो एक फ्लेमिंगो (राजहंस) की तस्वीर देखता है और सही ढंग से कहता है, "यह एक फ्लेमिंगो है!" लेकिन वह रोबोट एक "ब्लैक बॉक्स" है—वह आपको यह नहीं बताएगा कि उसे क्यों लगा कि यह फ्लेमिंगो है। क्या वह गुलाबी पंखों को देख रहा है? उसकी लंबी टांगों को? या बैकग्राउंड को?

इसे ठीक करने के लिए, वैज्ञानिक Explainable AI (XAI) नामक टूल्स का उपयोग करते हैं। ये टूल्स इमेज के उन हिस्सों को हाइलाइट करने की कोशिश करते हैं जिन्होंने रोबलेट को उसका निर्णय लेने के लिए मनाया।

यह पेपर एक नया, अधिक स्मार्ट टूल पेश करता है जिसे ShapBPT कहा जाता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: "ग्रिड" बनाम "पहेली"

अधिकांश वर्तमान टूल्स (जैसे लोकप्रिय SHAP) इमेज को एक चेकरबोर्ड (शतरंज के बोर्ड) की तरह देखते हैं। वे तस्वीर को छोटे, कठोर वर्गों (पिक्सेल) में काट देते हैं और रोबोट से पूछते हैं: "अगर मैं इस वर्ग को छिपा दूँ, तो क्या रोबोट अभी भी इसे फ्लेमिंगो समझेगा?"

  • दोष: यह अक्षम (inefficient) है। यदि रोबोट फ्लेमिंगो की पूरी टांग को देख रहा है, तो ग्रिड टूल टांग के हर एक पिक्सेल को अलग-अलग टेस्ट करने में समय बर्बाद कर सकता है। यह एक किताब में एक विशिष्ट शब्द खोजने के लिए हर एक अक्षर को एक-एक करके पढ़ने जैसा है, बजाय इसके कि पूरे शब्दों को देखा जाए।
  • परिणाम: इसमें बहुत समय लगता है (धीमा) और कभी-कभी हाइलाइट्स बिखरे हुए या धुंधले दिखते हैं क्योंकि वे वस्तु के प्राकृतिक आकार का सम्मान नहीं करते हैं।

2. समाधान: "स्मार्ट ट्री" (ShapBPT)

लेखकों ने ShapBPT बनाया है, जो इमेज को एक कठोर ग्रिड के बजाय एक बढ़ते हुए पेड़ या एक स्मार्ट पहेली की तरह देखता है।

  • यह कैसे काम करता है: इमेज को वर्गों में काटने के बजाय, ShapBPT तस्वीर को देखता है और कहता है, "अरे, ये पिक्सेल सभी एक ही गुलाबी रंग के हैं और एक-दूसरे के बगल में हैं। चलिए इन्हें एक साथ जोड़ देते हैं!"
  • बाइनरी पार्टीशन ट्री (BPT): कल्पना कीजिए कि आपके पास लेगो (Lego) ब्रिक्स का एक ढेर है।
    1. आप हर एक ब्रिक को अलग-अलग से शुरू करते हैं।
    2. आप दो ऐसे ब्रिक्स को ढूंढते हैं जो समान दिखते हैं (समान रंग, आपस में जुड़े हुए) और उन्हें एक साथ जोड़ देते हैं।
    3. आप समान समूहों को तब तक जोड़ते रहते हैं जब तक कि आपके पास पूरे फ्लेमिंगो का प्रतिनिधित्व करने वाला एक बड़ा ब्लॉक न बन जाए।
    4. यह एक ट्री (पेड़) संरचना बनाता है जहाँ छोटे समूह बड़े समूहों में विलीन हो जाते हैं।

3. जादू: "डेटा-अवेयर" (Data-Aware)

मुख्य शब्द है Data-Aware

  • पुराना तरीका (Grid): "मैं इमेज को आधा काट दूँगा, फिर उन हिस्सों को फिर से आधा कर दूँगा, चाहे तस्वीर में कुछ भी हो।" (जैसे पिज्जा को परफेक्ट स्लाइस में काटना, भले ही पेपरोनी केवल एक तरफ हो)।
  • ShapBلط (Tree): "मैं इमेज को ठीक वहीं से काटूँगा जहाँ वस्तु बदलती है।" यदि फ्लेमिंगो की टांग पानी के बगल में है, तो यह टूल टांग और पानी के बीच में ही कट लगाएगा। यह वस्तु के आकार (shape) का सम्मान करता है।

4. यह बेहतर क्यों है? (उपमा)

एक भीड़ भरे स्टेडियम में किसी विशिष्ट व्यक्ति को खोजने की कोशिश करने के बारे में सोचें।

  • ग्रिड विधि (SHAP): आप स्टेडियम की हर एक सीट पर एक-एक करके चिल्लाते हैं, "क्या तुम वह व्यक्ति हो?" इसमें बहुत समय लगता है।
  • ShapBPT विधि: आप भीड़ को देखते हैं। आप लाल शर्ट पहने लोगों का एक समूह देखते हैं। आप पूरे समूह से पूछते हैं, "क्या व्यक्ति इस समूह में है?" यदि हाँ, तो आप उस समूह पर ज़ूम इन करते हैं। यदि नहीं, तो आप तुरंत पूरे समूह को अनदेखा कर देते हैं।
    • परिणाम: आप उस व्यक्ति को बहुत तेज़ी से ढूंढ लेते हैं, और आप जानते हैं कि वे किस समूह के हैं।

5. परिणाम

पेपर ने हजारों छवियों (कारों, जानवरों, चेहरों, यहाँ तक कि कारखाने के पुर्जों में दोष पहचानने) पर अन्य तरीकों के मुकाबले ShapBPT का परीक्षण किया।

  • गति (Speed): यह बहुत तेज़ था क्योंकि इसने अप्रासंगिक पिक्सेल को टेस्ट करने में समय बर्बाद नहीं किया।
  • सटीकता (Accuracy): इसने जो "हाइलाइट" बनाया, वह वस्तु के वास्तविक आकार से पूरी तरह मेल खाता था। यदि रोबोट कुत्ते के कान को देख रहा था, तो ShapBPT ने कान को साफ तरीके से हाइलाइट किया, न कि उसके आसपास एक धुंधले ढेर की तरह।
  • मानवीय प्राथमिकता (Human Preference): उन्होंने परिणामों को 20 लोगों को दिखाया और पूछा, "कौन सा स्पष्टीकरण सबसे अधिक समझ में आता है?" ShapBPT जीत गया। लोग साफ, आकार-आधारित हाइलाइट्स को ग्रिड जैसे बिखरे हुए हाइलाइट्स की तुलना में अधिक पसंद करते हैं।

सारांश

ShapBPT ऐसा है जैसे आप AI को एक रूलर (स्केल) के बजाय स्मार्ट कैंची दे रहे हों। इमेज को कठोर वर्गों में काटने के बजाय, यह वस्तुओं की प्राकृतिक रेखाओं के साथ कटता है। यह स्पष्टीकरण को कंप्यूट करने में तेज़, समझने में आसान और यह दिखाने में बहुत अधिक सटीक बनाता है कि AI ने अपना निर्णय क्यों लिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →