Spatially Grounded Concept-Based Image Classification
यह शोध पत्र SEG-MIL-CBM का प्रस्ताव करता है, जो एक स्थानिक रूप से आधारित (spatially grounded) कॉन्सेप्ट बॉटलनेक मॉडल है जो छवियों को कॉन्सेप्ट-निर्देशित क्षेत्रों में विभाजित करता है और वर्गीकरण सटीकता में सुधार करने तथा अलग से पोस्ट-हॉक एट्रिब्यूशन मॉड्यूल की आवश्यकता के बिना आंतरिक, मानव-व्याख्या योग्य स्पष्टीकरण प्रदान करने के लिए अटेंशन के माध्यम से सेगमेंट-स्तरीय साक्ष्य को एकत्रित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं: इस तस्वीर में क्या है?
अधिकांश आधुनिक AI जासूस (डीप न्यूरल नेटवर्क) इस केस को सुलझाने में अविश्वसनीय रूप से अच्छे होते हैं। वे आपको बता सकते हैं, "वह एक पक्षी है!" 99% सटीकता के साथ। लेकिन वे यह समझाने में बहुत खराब हैं कि उन्हें कैसे पता चला। वे शायद पक्षी के बजाय बैकग्राउंड (जैसे कि झील) को देख रहे हों, या वे किसी गुप्त कोड का उपयोग कर रहे हों जिसे कोई इंसान पढ़ नहीं सकता। यदि आप पूछते हैं, "आपने क्यों कहा कि यह एक पक्षी है?", तो वे बस कंधे उचका देते हैं और कहते हैं, "क्योंकि गणित ऐसा कहता है।"
अन्य AI जासूस, जिन्हें कॉन्सेप्ट बोतलबंद मॉडल (CBMs) कहा जाता है, अधिक ईमानदार होने की कोशिश करते हैं। वे कहते हैं, "मैं एक 'चोंच' और 'पंख' देख रहा हूँ, इसलिए यह एक पक्षी है।" यह बेहतर है, लेकिन उनमें अभी भी एक दोष है: वे पूरी तस्वीर को एक स्मूदी की तरह मानते हैं। वे सभी "चोंच" और "पंखों" को जानकारी के एक बड़े कप में मिला देते हैं। वे यह नहीं बता सकते कि वे तस्वीर के किस विशिष्ट भाग को देख रहे हैं। क्या उन्होंने बाईं ओर की चोंच देखी? या दाईं ओर की पूंछ? वे केवल एक ग्लोबल स्कोर देते हैं।
नए जासूस से मिलिए: SEG-MIL-CBM
लेखकों ने इस नए जासूस को बनाया है जिसे SEG-MIL-CBM कहा जाता है। इस SEG-MIL-CBM वाले जासूस के बारे में सोचें जो एक फोरेंसिक अकाउंटेंट की तरह है जो केवल अनुमान नहीं लगाता; वह अपने द्वारा लिए गए हर निर्णय के लिए एक विस्तृत, मद-वार रसीद रखता है।
यह कैसे काम करता है, सरल उपमाओं का उपयोग करके यहाँ दिया गया है:
1. "कट-एंड-पेस्ट" टीम (प्रीप्रोसेसिंग)
इससे पहले कि जासूस तस्वीर को देखे, वे एक विशेष रोबोटों की टीम (प्री-ट्रेन्ड AI टूल्स जैसे CLIP, GroundingDINO, और SAM) का उपयोग करके छवि को पहेली के टुकड़ों में काट देते हैं।
- रोबोट: वे छवि को देखते हैं और कहते हैं, "मुझे यहाँ एक पैच दिख रहा है जो 'चमकदार नारंगी छाती' जैसा है," और "मुझे वहाँ 'काले पंखों' जैसा दिखने वाला एक पैच दिख रहा है।"
- परिणाम: छवि अब एक बड़ा ढेर नहीं रह जाती। यह अलग-अलग, लेबल किए गए पहेली के टुकड़ों (सेगमेंट) का एक थैला है।
2. "समिति का वोट" (द मॉडल)
अब, मुख्य जासूस (मॉडल) इस पहेली के टुकड़ों के थैले को देखता है। उन्हें मिलाने के बजाय, यह प्रत्येक टुकड़े को अदालत में एक गवाह की तरह मानता है।
- गवाह: प्रत्येक पहेली का टुकड़ा कहता है, "मैं पक्षी का एक हिस्सा हूँ, और मैं 'पक्षी' के फैसले में 40% योगदान देता हूँ।" दूसरा टुकड़ा कहता है, "मैं बैकग्राउंड का एक हिस्सा हूँ, और मैं 0% योगदान देता हूँ।"
- वोट: जासूस इन गवाहियों को तौलता है। यह उन टुकड़ों को अधिक ध्यान से सुनने के लिए एक विशेष "अटेंशन" तंत्र का उपयोग करता है जो सबसे महत्वपूर्ण लगते हैं और शोर को अनदेखा करता है।
3. "मद-वार रसीद" (एक्सप्लेनेशन)
यही जादू वाला हिस्सा है। क्योंकि अंतिम उत्तर केवल गवाहों के वोटों का योग है, इसलिए जासूस एक मद-वार रसीद प्रिंट कर सकता है।
- रसीद: यह केवल "पक्षी" नहीं कहता। यह कहता है:
- गवाह 1 (नारंगी छाती): "पक्षी" के लिए +0.42 अंक।
- गवाह 2 (काले पंख): "पक्षी" के लिए +0.32 अंक।
- ग meskipun 3 (नीला आकाश): 0 अंक।
- लाभ: आप देख सकते हैं कि AI ने वास्तव में कहाँ देखा और उसने क्या देखा। यदि AI ने गलती की है, तो आप रसीद देख सकते हैं और कह सकते हैं, "आह, आपने पहेली के गलत टुकड़े पर ध्यान केंद्रित किया!"
यह क्यों मायने रखता है? (द "शॉर्टकट" समस्या)
कभी-कभी, AI आलसी हो जाता है। वे "शॉर्टकट" सीख लेते हैं।
- परिदृश्य: कल्पना कीजिए कि एक AI को पक्षियों को पहचानने के लिए प्रशिक्षित किया गया है। वह देखता है कि अधिकांश ट्रेनिंग फोटो में पक्षी पानी पर होते हैं। इसलिए, वह सीखता है: "यदि मैं पानी देखता हूँ, तो यह एक पक्षी है।"
- विफलता: यदि आप उसे पेड़ पर एक पक्षी दिखाते हैं, तो वह भ्रमित हो सकता है क्योंकि वह पानी की तलाश कर रहा है।
- पुराना तरीका: ग्लोबल CBMs अभी भी धोखा खा सकते हैं क्योंकि वे "पानी" और "पक्षी" को एक ही स्कोर में मिला देते हैं।
- SEG-MIL-CBM का तरीका: क्योंकि यह मॉडल टुकड़ों को अलग-अलग देखता है, यह देख सकता है: "यह एक पेड़ पर बैठा पक्षी है (अच्छा!), लेकिन यह टुकड़ा पानी है (बुरा/शॉर्टकट)।" यह पानी के टुकड़े को अनदेखा करने और पक्षी के टुकड़े पर ध्यान केंद्रित करने का विकल्प चुन सकता है।
उन्होंने क्या साबित किया?
लेखकों ने इस नए जासूस का कई चुनौतियों पर परीक्षण किया:
- यह ईमानदार है: उन्होंने परीक्षण किया जहाँ उन्होंने एक-एक करके सबसे महत्वपूर्ण पहेली के टुकड़ों को हटाया। मॉडल का आत्मविश्वास ठीक वैसे ही गिरा जैसा अपेक्षित था, जिससे सिद्ध हुआ कि स्पष्टीकरण सोचने की प्रक्रिया से मेल खाता है।
- यह स्मार्ट है: यह न केवल समझाने में बेहतर हुआ; बल्कि इसने उन कठिन मामलों को हल करने में भी बेहतर प्रदर्शन किया जहाँ अन्य "ईमानदार" मॉडल विफल रहे (विशेष रूप से उन डेटासेट्स पर जहाँ AI आमतौर पर बैकग्राउंड द्वारा चकमा खा जाता है)।
- यह पर्याप्त तेज़ है: यह मानक इमेज रिकग्निशन कार्यों पर अच्छी तरह से काम करता है, न कि केवल ट्रिकी वाले।
निचोड़
यह पेपर एक ऐसी प्रणाली पेश करता है जो AI को अपना काम दिखाने के लिए मजबूर करती है। एक ब्लैक बॉक्स के बजाय जो केवल उत्तर देता है, यह आपको एक हाइलाइट किया गया मैप देता है जिसमें हर हाइलाइट किए गए क्षेत्र के लिए एक स्कोरकार्ड होता है।
- पुराना AI: "यह एक पक्षी है।" (मेरा विश्वास करो, मैं स्मार्ट हूँ।)
- पुराना "ईमानदार" AI: "यह एक पक्षी है क्योंकि इसमें 'पंख' और 'चोंच' जैसे कॉन्सेप्ट्स हैं।" (लेकिन मैं आपको नहीं बता सकता कि मैंने उन्हें कहाँ देखा।)
- SEG-MIL-CBM: "यह एक पक्षी है। यहाँ बाईं ओर का 'पंख' वाला पैच है (स्कोर: 0.4), और यहाँ दाईं ओर की 'चोंच' है (स्कोर: 0.3)। मैंने बैकग्राउंड में पानी को अनदेखा कर दिया।"
लेखकों का दावा है कि यह AI को अधिक विश्वसनीय बनाता है, खासकर जब इसके द्वारा आलसी शॉर्टकट लेने की संभावना हो, और यह मनुष्यों को इसे बिना किसी अलग, भ्रमित करने वाले टूल के ऑडिट करने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।