← नवीनतम पेपर
🤖 machine learning

Spatially Grounded Concept-Based Image Classification

यह शोध पत्र SEG-MIL-CBM का प्रस्ताव करता है, जो एक स्थानिक रूप से आधारित (spatially grounded) कॉन्सेप्ट बॉटलनेक मॉडल है जो छवियों को कॉन्सेप्ट-निर्देशित क्षेत्रों में विभाजित करता है और वर्गीकरण सटीकता में सुधार करने तथा अलग से पोस्ट-हॉक एट्रिब्यूशन मॉड्यूल की आवश्यकता के बिना आंतरिक, मानव-व्याख्या योग्य स्पष्टीकरण प्रदान करने के लिए अटेंशन के माध्यम से सेगमेंट-स्तरीय साक्ष्य को एकत्रित करता है।

मूल लेखक: Ran Eisenberg, Amit Rozner, Ethan Fetaya, Ofir Lindenbaum

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ran Eisenberg, Amit Rozner, Ethan Fetaya, Ofir Lindenbaum

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं: इस तस्वीर में क्या है?

अधिकांश आधुनिक AI जासूस (डीप न्यूरल नेटवर्क) इस केस को सुलझाने में अविश्वसनीय रूप से अच्छे होते हैं। वे आपको बता सकते हैं, "वह एक पक्षी है!" 99% सटीकता के साथ। लेकिन वे यह समझाने में बहुत खराब हैं कि उन्हें कैसे पता चला। वे शायद पक्षी के बजाय बैकग्राउंड (जैसे कि झील) को देख रहे हों, या वे किसी गुप्त कोड का उपयोग कर रहे हों जिसे कोई इंसान पढ़ नहीं सकता। यदि आप पूछते हैं, "आपने क्यों कहा कि यह एक पक्षी है?", तो वे बस कंधे उचका देते हैं और कहते हैं, "क्योंकि गणित ऐसा कहता है।"

अन्य AI जासूस, जिन्हें कॉन्सेप्ट बोतलबंद मॉडल (CBMs) कहा जाता है, अधिक ईमानदार होने की कोशिश करते हैं। वे कहते हैं, "मैं एक 'चोंच' और 'पंख' देख रहा हूँ, इसलिए यह एक पक्षी है।" यह बेहतर है, लेकिन उनमें अभी भी एक दोष है: वे पूरी तस्वीर को एक स्मूदी की तरह मानते हैं। वे सभी "चोंच" और "पंखों" को जानकारी के एक बड़े कप में मिला देते हैं। वे यह नहीं बता सकते कि वे तस्वीर के किस विशिष्ट भाग को देख रहे हैं। क्या उन्होंने बाईं ओर की चोंच देखी? या दाईं ओर की पूंछ? वे केवल एक ग्लोबल स्कोर देते हैं।

नए जासूस से मिलिए: SEG-MIL-CBM

लेखकों ने इस नए जासूस को बनाया है जिसे SEG-MIL-CBM कहा जाता है। इस SEG-MIL-CBM वाले जासूस के बारे में सोचें जो एक फोरेंसिक अकाउंटेंट की तरह है जो केवल अनुमान नहीं लगाता; वह अपने द्वारा लिए गए हर निर्णय के लिए एक विस्तृत, मद-वार रसीद रखता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करके यहाँ दिया गया है:

1. "कट-एंड-पेस्ट" टीम (प्रीप्रोसेसिंग)

इससे पहले कि जासूस तस्वीर को देखे, वे एक विशेष रोबोटों की टीम (प्री-ट्रेन्ड AI टूल्स जैसे CLIP, GroundingDINO, और SAM) का उपयोग करके छवि को पहेली के टुकड़ों में काट देते हैं।

  • रोबोट: वे छवि को देखते हैं और कहते हैं, "मुझे यहाँ एक पैच दिख रहा है जो 'चमकदार नारंगी छाती' जैसा है," और "मुझे वहाँ 'काले पंखों' जैसा दिखने वाला एक पैच दिख रहा है।"
  • परिणाम: छवि अब एक बड़ा ढेर नहीं रह जाती। यह अलग-अलग, लेबल किए गए पहेली के टुकड़ों (सेगमेंट) का एक थैला है।

2. "समिति का वोट" (द मॉडल)

अब, मुख्य जासूस (मॉडल) इस पहेली के टुकड़ों के थैले को देखता है। उन्हें मिलाने के बजाय, यह प्रत्येक टुकड़े को अदालत में एक गवाह की तरह मानता है।

  • गवाह: प्रत्येक पहेली का टुकड़ा कहता है, "मैं पक्षी का एक हिस्सा हूँ, और मैं 'पक्षी' के फैसले में 40% योगदान देता हूँ।" दूसरा टुकड़ा कहता है, "मैं बैकग्राउंड का एक हिस्सा हूँ, और मैं 0% योगदान देता हूँ।"
  • वोट: जासूस इन गवाहियों को तौलता है। यह उन टुकड़ों को अधिक ध्यान से सुनने के लिए एक विशेष "अटेंशन" तंत्र का उपयोग करता है जो सबसे महत्वपूर्ण लगते हैं और शोर को अनदेखा करता है।

3. "मद-वार रसीद" (एक्सप्लेनेशन)

यही जादू वाला हिस्सा है। क्योंकि अंतिम उत्तर केवल गवाहों के वोटों का योग है, इसलिए जासूस एक मद-वार रसीद प्रिंट कर सकता है।

  • रसीद: यह केवल "पक्षी" नहीं कहता। यह कहता है:
    • गवाह 1 (नारंगी छाती): "पक्षी" के लिए +0.42 अंक।
    • गवाह 2 (काले पंख): "पक्षी" के लिए +0.32 अंक।
    • ग meskipun 3 (नीला आकाश): 0 अंक।
  • लाभ: आप देख सकते हैं कि AI ने वास्तव में कहाँ देखा और उसने क्या देखा। यदि AI ने गलती की है, तो आप रसीद देख सकते हैं और कह सकते हैं, "आह, आपने पहेली के गलत टुकड़े पर ध्यान केंद्रित किया!"

यह क्यों मायने रखता है? (द "शॉर्टकट" समस्या)

कभी-कभी, AI आलसी हो जाता है। वे "शॉर्टकट" सीख लेते हैं।

  • परिदृश्य: कल्पना कीजिए कि एक AI को पक्षियों को पहचानने के लिए प्रशिक्षित किया गया है। वह देखता है कि अधिकांश ट्रेनिंग फोटो में पक्षी पानी पर होते हैं। इसलिए, वह सीखता है: "यदि मैं पानी देखता हूँ, तो यह एक पक्षी है।"
  • विफलता: यदि आप उसे पेड़ पर एक पक्षी दिखाते हैं, तो वह भ्रमित हो सकता है क्योंकि वह पानी की तलाश कर रहा है।
  • पुराना तरीका: ग्लोबल CBMs अभी भी धोखा खा सकते हैं क्योंकि वे "पानी" और "पक्षी" को एक ही स्कोर में मिला देते हैं।
  • SEG-MIL-CBM का तरीका: क्योंकि यह मॉडल टुकड़ों को अलग-अलग देखता है, यह देख सकता है: "यह एक पेड़ पर बैठा पक्षी है (अच्छा!), लेकिन यह टुकड़ा पानी है (बुरा/शॉर्टकट)।" यह पानी के टुकड़े को अनदेखा करने और पक्षी के टुकड़े पर ध्यान केंद्रित करने का विकल्प चुन सकता है।

उन्होंने क्या साबित किया?

लेखकों ने इस नए जासूस का कई चुनौतियों पर परीक्षण किया:

  1. यह ईमानदार है: उन्होंने परीक्षण किया जहाँ उन्होंने एक-एक करके सबसे महत्वपूर्ण पहेली के टुकड़ों को हटाया। मॉडल का आत्मविश्वास ठीक वैसे ही गिरा जैसा अपेक्षित था, जिससे सिद्ध हुआ कि स्पष्टीकरण सोचने की प्रक्रिया से मेल खाता है।
  2. यह स्मार्ट है: यह न केवल समझाने में बेहतर हुआ; बल्कि इसने उन कठिन मामलों को हल करने में भी बेहतर प्रदर्शन किया जहाँ अन्य "ईमानदार" मॉडल विफल रहे (विशेष रूप से उन डेटासेट्स पर जहाँ AI आमतौर पर बैकग्राउंड द्वारा चकमा खा जाता है)।
  3. यह पर्याप्त तेज़ है: यह मानक इमेज रिकग्निशन कार्यों पर अच्छी तरह से काम करता है, न कि केवल ट्रिकी वाले।

निचोड़

यह पेपर एक ऐसी प्रणाली पेश करता है जो AI को अपना काम दिखाने के लिए मजबूर करती है। एक ब्लैक बॉक्स के बजाय जो केवल उत्तर देता है, यह आपको एक हाइलाइट किया गया मैप देता है जिसमें हर हाइलाइट किए गए क्षेत्र के लिए एक स्कोरकार्ड होता है।

  • पुराना AI: "यह एक पक्षी है।" (मेरा विश्वास करो, मैं स्मार्ट हूँ।)
  • पुराना "ईमानदार" AI: "यह एक पक्षी है क्योंकि इसमें 'पंख' और 'चोंच' जैसे कॉन्सेप्ट्स हैं।" (लेकिन मैं आपको नहीं बता सकता कि मैंने उन्हें कहाँ देखा।)
  • SEG-MIL-CBM: "यह एक पक्षी है। यहाँ बाईं ओर का 'पंख' वाला पैच है (स्कोर: 0.4), और यहाँ दाईं ओर की 'चोंच' है (स्कोर: 0.3)। मैंने बैकग्राउंड में पानी को अनदेखा कर दिया।"

लेखकों का दावा है कि यह AI को अधिक विश्वसनीय बनाता है, खासकर जब इसके द्वारा आलसी शॉर्टकट लेने की संभावना हो, और यह मनुष्यों को इसे बिना किसी अलग, भ्रमित करने वाले टूल के ऑडिट करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →