← नवीनतम पेपर
💻 computer science

A Good Initialization is All You Need for Faithful Visual Attribution

यह शोध पत्र CoPAIR और TRACE को प्रस्तुत करता है, जो दो फॉरवर्ड-ओनली (forward-only) विधियाँ हैं जो कॉम्पैक्ट टॉप-के (top-k) विजुअल एविडेंस मास्क के इनिशियलाइजेशन और डायरेक्ट सर्च को अनुकूलित करती हैं, जिससे इमेज क्लासिफिकेशन और मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में स्टेट-ऑफ-द-आर्ट फेथफुल एट्रिब्यूशन परफॉरमेंस प्राप्त होता है और साथ ही एक्शनएबल सिंगल-पॉइंट रिपेयर्स को सक्षम बनाया जाता है।

मूल लेखक: Zihan Gu, Jiayu Wang, Hua Zhang, Yue Hu

प्रकाशित 2026-07-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihan Gu, Jiayu Wang, Hua Zhang, Yue Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत बुद्धिमान लेकिन कभी-कभी भ्रमित होने वाला रोबोट है जो एक तस्वीर को देखता है और एक अनुमान लगाता है, जैसे कि कहना, "यह एक गाय है!" भले ही वह वास्तव में एक घोड़ा हो। आप जानना चाहते हैं: तस्वीर के कौन से विशिष्ट हिस्सों ने रोबोट को यह गलती करने के लिए राजी किया?

यह पेपर एक बेहतर "जासूस" बनाने के बारे में है जो उन विशिष्ट हिस्सों को खोज सके। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

समस्या: "लंबी सूची" बनाम "शॉर्टकट नोट"

पारंपरिक रूप से, जब हम किसी रोबोट के निर्णय को समझाने की कोशिश करते हैं, तो हम उसे तस्वीर के हर एक टुकड़े को "सबसे महत्वपूर्ण" से "सबसे कम महत्वपूर्ण" के क्रम में रैंक करने के लिए कहते हैं। यह एक जासूस से एक मामले में मिले हर एक सुराग की 100 पन्नों की रिपोर्ट लिखने के लिए कहने जैसा है, जिसे महत्व के आधार पर क्रमबद्ध किया गया हो।

लेकिन अक्सर, हमें पूरी 100 पन्नों की रिपोर्ट की आवश्यकता नहीं होती। हमें बस उन शीर्ष 5 सुरागों की आवश्यकता होती जिन्होंने वास्तव में मामले को सुलझाया। AI की दुनिया में, इसे "कॉम्पैक्ट टॉप-k एविडेंस मास्क" (compact top-k evidence mask) कहा जाता है। यह छवि का एक छोटा, केंद्रित हाइलाइट है जो साबित करता है कि रोबोट ने जो सोचा वह क्यों सोचा।

इन शीर्ष 5 सुरागों को खोजना कठिन है।

  • "लालची" (Greedy) दृष्टिकोण: कल्पना कीजिए कि एक जासूस एक सबसे अच्छा सुराग चुनता है, फिर अगला सबसे अच्छा, फिर अगला। यह ठीक काम करता है, लेकिन यह धीमा है (जैसे एक बार में एक शब्द पढ़ते हुए किताब पढ़ना) और कभी-कभी यह बड़े चित्र को मिस कर देता है क्योंकि दो सुराग केवल तभी समझ में आते हैं जब उन्हें एक साथ देखा जाए।
  • "कोर्स" (Coarse) दृष्टिकोण: कल्पना कीजिए कि पूरी छवि को बड़े टुकड़ों में समूहबद्ध करना (जैसे "आकाश," "जमीन," "पेड़") और सबसे अच्छे टुकड़े को चुनना। यह तेज़ है, लेकिन यह बहुत धुंधला है। आप सुराग के रूप में "जमीन" चुन सकते हैं, लेकिन असली सुराग जमीन पर एक छोटा सा पत्थर था।

समाधान: दो नए जासूसी उपकरण

लेखक इन दो तरीकों को पेश करते हैं जो तेजी से और अधिक सटीकता से पूर्ण छोटे सुरागों के सेट को खोजने में मदद करते हैं।

1. COPAIR: "ग्रुप स्काउट" (समूह खोजकर्ता)

इसे एक ऐसे स्काउट के रूप में सोचें जो पहले छवि को बड़े, धुंधले समूहों में देखता है (जैसे व्यक्तिगत शहरों के बजाय देशों के मानचित्र को देखना)।

  • यह कैसे काम करता है: स्काउट जल्दी से सबसे अच्छे "देशों" (पिक्सेल के समूहों) को पाता है और जांचता है कि क्या कोई दो देश मिलकर अच्छा काम करते हैं।
  • ट्रिक: एक बार जब स्काउट एक आशाजनक समूह पा लेता है, तो वे उसके अंदर विशिष्ट शहरों (बारीक विवरणों) को खोजने के लिए ज़ूम इन करते हैं।
  • यह कैसे मदद करता है: यह मुख्य जासूस को एक बेहतरीन "हेड स्टार्ट" (शुरुआती बढ़त) देता है। यह अकेले पूरा मामला नहीं सुलझाता, लेकिन यह जासूस को गलत क्षेत्रों में समय बर्बाद करने से बचाता है।

2. TRACE: "लॉटरी टिकट" खोज

यह इस पेपर का मुख्य आकर्षण है। कल्पना कीजिए कि आप लॉटरी में जीतने वाले संयोजन को खोजने की कोशिश कर रहे हैं, लेकिन आप केवल एक-एक करके नंबर नहीं चुन सकते। आपको एक पूरा टिकट (5 नंबरों का एक विशिष्ट सेट) एक साथ चुनना होगा।

  • यह कैसे काम करता है:
    1. ड्रॉ (Draw): TRACE यादृच्छिक रूप से एक "टिकट" (छवि के 5 क्षेत्रों का एक यादृच्छिक सेट) निकालता है।
    2. टेस्ट (Test): यह रोबोट से पूछता है, "यदि मैं तुम्हें केवल ये 5 क्षेत्र दिखाऊं, तो क्या तुम अभी भी 'गाय' का अनुमान लगाओगे?"
    3. लर्न (Learn): यदि रोबोट कहता है "हाँ!", तो TRACE उस संयोजन को याद रखता है। यदि रोबोट कहता है "नहीं," तो वह उसे भूल जाता है।
    4. रिफाइन (Refine): कई दौरों के बाद, TRACE ऐसे टिकट बनाना शुरू कर देता है जो पहले मिले विजेता संयोजनों की तरह अधिक दिखते हैं। यह एक छात्र की तरह है जो अगले टेस्ट के लिए सही उत्तर का अनुमान लगाने के लिए पिछले परीक्षा प्रश्नों का अध्ययन करता है।
  • परिणाम: TRACE सीधे तौर पर सुरागों के आदर्श छोटे सेट को खोज लेता है, बिना छवि के हर एक पिक्सेल को रैंक किए।

यह क्यों मायने रखता है ("अहा!" क्षण)

पेपर दिखाता है कि ये तरीके न केवल तेज़ हैं; वे अधिक समझदार भी हैं।

  • मानक छवियों के लिए: मानक इमेज रिकग्निशन कार्यों (जैसे फोटो में वस्तुओं की पहचान करना) पर परीक्षण करते समय, जासूस को "हेड स्टार्ट" देने के लिए TRACE का उपयोग करने से अंतिम स्पष्टीकरण पहले से कहीं अधिक सटीक रहा।
  • हैलुसिनेशन (भ्रम) के लिए (बड़ी जीत): यहीं पर यह रोमांचक हो जाता है। जब रोबट भ्रमित होता है (चीजें मनगढ़ंत बनाता है), तो पुराने तरीके में इसे ठीक करने के लिए एक लंबी, धीमी प्रक्रिया की आवश्यकता होती थी।
    • पुराना तरीका: "यहाँ सुरागों की एक लंबी सूची है। शायद पहला एक मदद करे, शायद दूसरा एक..."
    • TRACE का तरीका: "यहाँ एक एकल मास्क (5 क्षेत्रों का एक विशिष्ट सेट) है। यदि आप केवल इसे रोबोट को दिखाते हैं, तो वह तुरंत अपनी गलती को समझ जाता है और खुद को सुधार लेता है।"

उनके परीक्षणों में, इस "एकल मास्क" दृष्टिकोण ने रोबोट के भ्रमों (hallucinations) को 94% से 96% तक ठीक कर दिया। यह एक विशिष्ट सबूत खोजने जैसा है जो तुरंत गलतफहमी को दूर कर देता है, बजाय इसके कि संभावनाओं की पूरी सूची के माध्यम से बहस की जाए।

सारांश

  • पुराना तरीका: एक लंबी व्याख्या बनाने के लिए हर पिक्सेल को धीरे-धीरे रैंक करना।
  • नया तरीका (TRACE): पिक्सेल के परफेक्ट छोटे समूह को खोजने के लिए एक स्मार्ट, पुनरावृत्ति खोज (iterative search) का उपयोग करना।
  • लाभ: यह तेज़ है, अधिक सटीक है, और सीधे तौर पर सही सबूत दिखाकर रोबोट के गलत उत्तर को "ठीक" कर सकता है, बिना किसी लंबी रिपोर्ट की आवश्यकता के।

यह पेपर साबित करता है कि कभी-कभी, आपको छवि के बारे में सब कुछ जानने की आवश्यकता नहीं होती; आपको बस सही कुछ चीजों को जानने की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →