← नवीनतम पेपर
💬 NLP

Do Composed Image Retrieval Benchmarks Require Multimodal Composition?

यह शोध पत्र प्रकट करता है कि वर्तमान कंपोज्ड इमेज रिट्रीवल (CIR) बेंचमार्क मल्टीमॉडल कंपोजिशन क्षमताओं को बढ़ा-चढ़ाकर दिखाते हैं क्योंकि प्रश्नों का एक महत्वपूर्ण हिस्सा यूनिमोडल शॉर्टकट के माध्यम से हल किया जा सकता है या खराब तरीके से निर्मित होता है, जिसके लिए यह सुनिश्चित करने हेतु एक सत्यापित उपसमूह की आवश्यकता है कि मॉडल वास्तव में इमेज और टेक्स्ट इनपुट को संयोजित करते हैं।

मूल लेखक: Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo, Alessandro Suglia, Dietmar Jannach, Tommaso Di Noia, Pasquale Minervini

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo, Alessandro Suglia, Dietmar Jannach, Tommaso Di Noia, Pasquale Minervini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "तस्वीर पहचानो" (Guess the Picture) नामक एक खेल खेल रहे हैं।

इस खेल में, आपको लाखों छवियों वाले एक विशाल पुस्तकालय में छिपी एक विशिष्ट फोटो खोजने के लिए दो सुराग दिए जाते हैं:

  1. एक शुरुआती फोटो (जैसे, एक लाल ड्रेस की तस्वीर)।
  2. एक टेक्स्ट निर्देश (जैसे, "इसे नीला बनाओ और लंबी आस्तीन जोड़ो")।

लक्ष्य टारगेट फोटो (नीली ड्रेस और लंबी आस्तीन वाली) को खोजना है। इसे कंपोज्ड इमेज रिट्रीवल (CIR) कहा जाता है। विचार यह है कि एक स्मार्ट कंप्यूटर को चित्र और टेक्स्ट के संकेतों को मिलाना आना चाहिए। यदि वह ऐसा नहीं कर पाता है, तो वह वास्तव में छवियों और शब्दों को मिलाने की प्रक्रिया को "समझ" नहीं रहा है।

समस्या: चीट कोड्स (Cheat Codes)

लेखकों ने इस कार्य को परखने के लिए उपयोग किए जाने वाले चार लोकप्रिय "तस्वीर पहचानो" खेलों (बेंचमार्क) की जांच की। उन्हें संदेह था कि ये खेल चीट कोड्स के साथ हेरफेर किए गए हैं।

उन्होंने पाया कि बहुत बड़ी संख्या में पहेलियों के लिए, एआई (AI) को वास्तव में चित्र और टेक्स्ट को मिलाने की आवश्यकता नहीं थी। वह केवल एक ही सुराग का उपयोग करके जीत सकता था:

  • टेक्स्ट चीट (The Text Cheat): कभी-कभी, टेक्स्ट निर्देश इतना विशिष्ट होता था ("नीली ड्रेस और लंबी आस्तीन वाली एक तस्वीर खोजें") कि एआई शुरुआती फोटो को पूरी तरह से अनदेखा कर सकता था और केवल टेक्स्ट विवरण के आधार पर खोज कर सकता था। उसने फोटो देखे बिना ही उत्तर ढूंढ लिया।
  • इमेज चीट (The Image Cheat): कभी-कभी, टेक्स्ट निर्देश इतना अस्पष्ट या अनुपयोगी होता था ("इसे बेहतर बनाएं") कि एआई टेक्स्ट को अनदेखा कर सकता था और केवल शुरुआती फोटो के आधार पर अनुमान लगा सकता था।

रूपक (Metaphor):
कल्पना कीजिए कि एक शिक्षक छात्र को गणित की एक समस्या देता है: "संख्या 5 से शुरू करें, फिर 3 जोड़ें।"

  • वास्तविक सीखना: छात्र गणना करता है कि 5+3=85 + 3 = 8
  • चीटिंग: छात्र "5 से शुरू करें" वाले हिस्से को अनदेखा कर देता है और बस यह याद कर लेता है कि "3 जोड़ें" का उत्तर हमेशा 8 होता है, या वह गणित को अनदेखा कर देता है और केवल इसलिए अनुमान लगा लेता है क्योंकि शिक्षक हमेशा 8 ही चुनते हैं।

शोधकर्ताओं ने पाया कि इन एआई बेंचमार्क में, 32% से 83% प्रश्न वास्तव में केवल एक सुराग का उपयोग करके हल किए जा सकते थे (चीट), न कि दोनों सुरागों को मिलाने की वास्तविक प्रक्रिया द्वारा। इसका मतलब है कि एआई मॉडल जो उच्च स्कोर प्राप्त कर रहे थे, वे अक्सर नकली थे—वे सीख नहीं रहे थे, बल्कि चीटिंग कर रहे थे।

दूसरी समस्या: टूटी हुई पहेलियाँ (Broken Puzzles)

इसके बाद लेखकों ने पूछा: "ठीक है, अब सभी 'चीट' वाले प्रश्नों को हटा देते हैं। अब हमारे पास केवल वे कठिन पहेलियाँ बची हैं जिनके लिए दोनों सुरागों की आवश्यकता है। क्या वे निष्पक्ष हैं?"

उन्होंने शेष "कठिन" पहेलियों को देखने के लिए मनुष्यों से कहा। उन्होंने पाया कि उनमें से कई टूटी हुई थीं:

  • बहुत अस्पष्ट: निर्देश था "इसे गहरा (darker) करें," लेकिन लाइब्रेरी में ड्रेस के 50 अलग-अलग गहरे संस्करण मौजूद थे। उनमें से "सही" उत्तर कौन सा था? पहेली का कोई एक सही उत्तर नहीं था।
  • मेल न खाना (Mismatched): निर्देश में कहा गया था "एक टोपी जोड़ें," लेकिन "सही" उत्तर वाली फोटो में टोपी भी नहीं थी। पहेली शुरुआत से ही गलत थी।

रूपक (Metaphor):
यह एक शिक्षक द्वारा छात्र को पहेली देने जैसा है: "ऐसी क्या चीज़ है जो गोल और लाल है?"

  • टूटी हुई पहेली: शिक्षक कहता है कि उत्तर "सेब" है, लेकिन छात्र सही रूप में "टमाटर" या "गेंद" भी कह सकता था। चूंकि कई सही उत्तर हो सकते हैं, इसलिए परीक्षण अनुचित है।
  • मेल न खाना: शिक्षक कहता है कि उत्तर "एक वर्ग (square)" है, लेकिन पहेली ने किसी गोल चीज़ के बारे में पूछा था। परीक्षण निरर्थक है।

समाधान: सर्कस (CIRCUS)

इसे ठीक करने के लिए, लेखकों ने इन परीक्षणों का एक नया, साफ-सुथरा संस्करण बनाया जिसे CIRCUS कहा जाता है।

  1. उन्होंने उन सभी "चीट" वाले प्रश्नों को हटा दिया जहाँ एआई केवल एक सुराग से जीत सकता था।
  2. उन्होंने उन सभी "टूटे हुए" प्रश्नों को हटा दिया जहाँ उत्तर अस्पष्ट या गलत था।

अंत में उनके पास 1,689 वास्तव में कठिन पहेलियाँ बचीं।

परिणाम: एआई बहुत खराब प्रदर्शन करता है (लेकिन यह अच्छा है)

जब उन्होंने इन नए, साफ किए गए पहेलियों पर एआई मॉडल का पुन: परीक्षण किया:

  • स्कोर नाटकीय रूप से गिर गया। उदाहरण के लिए, एक मॉडल का एक टेस्ट पर स्कोर 70% से गिरकर 24% हो गया।
  • यह क्यों अच्छा है? यह साबित करता है कि मॉडल पहले छवियों और टेक्स्ट को मिलाने में वास्तव में स्मार्ट नहीं था; वह केवल चीट कोड्स को पहचानने में अच्छा था।
  • नए साफ किए गए परीक्षणों पर, मॉडलों को उत्तर पाने के लिए वास्तव में चित्र और टेक्स्ट दोनों का उपयोग करना पड़ा। केवल टेक्स्ट, केवल इमेज, और दोनों का उपयोग करने के बीच का "अंतर" अब बहुत स्पष्ट हो गया।

निष्कर्ष (The Bottom Line)

शोध पत्र निष्कर्ष निकालता है कि "छवियों और टेक्स्ट को मिलाने" के लिए वर्तमान एआई परीक्षण त्रुटिपूर्ण हैं। वे एक ड्राइविंग टेस्ट की तरह हैं जहाँ कार बिना कभी स्टीयरिंग घुमाए केवल गैस पेडल दबाकर पास हो सकती है। लेखकों ने एक नया, अधिक सख्त ड्राइविंग टेस्ट (CIRCUS) बनाया है जो कार को वास्तव में स्टीयरिंग घुमाने के लिए मजबूर करता है। जब तक हम इस तरह के परीक्षणों का उपयोग नहीं करते, हम एआई वास्तव में कितना स्मार्ट है, इसका अत्यधिक आकलन करते रहेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →