← नवीनतम पेपर
💻 computer science

Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering

यह शोधपत्र RETINA डेटासेट को पेश करके मौजूदा मल्टीमॉडल नॉलेज-बेस्ड विजुअल क्वेश्चन अनस्वर्सिंग बेंचमार्क को प्रभावित करने वाले "विजुअल शॉर्टकट्स" की पहचान और समाधान करता है, जो मॉडलों को संबंधित संस्थाओं के बारे में तर्क करने के लिए मजबूर करता है, और MIMIR मॉडल का प्रस्ताव करता है जो इन सीमाओं को दूर करने के लिए मल्टी-इमेज रिट्रीवल का लाभ उठाता है।

मूल लेखक: Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo

प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: AI में "चीट कोड" (Cheat Code)

कल्पना कीजिए कि आप इतिहास की एक परीक्षा दे रहे हैं। शिक्षक आपको एक बीटल (Beetle) का चित्र दिखाते हैं और पूछते हैं, "यह जीव दुनिया के किस हिस्से में रहता है?"

पुराने तरीके में (मौजूदा बेंचमार्क में), उत्तर कुंजी हमेशा चित्र के ठीक बगल में रखी होती थी। AI को दिखाए गए टेक्स्टबुक पेज में उसी सटीक बीटल का चित्र और "नॉर्थ अमेरिका" लिखा हुआ टेक्स्ट था।

AI ने एक विजुअल शॉर्टकट (या "चीट कोड") सीख लिया। उसने वास्तव में टेक्स्ट को नहीं पढ़ा या जीव विज्ञान को नहीं समझा। उसने बस यह सीख लिया: "अगर मुझे बीटल का चित्र दिखता है, तो मैं एक ऐसा दस्तावेज़ ढूँढूँगा जिसमें बीटल का चित्र हो, और मैं वहाँ से उत्तर निकाल लूँगा।" यह उस छात्र की तरह था जिसने याद कर लिया कि "प्रश्न 5 में हमेशा कुत्ते का चित्र होता है, इसलिए उत्तर हमेशा 'डॉग पार्क' ही होगा।"

शोधकर्ताओं ने पाया कि यदि आप टेक्स्ट हटा दें और केवल AI को चित्र दें, तो भी वह सही उत्तर दे सकता है! यह साबित करता है कि AI "सोच" नहीं रहा था; वह केवल पैटर्न मिला रहा था।

समाधान: "RETINA" परीक्षा

इसे ठीक करने के लिए, लेखकों ने एक नई, कठिन परीक्षा बनाई जिसे RETINA कहा जाता है।

उपमा (Analogy):
कल्पना कीजिए कि शिक्षक अभी भी आपको बीटल का चित्र दिखाते हैं। लेकिन इस बार, उत्तर बीटल के बारे में किसी किताब में नहीं है। उत्तर आलू (Potatoes) के बारे में एक किताब में छिपा है।

क्यों? क्योंकि बीटल आलू खाता है। आलू वाली किताब में बीटल का ज़िक्र है, लेकिन बीटल वाली किताब में आलू का ज़िक्र नहीं है।

  • पुराना तरीका: बीटल का चित्र दिखाएं \rightarrow बीटल वाले चित्र वाली किताब खोजें। (आसान/चीटिंग)।
  • RETINA का तरीका: बीटल का चित्र दिखाएं \rightarrow आलू के बारे में किताब खोजें। (कठिन/वास्तविक)।

यह AI को विजुअल मैच (चित्र मिलाने) के बजाय वास्तव में तर्क (Reasoning) करने के लिए मजबूर करता है। उसे समझना होगा कि "बीटल" \rightarrow "खाता है" \rightarrow "आलू" \rightarrow "आलू के बारे में पढ़ो।"

उन्होंने एक स्मार्ट AI (एक LLM) का उपयोग किया जो स्वचालित रूप से 1,20,000 ऐसे पेचीदा प्रश्न बना सका, यह सुनिश्चित करते हुए कि प्रश्न में दिया गया चित्र उत्तर वाली किताब के मुख्य चित्र से मेल न खाए।

नया टूल: MIMIR (द "मल्टी-इमेज डिटेक्टिव")

शोधकर्ताओं ने महसूस किया कि मौजूदा AI मॉडल इस नए "RETINA" एग्जाम में बहुत खराब प्रदर्शन कर रहे थे क्योंकि उन्हें केवल एक दस्तावेज़ के एक चित्र (मुख्य विषय) को देखने के लिए प्रशिक्षित किया गया था।

यदि AI आलू के बारे में किताब ढूँढ रहा है, लेकिन प्रश्न में बीटल दिखाया गया है, तो एक मानक AI कहता है, "कोई मेल नहीं! चित्र अलग हैं!" और हार मान लेता है।

इसलिए, उन्होंने एक नया AI मॉडल बनाया जिसे MIMM IR (Multi-Image Multimodal Retriever) कहा जाता है।

उपमा (Analogy):
एक मानक AI को एक ऐसे लाइब्रेरियन के रूप में सोचें जो यह तय करने के लिए कि क्या प्रासंगिक है, केवल किताब के कवर फोटो को देखता है।

  • लाइब्रेरियन (पुराना AI): बीटल देखता है। "आलू" वाली किताब को देखता है। आलू देखता है। कहता है, "गलत किताब!"

MIMIR (नया AI) को एक ऐसे लाइब्रेरियन के रूप में सोचें जो निर्णय लेने से पहले किताब खोलने और उसके अंदर के हर एक फोटो को देखने के बाद ही फैसला करता है।

  • MIMIR (नया AI): बीटल देखता है। "आलू" वाली किताब खोलता है। वह देखता है कि कवर पर आलू है, लेकिन वह पन्ने पलटता है और अंदर आलू खाते हुए बीटल का एक चित्र भी देखता है। वह कहता है, "आहा! इस किताब में बीटल का एक चित्र भी है! यह सही किताब है!"

"आलू" वाले दस्तावेज़ के साथ संबंधित चीजों (जैसे बीटल, आलू, मिट्टी, किसान) के चित्रों को जोड़कर, MIMIR उस संबंध को खोज सकता है भले ही मुख्य कवर फोटो मेल न खाता हो।

यह क्यों महत्वपूर्ण है

  1. वास्तविक दुनिया के कौशल: वास्तविक दुनिया में, जानकारी बिखरी हुई और जटिल होती है। यदि आप किसी डॉक्टर से किसी रैश (rash) के बारे में पूछते हैं, तो उन्हें त्वचा के बारे में किताब के बजाय उस वायरस के बारे में किताब देखने की आवश्यकता हो सकती है जो उसका कारण है। पुराना AI इतना आलसी था; नया वाला इसे स्मार्ट होने के लिए मजबूर करता है।
  2. बेहतर सर्च इंजन: यह ऐसे सर्च इंजन बनाने में मदद करता है जो केवल कीवर्ड या इमेज को मैच नहीं करते, बल्कि चीजों के बीच के संबंधों को समझते हैं।
  3. ईमानदार मूल्यांकन: यह पेपर साबित करता है कि कई पिछले AI टेस्ट "टूटे हुए" थे क्योंकि वे AI को चीटिंग करने देते थे। RETINA एक निष्पक्ष परीक्षण है जो दिखाता है कि कौन वास्तव में स्मार्ट है और कौन केवल अनुमान लगा रहा है।

सारांश

  • समस्या: पुराने AI मॉडल पढ़ने के बजाय चित्र मिलाकर चीटिंग कर रहे थे।
  • समाधान (RETINA): एक नया डेटासेट जहाँ प्रश्न का चित्र और उत्तर वाली किताब का चित्र अलग-अलग होते हैं, जिससे AI को सोचने के लिए मजबूर किया जाता है।
  • नायक (MIMIR): एक नया AI मॉडल जो एक दस्तावेज़ के अंदर के सभी चित्रों को देखता है (केवल कवर नहीं), ताकि सही उत्तर मिल सके, भले ही विजुअल संकेत पेचीदा हों।

यह पेपर मूल रूप से कह रहा है: "AI को शॉर्टकट लेने से रोकें। आइए इसे एक असली पहेली दें, और इसे हल करने के लिए एक स्मार्ट जासूस बनाएँ।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →