← नवीनतम पेपर
💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

यह शोध पत्र DRAGON को पेश करता है, जो एक बेंचमार्क डेटासेट और मूल्यांकन ढांचा है जिसे विजन-लैंग्वेज मॉडल्स की आरेखों (डायग्राम्स) के भीतर विशिष्ट दृश्य साक्ष्यों में अपने उत्तरों को ग्राउंड करने की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है, जो विश्वसनीय तर्क औचित्य के बिना उच्च सटीकता की सीमा को संबोधित करता है।

मूल लेखक: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक परीक्षा दे रहे हैं जहाँ आपको एक जटिल आरेख (diagram) को देखना है—जैसे कि एक मानचित्र, एक सर्किट बोर्ड, या एक बार चार्ट—और उस पर आधारित एक प्रश्न का उत्तर देना है।

अतीत में, यदि किसी कंप्यूटर प्रोग्राम (एक AI) को सही उत्तर मिल जाता था, तो हम मान लेते थे कि वह चित्र को "समझता" है। लेकिन यह नया शोध पत्र, DRAGON, तर्क देता है कि सही उत्तर मिलना ही काफी नहीं है। AI धोखाधड़ी कर सकता है। वह चित्र के विशिष्ट हिस्सों को देखे बिना, केवल प्रश्न के शब्दों या डेटा के पैटर्न के आधार पर उत्तर का अनुमान लगा सकता है।

इसे एक छात्र की तरह समझें जो गणित की परीक्षा दे रहा है।

  • पुराना तरीका: यदि छात्र उत्तर के रूप में "42" लिखता है, तो शिक्षक उसे सही का निशान दे देता है। हमें नहीं पता कि उसने गणित किया या सिर्फ अनुमान लगाया।
  • DRAGON का तरीका: शिक्षक छात्र से उसका काम दिखाने की मांग करता है। छात्र को उन विशिष्ट संख्याओं को घेरना होगा जिनका उसने उपयोग किया है, सूत्रों (formulas) की ओर तीर खींचने होंगे, और ग्राफ के उस हिस्से को हाइलाइट करना होगा जिसने "42" तक पहुँचाया। यदि वह साक्ष्य (evidence) की ओर इशारा नहीं कर सकता, तो उसने वास्तव में समस्या को हल नहीं किया है, भले ही अंतिम संख्या सही क्यों न हो।

DRAGON क्या है?

DRAGON एक नया "टेस्ट" (बेंचमार्क) है जिसे अनुमान लगाने वाले AI मॉडल को पकड़ने के लिए डिज़ाइन किया गया है। यह एक सरल लेकिन कठिन प्रश्न पूछता है: "मुझे ठीक से दिखाओ कि आपने चित्र में उत्तर कहाँ पाया।"

इस टेस्ट को पास करने के लिए, AI को उस दृश्य सुराग (visual clue) के चारों ओर एक बॉक्स बनाना होगा जिसका उसने उपयोग किया है। ये सुराग हो सकते हैं:

  • चार्ट पर एक विशिष्ट बार (bar)।
  • मानचित्र पर एक लेबल।
  • सर्किट आरेख में एक तार।
  • एक लेजेंड (legend) या शीर्षक।

उन्होंने टेस्ट कैसे बनाया

शोधकर्ताओं ने केवल AI से अनुमान लगाने के लिए नहीं कहा; उन्होंने छह अलग-अलग प्रकार के आरेखों (चार्ट, मानचित्र, सर्किट आदि) से 11,000+ प्रश्नों का एक विशाल पुस्तकालय बनाया।

प्रत्येक प्रश्न के लिए, मानव "सत्यवादी" (truth-tellers) के रूप में कार्य करते थे। उन्होंने आरेख और सही उत्तर को देखा, फिर उत्तर को सिद्ध करने के लिए आवश्यक दृश्य साक्ष्य के चारों ओर सटीक बॉक्स बनाए।

  • उपमा: कल्पना कीजिए कि एक जासूस अपराध सुलझा रहा है। मानव एनोटेटर वे लोग हैं जो कहते हैं, "सुराग केवल पूरा कमरा नहीं है; सुराग फर्श पर यह विशिष्ट कीचड़ वाला पदचिह्न (footprint) है।" AI को फिर उसी पदचिह्न को खोजना होता है।

उन्होंने AI से तीन तरीकों से पूछा

शोधकर्ताओं ने तीन अलग-अलग "प्रॉम्प्ट्स" (AI से पूछने के तरीके) का परीक्षण किया यह देखने के लिए कि क्या वह अपना काम दिखाना सीख सकता है:

  1. EDGE (सीधा दृष्टिकोण): "यहाँ चित्र और उत्तर है। बस साक्ष्य के चारों ओर बॉक्स बना दें।" (जैसे किसी छात्र से केवल उत्तर लिखने के लिए कहना)।
  2. SAGE (चरण-दर-चरण दृष्टिकोण): "पहले, मुझे बताएं कि आपको किन चीजों को देखने की आवश्यकता है (जैसे, 'लाल बार' और 'वर्ष 2020')। फिर, उनके चारों ओर बॉक्स बनाएं।" (जैसे किसी छात्र को हल करने से पहले अपने चरणों को सूचीबद्ध करने के लिए कहना)।
  3. VERGE (स्व-सुधार दृष्टिकोण): "अपने बॉक्स बनाएं। अब, अपने ड्राइंग को फिर से देखें। क्या आप कुछ भूल गए हैं? क्या आपका बॉक्स बहुत बड़ा है? इसे ठीक करें।" (जैसे किसी छात्र को अपना काम दोबारा जांचने के लिए कहना)।

उन्हें क्या मिला (परिणाम)

परिणाम थोड़े चौंकाने वाले थे:

  • AI अनुमान लगाने में अच्छा है, साबित करने में बुरा: कई AI मॉडल सही उत्तर पा लेते हैं, लेकिन जब उन्हें बॉक्स बनाने के लिए कहा जाता है, तो वे बुरी तरह विफल हो जाते हैं। वे अक्सर चित्र के गलत हिस्से की ओर इशारा करते हैं या महत्वपूर्ण विवरणों को छोड़ देते हैं।
  • "ब्लैक बॉक्स" की समस्या: यहाँ तक कि सबसे स्मार्ट AI मॉडल (जैसे Claude Opus या Gemini) भी अपना काम दिखाने में संघर्ष करते हैं। वे कह सकते हैं "उत्तर 50 है," लेकिन वे चार्ट पर "50" की ओर विश्वसनीय रूप से इशारा नहीं कर सकते।
  • कुछ मॉडल दूसरों से बेहतर हैं: "क्लोज्ड-सोर्स" मॉडल (Anthropic और Google जैसी कंपनियों के बड़े, महंगे मॉडल) ओपन-सोर्स मॉडल की तुलना में साक्ष्य खोजने में बेहतर थे, लेकिन उनमें से कोई भी पूर्ण नहीं था।
  • विनम्रता से मदद मिलती है: चरण-दर-चरण (SAGE) या स्व-सुधार (VERGE) विधियों का उपयोग करने से AI सही स्थानों को थोड़ा अधिक बार ढूंढ पाता है, लेकिन इसने मौलिक समस्या को ठीक नहीं किया। AI अभी भी अक्सर साक्ष्य के हिस्सों को छोड़ देता है।

यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि हम केवल इसलिए AI पर भरोसा नहीं कर सकते कि वह आरेखों के बारे में तर्क करता है क्योंकि वह सही उत्तर दे देता है। यदि AI का उपयोग मेडिकल चार्ट, वित्तीय ग्राफ या सुरक्षा आरेखों का विश्लेषण करने के लिए किया जा रहा है, तो हमें यह जानने की आवश्यकता है कि उसने निर्णय क्यों लिया।

DRAGON एक उपकरण है जो AI को अनुमान लगाना बंद करने और अपना "काम दिखाने" के लिए मजबूर करता है। यह एक नया मानक है यह सुनिश्चित करने के लिए कि जब कोई AI कहता है कि वह एक चित्र को समझता है, तो वह वास्तव में प्रमाण की ओर इशारा कर सके।

सीमाएं

लेखक स्वीकार करते हैं कि उनका टेस्ट परफेक्ट नहीं है। वे साक्ष्य को चिह्नित करने के लिए सरल आयताकार बॉक्स का उपयोग करते हैं। यह बड़े बार या ब्लॉक्स के लिए तो काम करता है, लेकिन सर्किट आरेख में एक पतले, घुमावदार तार या मानचित्र पर एक मुड़े हुए तीर को चिह्नित करने के लिए बॉक्स का उपयोग करना कठिन है। इसके अलावा, कभी-कभी अलग-अलग मनुष्य इस बात पर असहमत हो सकते हैं कि चित्र का कौन सा हिस्सा "सबसे महत्वपूर्ण" सुराग है, जो इस टेस्ट में थोड़ी व्यक्तिपरकता (subjectivity) जोड़ता है।

संक्षेप में: DRAGON एक नया नियम संग्रह है जो कहता है, "मुझे केवल उत्तर मत दो; मुझे चित्र में साक्ष्य दिखाओ।" और वर्तमान में, अधिकांश AI छात्र इस टेस्ट में फेल हो रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →