DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams
यह शोध पत्र DRAGON को पेश करता है, जो एक बेंचमार्क डेटासेट और मूल्यांकन ढांचा है जिसे विजन-लैंग्वेज मॉडल्स की आरेखों (डायग्राम्स) के भीतर विशिष्ट दृश्य साक्ष्यों में अपने उत्तरों को ग्राउंड करने की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है, जो विश्वसनीय तर्क औचित्य के बिना उच्च सटीकता की सीमा को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक परीक्षा दे रहे हैं जहाँ आपको एक जटिल आरेख (diagram) को देखना है—जैसे कि एक मानचित्र, एक सर्किट बोर्ड, या एक बार चार्ट—और उस पर आधारित एक प्रश्न का उत्तर देना है।
अतीत में, यदि किसी कंप्यूटर प्रोग्राम (एक AI) को सही उत्तर मिल जाता था, तो हम मान लेते थे कि वह चित्र को "समझता" है। लेकिन यह नया शोध पत्र, DRAGON, तर्क देता है कि सही उत्तर मिलना ही काफी नहीं है। AI धोखाधड़ी कर सकता है। वह चित्र के विशिष्ट हिस्सों को देखे बिना, केवल प्रश्न के शब्दों या डेटा के पैटर्न के आधार पर उत्तर का अनुमान लगा सकता है।
इसे एक छात्र की तरह समझें जो गणित की परीक्षा दे रहा है।
- पुराना तरीका: यदि छात्र उत्तर के रूप में "42" लिखता है, तो शिक्षक उसे सही का निशान दे देता है। हमें नहीं पता कि उसने गणित किया या सिर्फ अनुमान लगाया।
- DRAGON का तरीका: शिक्षक छात्र से उसका काम दिखाने की मांग करता है। छात्र को उन विशिष्ट संख्याओं को घेरना होगा जिनका उसने उपयोग किया है, सूत्रों (formulas) की ओर तीर खींचने होंगे, और ग्राफ के उस हिस्से को हाइलाइट करना होगा जिसने "42" तक पहुँचाया। यदि वह साक्ष्य (evidence) की ओर इशारा नहीं कर सकता, तो उसने वास्तव में समस्या को हल नहीं किया है, भले ही अंतिम संख्या सही क्यों न हो।
DRAGON क्या है?
DRAGON एक नया "टेस्ट" (बेंचमार्क) है जिसे अनुमान लगाने वाले AI मॉडल को पकड़ने के लिए डिज़ाइन किया गया है। यह एक सरल लेकिन कठिन प्रश्न पूछता है: "मुझे ठीक से दिखाओ कि आपने चित्र में उत्तर कहाँ पाया।"
इस टेस्ट को पास करने के लिए, AI को उस दृश्य सुराग (visual clue) के चारों ओर एक बॉक्स बनाना होगा जिसका उसने उपयोग किया है। ये सुराग हो सकते हैं:
- चार्ट पर एक विशिष्ट बार (bar)।
- मानचित्र पर एक लेबल।
- सर्किट आरेख में एक तार।
- एक लेजेंड (legend) या शीर्षक।
उन्होंने टेस्ट कैसे बनाया
शोधकर्ताओं ने केवल AI से अनुमान लगाने के लिए नहीं कहा; उन्होंने छह अलग-अलग प्रकार के आरेखों (चार्ट, मानचित्र, सर्किट आदि) से 11,000+ प्रश्नों का एक विशाल पुस्तकालय बनाया।
प्रत्येक प्रश्न के लिए, मानव "सत्यवादी" (truth-tellers) के रूप में कार्य करते थे। उन्होंने आरेख और सही उत्तर को देखा, फिर उत्तर को सिद्ध करने के लिए आवश्यक दृश्य साक्ष्य के चारों ओर सटीक बॉक्स बनाए।
- उपमा: कल्पना कीजिए कि एक जासूस अपराध सुलझा रहा है। मानव एनोटेटर वे लोग हैं जो कहते हैं, "सुराग केवल पूरा कमरा नहीं है; सुराग फर्श पर यह विशिष्ट कीचड़ वाला पदचिह्न (footprint) है।" AI को फिर उसी पदचिह्न को खोजना होता है।
उन्होंने AI से तीन तरीकों से पूछा
शोधकर्ताओं ने तीन अलग-अलग "प्रॉम्प्ट्स" (AI से पूछने के तरीके) का परीक्षण किया यह देखने के लिए कि क्या वह अपना काम दिखाना सीख सकता है:
- EDGE (सीधा दृष्टिकोण): "यहाँ चित्र और उत्तर है। बस साक्ष्य के चारों ओर बॉक्स बना दें।" (जैसे किसी छात्र से केवल उत्तर लिखने के लिए कहना)।
- SAGE (चरण-दर-चरण दृष्टिकोण): "पहले, मुझे बताएं कि आपको किन चीजों को देखने की आवश्यकता है (जैसे, 'लाल बार' और 'वर्ष 2020')। फिर, उनके चारों ओर बॉक्स बनाएं।" (जैसे किसी छात्र को हल करने से पहले अपने चरणों को सूचीबद्ध करने के लिए कहना)।
- VERGE (स्व-सुधार दृष्टिकोण): "अपने बॉक्स बनाएं। अब, अपने ड्राइंग को फिर से देखें। क्या आप कुछ भूल गए हैं? क्या आपका बॉक्स बहुत बड़ा है? इसे ठीक करें।" (जैसे किसी छात्र को अपना काम दोबारा जांचने के लिए कहना)।
उन्हें क्या मिला (परिणाम)
परिणाम थोड़े चौंकाने वाले थे:
- AI अनुमान लगाने में अच्छा है, साबित करने में बुरा: कई AI मॉडल सही उत्तर पा लेते हैं, लेकिन जब उन्हें बॉक्स बनाने के लिए कहा जाता है, तो वे बुरी तरह विफल हो जाते हैं। वे अक्सर चित्र के गलत हिस्से की ओर इशारा करते हैं या महत्वपूर्ण विवरणों को छोड़ देते हैं।
- "ब्लैक बॉक्स" की समस्या: यहाँ तक कि सबसे स्मार्ट AI मॉडल (जैसे Claude Opus या Gemini) भी अपना काम दिखाने में संघर्ष करते हैं। वे कह सकते हैं "उत्तर 50 है," लेकिन वे चार्ट पर "50" की ओर विश्वसनीय रूप से इशारा नहीं कर सकते।
- कुछ मॉडल दूसरों से बेहतर हैं: "क्लोज्ड-सोर्स" मॉडल (Anthropic और Google जैसी कंपनियों के बड़े, महंगे मॉडल) ओपन-सोर्स मॉडल की तुलना में साक्ष्य खोजने में बेहतर थे, लेकिन उनमें से कोई भी पूर्ण नहीं था।
- विनम्रता से मदद मिलती है: चरण-दर-चरण (SAGE) या स्व-सुधार (VERGE) विधियों का उपयोग करने से AI सही स्थानों को थोड़ा अधिक बार ढूंढ पाता है, लेकिन इसने मौलिक समस्या को ठीक नहीं किया। AI अभी भी अक्सर साक्ष्य के हिस्सों को छोड़ देता है।
यह क्यों महत्वपूर्ण है
शोध पत्र निष्कर्ष निकालता है कि हम केवल इसलिए AI पर भरोसा नहीं कर सकते कि वह आरेखों के बारे में तर्क करता है क्योंकि वह सही उत्तर दे देता है। यदि AI का उपयोग मेडिकल चार्ट, वित्तीय ग्राफ या सुरक्षा आरेखों का विश्लेषण करने के लिए किया जा रहा है, तो हमें यह जानने की आवश्यकता है कि उसने निर्णय क्यों लिया।
DRAGON एक उपकरण है जो AI को अनुमान लगाना बंद करने और अपना "काम दिखाने" के लिए मजबूर करता है। यह एक नया मानक है यह सुनिश्चित करने के लिए कि जब कोई AI कहता है कि वह एक चित्र को समझता है, तो वह वास्तव में प्रमाण की ओर इशारा कर सके।
सीमाएं
लेखक स्वीकार करते हैं कि उनका टेस्ट परफेक्ट नहीं है। वे साक्ष्य को चिह्नित करने के लिए सरल आयताकार बॉक्स का उपयोग करते हैं। यह बड़े बार या ब्लॉक्स के लिए तो काम करता है, लेकिन सर्किट आरेख में एक पतले, घुमावदार तार या मानचित्र पर एक मुड़े हुए तीर को चिह्नित करने के लिए बॉक्स का उपयोग करना कठिन है। इसके अलावा, कभी-कभी अलग-अलग मनुष्य इस बात पर असहमत हो सकते हैं कि चित्र का कौन सा हिस्सा "सबसे महत्वपूर्ण" सुराग है, जो इस टेस्ट में थोड़ी व्यक्तिपरकता (subjectivity) जोड़ता है।
संक्षेप में: DRAGON एक नया नियम संग्रह है जो कहता है, "मुझे केवल उत्तर मत दो; मुझे चित्र में साक्ष्य दिखाओ।" और वर्तमान में, अधिकांश AI छात्र इस टेस्ट में फेल हो रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।