← नवीनतम पेपर
💬 NLP

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

यह शोधपत्र InterChart प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जिसे विजन-लैंग्वेज मॉडल्स की कई संबंधित चार्ट्स के बीच तर्क करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि विघटित दृश्य कार्यों (decomposed visual tasks) पर बेहतर प्रदर्शन के बावजूद वर्तमान अत्याधुनिक मॉडल क्रॉस-चार्ट एकीकरण और जटिल बहु-चरणीय तर्क में काफी संघर्ष करते हैं।

मूल लेखक: Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में, लेकिन आपको केवल एक सुराग देखने के बजाय, एक साथ तीन अलग-अलग मानचित्रों, एक मौसम रिपोर्ट और एक स्टॉक टिकर को देखना पड़ता है ताकि उत्तर मिल सके। यही वह चुनौती है जो INTERCHART आर्टिफिशियल इंटेलिजेंस के लिए पेश करता है।

यहाँ इस पेपर में दी गई बातों का एक सरल विवरण दिया गया, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।

बड़ी समस्या: AI एक चीज़ में अच्छा है, कई चीज़ों में बुरा

वर्तमान AI मॉडल (जिन्हें विजन-लैंग्वेज मॉडल्स कहा जाता है) उन छात्रों की तरह हैं जो एक ही पाठ्यपुस्तक के पन्ने को पढ़ने और उस पर आधारित प्रश्न का उत्तर देने में बहुत अच्छे हैं। यदि आप उन्हें एक चार्ट (जैसे बिक्री का बार ग्राफ) दिखाते हैं, तो वे आमतौर पर आपको उच्चतम संख्या बता सकते हैं।

लेकिन वास्तविक दुनिया में, डेटा शायद ही कभी केवल एक चार्ट होता है। वैज्ञानिक, बैंकर और पत्रकार अक्सर एक कहानी बताने के लिए कई चार्टों का एक साथ उपयोग करते हैं। एक चार्ट तापमान दिखा सकता है, दूसरा आइसक्रीम की बिक्री, और तीसरा वर्षा। पूरी तस्वीर को समझने के लिए, आपको उनके बीच के बिंदुओं को जोड़ना होगा।

यह पेपर तर्क देता है कि वर्तमान AI मॉडल इस "बिंदुओं को जोड़ने" (connecting the dots) के कार्य में बहुत खराब हैं। जब उन्हें दो या तीन अलग-अलग चार्टों को देखना होता है और यह पता लगाना होता है कि वे एक-दूसरे से कैसे संबंधित हैं, तो वे भ्रमित हो जाते हैं।

समाधान: AI के लिए एक नया "जिम" (INTERCHART)

शोधकर्ताओं ने INTERCHART नामक एक नया परीक्षण मैदान बनाया है। इसे एक जिम के रूप में सोचें जिसमें कठिनाई के तीन अलग-अलग स्तर हैं, जिसे यह परीक्षण करने के लिए डिज़ाइन किया गया है कि AI जटिल दृश्य पहेलियों को कितनी अच्छी तरह संभाल सकता है।

स्तर 1: "डीकंपोज्ड" वार्म-अप (DECAF)

  • उपमा: एक बिखरे हुए कमरे की कल्पना करें जो खिलौनों से भरा है। इस स्तर में, शोधकर्ता एक बिखरे हुए कमरे को व्यवस्थित करके उसे अलग-अलग बक्सों में बाँट देते हैं।
  • यह क्या परीक्षण करता है: वे जटिल चार्टों को लेते हैं और उन्हें सरल, एकल-चर (single-variable) टुकड़ों में तोड़ देते हैं। वे AI से सरल प्रश्न पूछते हैं जैसे, "इस विशिष्ट रेखा पर संख्या क्या है?"
  • परिणाम: AI यहाँ काफी अच्छा प्रदर्शन करता है। जब जानकारी साफ और अलग होती है, तो AI तथ्य खोज सकता है।

स्तर 2: "सिंथेटिक" मध्य स्तर (SPECTRA)

  • उपमा: अब, एक ही शहर के दो अलग-अलग मानचित्रों की कल्पना करें, लेकिन एक नीले रंग में बना है और दूसरा लाल रंग में। वे संबंधित चीजें दिखाते हैं (जैसे ट्रैफिक और मौसम), लेकिन वे अलग दिखते हैं।
  • यह क्या परीक्षण करता है: AI को दो चार्टों को देखना होता है जो संबंधित हैं (जैसे, "बारिश ट्रैफिक को कैसे प्रभावित करती है?") लेकिन वे अलग-अलग शैलियों में बनाए गए हैं। उसे यह समझना होगा कि पहले चार्ट पर "बारिश" दूसरे चार्ट के "वर्षा" (Precipitation) से मेल खाती है।
  • परिणाम: AI लड़खड़ाने लगता है। उसे यह समझने में संघर्ष करना पड़ता है कि दो अलग-अलग दिखने वाले चार्ट वास्तव में एक ही चीज़ के बारे में बात कर रहे हैं।

स्तर 3: "रियल-वर्ल्ड" बॉस फाइट (STORM)

  • उपमा: यह सबसे कठिन स्तर है। एक समाचार लेख को देखने की कल्पना करें जिसमें अलग-अलग वर्षों के तीन अलग-अलग चार्ट हैं, जिन्हें अलग-अलग लोगों द्वारा बनाया गया है, और जिनमें अलग-अलग रंग और लेबल हैं। आपको उन सभी में से एक रुझान (trend) को समझना है।
  • यह क्या परीक्षण करता है: इसमें इंटरनेट से लिए गए वास्तविक चार्ट का उपयोग किया जाता है (जैसे आर्थिक रिपोर्ट)। चार्ट अस्त-व्यस्त होते हैं, लेबल पूरी तरह से मेल नहीं खाते, और AI को "टाइम ट्रैवल" तर्क करने की आवश्यकता होती है (जैसे, "2015 में, देश A, देश B से ऊपर था, लेकिन 2020 तक, वे आपस में बदल गए। बीच में क्या हुआ?")।
  • परिणाम: AI का प्रदर्शन गिर जाता है। यहाँ तक कि सबसे स्मार्ट मॉडल भी भ्रमित हो जाते हैं। वे अव्यवस्था और विभिन्न दृश्य शैलियों के बीच विचारों को जोड़ने की आवश्यकता को नहीं संभाल पाते हैं।

"जिम" से मुख्य खोजें

  1. सरलीकरण मदद करता है: पेपर में पाया गया कि यदि आप एक अस्त-व्यस्त चार्ट को AI से पूछने से पहले एक सरल टेक्स्ट टेबल (जैसे स्प्रेडशीट) में बदल देते हैं, तो AI अधिक स्मार्ट हो जाता है। यह एक जासूस को तस्वीरों के ढेर के बजाय सुरागों की लिखित सूची देने जैसा है। AI को टेबल पसंद हैं; उसे अस्त-व्यस्त छवियों से नफरत है।
  2. अधिक चरण = अधिक भ्रम: बिंदुओं को जोड़ने के लिए AI को जितने अधिक चरणों से गुजरना पड़ता है (जैसे, "चार्ट A देखें, फिर चार्ट B देखें, फिर उनकी तुलना करें, फिर भविष्य का अनुमान लगाएं"), उसके विफल होने की संभावना उतनी ही अधिक होती है।
  3. असली बनाम नकली: AI "नकली" चार्टों (जो कंप्यूटर द्वारा बनाए गए साफ और सटीक होते हैं) पर तर्क करने में ठीक है, लेकिन वह समाचारों के "असली" चार्टों (जो अस्त-व्यस्त और अपूर्ण होते हैं) पर बुरी तरह विफल हो जाता है। इसका मतलब है कि AI ने वास्तव में तर्क करना नहीं सीखा है; उसने केवल साफ डेटा से पैटर्न को याद किया है।
  4. "जज" की समस्या: शोधकर्ताओं ने यह भी महसूस किया कि केवल यह जांचना कि AI का उत्तर सही उत्तर से शब्द-दर-शब्द मेल खाता है या नहीं, निष्पक्ष नहीं है। यदि उत्तर "25%" है और AI कहता है "लगभग एक चौथाई," तो एक कंप्यूटर इसे "गलत" कह सकता है, लेकिन एक इंसान इसे "सही" कहेगा। इसलिए, उन्होंने यह जांचने के लिए अन्य AI का उपयोग किया कि अर्थ सही है या नहीं, न कि केवल स्पेलिंग।

निचोड़

पेपर निष्कर्ष निकालता है कि हालांकि AI चित्रों को देखने में बेहतर हो रहा है, लेकिन यह कई, अस्त-व्यस्त स्रोतों से जानकारी को संश्लेषित (synthesize) करने में अभी भी बहुत खराब है। यह उस छात्र की तरह है जो एक वाक्य को पूरी तरह से पढ़ सकता है लेकिन तीन अलग-अलग किताबों को जोड़ने वाला निबंध लिखने में विफल रहता है।

INTERCHART बेंचमार्क एक उपकरण है जो शोधकर्ताओं को यह दिखाने के लिए है कि उनके AI मॉडल कहाँ और क्यों विफल हो रहे हैं, ताकि वे बेहतर मॉडल बना सकें जो वास्तविक दुनिया की अस्त-व्यस्त, बहु-चार्ट वास्तविकता को संभाल सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →