← नवीनतम पेपर
💻 computer science

ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

यह शोधपत्र ChartArena को प्रस्तुत करता है, जो डिजिटल, मुद्रित और हस्तलिखित परिदृश्यों में आठ चार्ट परिवारों वाला एक व्यापक द्विभाषी बेंचमार्क है, जिसमें एक प्रारूप-अज्ञेय (format-agnostic) मूल्यांकन प्रोटोकॉल शामिल है, ताकि विविध प्रकार के चार्टों को पार्स करने में 26 अग्रणी मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की वर्तमान क्षमताओं और सीमाओं का व्यवस्थित रूप से आकलन और अनावरण किया जा सके।

मूल लेखक: Shangpin Peng, Gengluo Li, Xingyu Wan, Chengquan Zhang, Hao Feng, Binghong Wu, Huawen Shen, Weinong Wang, Ziyi Cai, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

प्रकाशित 2026-06-02✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shangpin Peng, Gengluo Li, Xingyu Wan, Chengquan Zhang, Hao Feng, Binghong Wu, Huawen Shen, Weinong Wang, Ziyi Cai, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास चार्ट, ग्राफ और आरेख (diagrams) का एक विशाल पुस्तकालय है। कुछ कंप्यूटर द्वारा बनाए गए साफ-सुथरे चित्र हैं, कुछ ऑफिस के बिखरे हुए कागजों की तस्वीरें हैं, और कुछ व्हाइटबोर्ड पर बनाए गए रफ स्केच हैं। अब, कल्पना कीजिए कि आप एक रोबोट को इन चित्रों को पढ़ना और उन्हें तथ्यों की एक सूची (जैसे कि एक स्प्रेडशीट) या कनेक्शन के एक मानचित्र (जैसे कि एक फैमिली ट्री) में बदलना सिखाना चाहते हैं।

यह शोध पत्र ChartArena को पेश करता है, जो एक विशाल नया "टेस्ट ट्रैक" है जिसे यह देखने के लिए बनाया गया है कि अलग-अलग रोबोट (AI मॉडल्स) इस कार्य में कितने कुशल हैं।

इस शोध पत्र का विवरण सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:

1. समस्या: "भाषा की बाधा" और "साफ कमरे" का मुद्दा

इस शोध पत्र से पहले, इन रोबोट्स का परीक्षण करना एक ऐसी दौड़ में धावकों की तुलना करने जैसा था जहाँ:

  • नियम बदल रहे थे: एक धावक को अपना उत्तर अंग्रेजी में लिखना था, दूसरे को स्पेनिश में, और तीसरे को मोर्स कोड में। आप आसानी से तुलना नहीं कर सकते थे कि कौन तेज़ था क्योंकि उनके उत्तर बहुत अलग दिखते थे।
  • ट्रैक नकली था: अधिकांश परीक्षणों में केवल पूर्ण, कंप्यूटर-जनरेटेड चार्ट का उपयोग किया जाता था। यह एक ड्राइवर को केवल एक चिकने, खाली रेस ट्रैक पर प्रशिक्षित करने जैसा था, और फिर यह उम्मीद करना कि वह बारिश में ऊबड़-खाबड़ कच्ची सड़क पर भी पूरी तरह से गाड़ी चला लेगा। वास्तविक जीवन में धुंधली तस्वीरें, टेढ़े कोण और बिखरा हुआ हस्तलेखन होता है, लेकिन पुराने परीक्षणों ने इन्हें अनदेखा कर दिया।
  • दायरा संकीमित था: परीक्षण मुख्य रूप से साधारण बार ग्राफ और पाई चार्ट तक सीमित थे। उन्होंने फ्लोचार्ट (निर्णय वृक्ष/decision trees) या माइंड मैप जैसे जटिल आरेखों की अनदेखी की, जो विचारों के जाल की तरह होते हैं न कि केवल संख्याओं के बजाय।

2. समाधान: ChartArena (अल्टीमेट बाधा दौड़)

लेखकों ने ChartArena बनाया है, जो एक नया, सुपर-व्यापक परीक्षण है जो उपरोक्त सभी समस्याओं को ठीक करता है।

  • आठ अलग-अलग "बाधाएं": यह परीक्षण आठ प्रकार के चार्टों को कवर करता है, जिनमें साधारण संख्यात्मक चार्ट (बार, लाइन, पाई) से लेकर जटिल संरचनात्मक आरेख (फ्लोचार्ट, माइंड मैप) शामिल हैं।
  • तीन "मौसम की स्थितियां": प्रत्येक चार्ट का तीन तरीकों से परीक्षण किया जाता है:
    1. डिजिटल: एक पूर्ण, स्पष्ट कंप्यूटर छवि।
    2. प्रिंटेड: एक कागजी दस्तावेज़ की फोटो (जो थोड़ी धुंधली या टेढ़ी हो सकती है)।
    3. हस्तलिखित (Hand-Drawn): व्हाइटबोर्ड या नोटबुक पर बने स्केच की एक फोटो (बिखरी हुई स्याही, असमान रेखाएं)।
  • दो भाषाएँ: यह परीक्षण द्विभाषी है, जिसमें अंग्रेजी और चीनी दोनों शामिल हैं।
  • "मानव-एजेंट" टीम: यह सुनिश्चित करने के लिए कि उत्तर सही हैं, उन्होंने एक टीम दृष्टिकोण का उपयोग किया। एक AI ने उत्तर का पहला ड्राफ्ट बनाया, और फिर मानव विशेषज्ञों ने इसे कई बार जांचा और सुधारा। यह सुनिश्चित करता है कि "गोल्ड स्टैंडर्ड" उत्तर विश्वसनीय हों।

3. स्कोरिंग सिस्टम: "यूनिवर्सल ट्रांसलेटर"

चूंकि अलग-अलग रोबोट अलग-अलग प्रारूपों में उत्तर देते हैं (कुछ कोड लिखते हैं, कुछ टेबल, कुछ सूचियाँ), तो आप निष्पक्ष रूप से स्कोर कैसे कर सकते हैं?

लेखकों ने एक यूनिवर्सल ट्रांसलेटर बनाया है।

  • संख्यात्मक चार्ट के लिए: चाहे रोबोट ने पायथन स्क्रिप्ट लिखी हो, CSV फ़ाइल लिखी हो, या मार्कडाउन टेबल, सिस्टम इन सभी को एक सरल "कौन, क्या, कितना" (Triples) की सूची में अनुवादित कर देता है।
  • आरेखों (Diagrams) के लिए: चाहे रोबमाट ने Mermaid, Graphviz, या PlantUML का उपयोग किया हो, सिस्टम इसे डॉट्स और लाइनों के एक मानचित्र (Directed Graph) में अनुवादित कर देता है।

एक बार जब सब कुछ इस सामान्य भाषा में अनुवादित हो जाता है, तो सिस्टम स्कोर करता है। यह केवल यह नहीं देखता कि शब्द बिल्कुल मेल खाते हैं या नहीं; यह जाँचता है कि क्या संरचना समझ में आती है। यह किसी छात्र के निबंध को ग्रेड देने जैसा है: यदि वे सही पर्यायवाची शब्दों का उपयोग करते हैं और मुख्य विचार को सही समझते हैं, तो उन्हें अंक मिलते हैं, भले ही उनकी वर्तनी (spelling) एकदम सटीक न हो।

4. परिणाम: दौड़ में कौन जीता?

लेखकों ने इस नए ट्रैक पर 26 अलग-अलग AI मॉडल्स का परीक्षण किया। यहाँ उन्हें क्या मिला:

  • "बिग टेक" रोबोट सबसे आगे हैं: सबसे उन्नत, सशुल्क मॉडल (जैसे Gemini 3.1 Pro) वर्तमान में इस काम में सर्वश्रेष्ठ हैं। हालांकि, सबसे अच्छे मुफ्त, ओपन-सोर्स मॉडल बहुत तेज़ी से बराबरी कर रहे हैं।
  • "डॉक्यूमेंट रीडर्स" केवल एक ही काम के विशेषज्ञ हैं: कुछ मॉडल दस्तावेज़ों और सरल संख्यात्मक चार्टों को पढ़ने में बहुत अच्छे हैं। लेकिन जब आप उन्हें एक जटिल फ्लोचार्ट या माइंड मैप दिखाते हैं, तो वे खो जाते हैं। उनमें यह समझने के लिए "विश्व ज्ञान" (world knowledge) की कमी होती है कि विचार आपस में कैसे जुड़ते हैं।
  • "विशेषज्ञ" बहुत अधिक विशिष्ट हैं: कुछ मॉडल विशेष रूप से चार्ट के लिए बनाए गए हैं। हालांकि वे साधारण बार ग्राफ के लिए ठीक हैं, लेकिन जटिल आरेखों या हस्तलिखित स्केच के सामने वे पूरी तरह विफल हो जाते हैं। उन्होंने वास्तविक दुनिया को संभालने के लिए पर्याप्त विविधता नहीं सीखी है।
  • सबसे कठिन चुनौतियां:
    • रडार चार्ट: ये गोलाकार चार्ट (मकड़ी के जाल की तरह) सभी के लिए पढ़ने में सबसे कठिन हैं।
    • हस्तलिखित स्केच: जब इनपुट एक बिखरे हुए स्केच की फोटो होती है, तो सभी मॉडल्स का प्रदर्शन काफी गिर जाता है।

5. निष्कर्ष (Takeaway)

लेखक निष्कर्ष निकालते हैं कि हालांकि AI चार्ट पढ़ने में बेहतर हो रहा है, लेकिन एक आदर्श लैब सेटिंग में उनके द्वारा किए जा रहे कार्यों और वास्तविक दुनिया की अव्यवस्था के बीच अभी भी एक बड़ा अंतर है।

ChartArena प्रगति को मापने का एक निष्पक्ष, एकीकृत तरीका प्रदान करता है। यह हमें स्पष्ट रूप से दिखाता है कि रोबोट कहाँ विफल हो रहे हैं (जटिल आरेख, धुंधली तस्वीरें), ताकि डेवलपर्स जान सकें कि उन्हें वास्तव में विश्वसनीय चार्ट-रीडिंग AI बनाने के लिए कहाँ ध्यान केंद्रित करने की आवश्यकता है।

संक्षेप में: हमारे पास अंततः वास्तविक दुनिया की बाधाओं वाला एक निष्पक्ष रेस ट्रैक है, और अब हम जानते हैं कि कौन से रोबोट वास्तविक दुनिया के लिए तैयार हैं और किन्हें अभी और प्रशिक्षण की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →