ChartAct: A Benchmark for Dynamic Chart Understanding
यह शोधपत्र ChartAct को प्रस्तुत करता है, जो एक नया इंटरैक्टिव बेंचमार्क है जिसमें 7 चार्ट प्रकारों और दो वातावरणों में 1,440 उच्च-गुणवत्ता वाले नमूने शामिल हैं, जो गतिशील चार्ट समझ का मूल्यांकन करने के लिए है, और यह दर्शाता है कि वर्तमान मल्टीमॉडल मॉडल और GUI एजेंट अभी भी इंटरैक्टिव चार्ट संचालन को संभालने में महत्वपूर्ण सीमाओं का सामना कर रहे हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: चार्ट जो चलते हैं और जवाब देते हैं
कल्पना कीजिए कि आप एक नक्शे की स्थिर पेंटिंग (static painting) देख रहे हैं। आप पहाड़ और नदियाँ देख सकते हैं, लेकिन आप छोटे गाँवों को देखने के लिए ज़ूम नहीं कर सकते, और आप यह देखने के लिए किसी नदी पर क्लिक नहीं कर सकते कि पानी कितनी तेज़ी से बह रहा है। आज के अधिकांश AI मॉडल चार्ट को इसी तरह "देखते" हैं। वे एक जमी हुई तस्वीर देखते हैं और उत्तर का अनुमान लगाने की कोशिश करते हैं।
लेकिन वास्तविक दुनिया में, चार्ट इंटरैक्टिव वीडियो गेम की तरह होते हैं।
- आपको एक गुप्त नंबर देखने के लिए अपने माउस को किसी बिंदु (dot) के ऊपर होवर (hover) करने की आवश्यकता हो सकती है।
- आपको एक लाइन को छिपाने और दूसरी को स्पष्ट रूप से देखने के लिए लेजेंड (legend) पर क्लिक करने की आवश्यकता हो सकती है।
- आपको यह देखने के लिए कि समय के साथ डेटा कैसे बदला, एक स्लाइडर को ड्रैग (drag) करने की आवश्यकता हो सकती है।
इस पेपर के लेखकों ने महसूस किया कि AI "जमी हुई पेंटिंग" को पढ़ने में तो बहुत अच्छा है, लेकिन "इंटरैक्टिव गेम" खेलने में बहुत खराब है। इसे ठीक करने के लिए, उन्होंने एक नया टेस्ट बनाया जिसे ChartAct कहा जाता है।
ChartAct क्या है? (वीडियो गेम टेस्ट)
ChartAct को एक वीडियो गेम लेवल के रूप में समझें जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि क्या एक AI वास्तव में चार्ट के साथ खेल सकता है, न कि केवल उसे देख सकता है।
- सेटअप: शोधकर्ताओं ने वास्तविक वेबसाइटों (जैसे वित्तीय डैशबोर्ड या मौसम की साइटों) से 673 वास्तविक चार्ट एकत्र किए। ये कोई नकली चित्र नहीं हैं; ये वे वास्तविक, इंटरैक्टिव चीज़ें हैं जिनका लोग रोज़ाना उपयोग करते हैं।
- मिशन: उन्होंने इन चार्ट्स के लिए 1,440 प्रश्न बनाए। कुछ प्रश्न आसान हैं (आप उत्तर तुरंत देख सकते हैं)। लेकिन पेचीदा प्रश्न वे हैं जिनमें AI को कार्रवाई (action) करनी पड़ती है।
- उदाहरण प्रश्न: "14 सितंबर, 2009 को 4:00 बजे फ्लो वैल्यू क्या थी?"
- चुनौती: वह विशिष्ट नंबर छिपा हुआ है। AI को सही तारीख खोजने के लिए ज़ूम इन (zoom in) करना होगा, और फिर नंबर प्रकट करने के लिए उस विशिष्ट बिंदु पर होवर (hover) करना होगा। यदि यह धुंधली शुरुआती दृश्य के आधार पर केवल अनुमान लगाता है, तो यह विफल हो जाता है।
- दो स्तर (Two Levels): इसे और कठिन बनाने के लिए, उन्होंने AI का परीक्षण दो अलग-अलग "कमरों" में किया:
- क्लीन रूम (डायनेमिक चार्ट): चार्ट स्क्रीन पर अकेला है। इसे ढूँढना आसान है।
- व्यस्त कार्यालय (डैशबोर्ड चार्ट): वही चार्ट बटनों, शीर्षकों और अन्य ग्राफों से भरी एक अव्यवस्थित वेबपेज के अंदर दबा हुआ है। AI को पहले सही चार्ट ढूँढना होगा, फिर उसके साथ इंटरैक्ट करना होगा। यह चलते हुए घास के ढेर (haystack) में सुई खोजने जैसा है।
AI ने कैसा प्रदर्शन किया? (स्कोरबोर्ड)
शोधकर्ताओं ने 11 उन्नत AI मॉडलों (बड़े नामों जैसे Claude, GPT और ओपन-सोर्स मॉडल सहित) को इस टेस्ट के माध्यम से परखा। यहाँ हुआ:
- "स्मार्ट" छात्र: सबसे अच्छा मॉडल, Claude-Opus-4.7, लगभग 84.5% उत्तर सही दे पाया। यह यह समझने में अच्छा था कि, "ओह, मुझे पहले ज़ूम इन करने की ज़रूरत है," और फिर उसने ऐसा किया।
- संघर्ष करते छात्र: अधिकांश अन्य मॉडल 60% से नीचे स्कोर करते हैं। कई मॉडल इसलिए विफल हुए क्योंकि उन्होंने बिना कोई कार्रवाई किए केवल शुरुआती धुंधली तस्वीर से उत्तर का अनुमान लगाने की कोशिश की।
- "कचरे/अव्यवस्था" की समस्या (Clutter Problem): जब चार्टों को "व्यस्त कार्यालय" (डैशबोर्ड वातावरण) में स्थानांतरित किया गया, तो हर एक मॉडल खराब प्रदर्शन करने लगा। कुछ मॉडलों के स्कोर में 30% या उससे अधिक की गिरावट आई। यह दर्शाता है कि जब बहुत अधिक भटकाव होता है, तो AI भ्रमित हो जाता है कि किस चार्ट को छूना है और किस बटन पर क्लिक करना है।
वे क्यों विफल होते हैं? (तीन गलतियाँ)
पेपर में पाया गया कि AI मॉडल आमतौर पर तीन तरीकों से लड़खड़ाते हैं:
- "आलसी पाठक" (The Lazy Reader): मॉडल प्रश्न देखता है, शुरुआती तस्वीर देखता है, और बिना कभी क्लिक या होवर किए उत्तर का अनुमान लगा लेता है। यह बिना लाइट जलाए अंधेरे रेस्तरां में मेनू पढ़ने की कोशिश करने जैसा है।
- "भद्दा माउस" (The Clumsy Mouse): मॉडल जानता है कि उसे होवर करने की आवश्यकता है, लेकिन वह गलत बिंदु पर होवर करता है। यह पेड़ से एक विशिष्ट सेब चुनने की कोशिश करने लेकिन उसके बगल वाले सेब को पकड़ लेने जैसा है।
- "खोया हुआ पर्यटक" (The Lost Tourist): व्यस्त डैशबोर्ड में, मॉडल आसपास के टेक्स्ट से भ्रमित हो जाता है और पूरी तरह से गलत चार्ट पर क्लिक कर देता है। यह मॉल में एक विशिष्ट दुकान को खोजने की कोशिश करने लेकिन समान दिखने वाले संकेतों के कारण गलत स्टोर में चले जाने जैसा है।
निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि जबकि AI स्थिर छवियों (static images) को समझने में बहुत अच्छा हो रहा है, वह डायनेमिक, इंटरैक्टिव डेटा के साथ संघर्ष कर रहा है।
दुनिया के डेटा को वास्तव में समझने के लिए, AI को यह सीखना होगा कि कैसे इंटरैक्ट किया जाए—ठीक वैसे ही जैसे एक इंसान करता है—क्लिक करना, ज़ूम करना और अन्वेषण करना। ChartAct वह नया "ड्राइविंग टेस्ट" है यह देखने के लिए कि क्या AI वे कौशल सीख सकता है। अभी, अधिकांश AI ड्राइवर अभी भी यह सीख रहे हैं कि डैशबोर्ड से टकराए बिना स्टीयरिंग व्हील कैसे घुमाया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।