← नवीनतम पेपर
💻 computer science

Chartography: A Benchmark for Professional Chart Understanding

यह शोधपत्र चार्टोग्राफी (Chartography) को पेश करता है, जो डोमेन-विशिष्ट चार्ट प्रारूपों में 100 पेशेवर रूप से क्यूरेट किए गए कार्यों वाला एक नया बेंचमार्क है, जो वर्तमान फ्रंटियर मॉडलों की जटिल दृश्य तर्क करने और डोमेन परंपराओं का पालन करने की क्षमता में महत्वपूर्ण सीमाओं को उजागर करता है, जहाँ शीर्ष कॉन्फ़िगरेशन मौजूदा बेंचमार्क में देखी जाने वाली 80-90% संतृप्ति की तुलना में केवल 45% सटीकता प्राप्त करते हैं।

मूल लेखक: Suhaas Garre, Chris Mutty, Sushant Mehta, Edwin Chen

प्रकाशित 2026-08-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Suhaas Garre, Chris Mutty, Sushant Mehta, Edwin Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन अपराध स्थल के बजाय, आपके सुराग एक तस्वीर के अंदर छिपे हुए हैं। यह AI विजन (AI vision) की दुनिया है, जो कंप्यूटर विज्ञान की एक शाखा है जहाँ मशीनें इंसानों की तरह छवियों को "देखने" और समझने के लिए सीखती हैं। लंबे समय तक, वैज्ञानिकों ने इन AI जासूसों का परीक्षण सरल चित्र पहेलियों के साथ किया है: "इस टोकरी में कितने लाल सेब हैं?" या "क्या यह एक बिल्ली है या कुत्ता?" ये परीक्षण 'ट्रेनिंग व्हील्स' (सहायक पहियों) की तरह हैं; वे AI को बुनियादी बातें सीखने में मदद करते हैं। लेकिन वास्तविक दुनिया में, पेशेवर—जैसे कि मरीज की धड़कन की जांच करने वाले डॉक्टर, पुल डिजाइन करने वाले इंजीनियर, या शेयर बाजारों पर नजर रखने वाले व्यापारी—साधारण चित्रों को नहीं देखते। वे जटिल, उलझे हुए चार्ट देखते हैं जिन्हें पढ़ने के लिए गहरे ज्ञान की आवश्यकता होती है। बड़ा सवाल यह है कि क्या हमारे सबसे स्मार्ट AI जासूस वास्तव में इन वास्तविक दुनिया की पहेलियों को हल कर सकते हैं, या वे केवल ट्रेनिंग व्हील्स के साथ खेलने में अच्छे हैं?

"चार्टोग्राफी" (Chartography) नामक यह शोध पत्र, एक बिल्कुल नया और अत्यंत कठिन टेस्ट विशेष रूप से पेशेवर चार्ट्स के लिए बनाकर यह पता लगाने का निर्णय लेता है। लेखकों की टीम, जो Surge AI से है, ने महसूस किया कि पुराने परीक्षण बहुत आसान थे और "सैचुरेटेड" (संतृप्त) हो चुके थे, जिसका अर्थ है कि सर्वश्रेष्ठ AI मॉडल पहले से ही 90% या उससे अधिक स्कोर कर रहे थे, जिससे यह बताना असंभव हो गया था कि वास्तव में सबसे बुद्धिमान कौन है। इसलिए, उन्होंने एक नई चुनौती बनाई: चिकित्सा, वित्त और इंजीनियरिंग जैसे क्षेत्रों के विशेषज्ञों द्वारा उपयोग किए जाने वाले वास्तविक चार्टों वाले 100 कार्य। उन्होंने AI से केवल अनुमान लगाने के लिए नहीं कहा; बल्कि उन्होंने वास्तविक मानव विशेषज्ञों से प्रश्न लिखवाए और उत्तरों को सत्यापित करवाया, जिससे यह सुनिश्चित हुआ कि परीक्षण निष्पक्ष और कठिन हो।

परिणाम काफी चौंकाने वाले थे। यहाँ तक कि सबसे उन्नत AI मॉडल भी, जो आमतौर पर आसान परीक्षणों में उत्कृष्ट प्रदर्शन करते हैं, इस नए परीक्षण में बुरी तरह लड़खड़ा गए। सर्वश्रेष्ठ मॉडल ने केवल 45.0% उत्तर सही दिए, जबकि बाकी का स्कोर 9.0% और 39.5% के बीच रहा। ऐसा प्रतीत होता है कि जहाँ ये AI सुपर-ब्रेन तर्क और लॉजिक में माहिर हैं, वहीं वे चार्ट के विवरणों को वास्तव में "देखने" में आश्चर्यजनक रूप से कमजोर हैं। वे शायद एक पतली रेखा को मिस कर देते हैं, एक कठिन एक्सिस (axis) पर नंबर को गलत पढ़ लेते हैं, या उन छिपे हुए नियमों को समझने में विफल रहते हैं जिनका उपयोग पेशेवर डेटा की व्याख्या करने के लिए करते हैं।

इसे इस तरह सोचें: आपके पास एक ऐसा दोस्त हो सकता है जो गणित में जीनियस है और अपने दिमाग में जटिल समीकरण हल कर सकता है। लेकिन यदि आप उन्हें एक धुंधला, घुमावदार रास्ता वाला नक्शा दें और उनसे एक विशिष्ट स्थान खोजने को कहें, तो वे खो सकते हैं क्योंकि वे कागज पर रेखाओं को ठीक से देख नहीं पाते। यहाँ यही हुआ। AI गणित तो पूरी तरह से कर सकता था, लेकिन वह दृश्य विवरणों (visual details) पर बार-बार ठोकर खाता रहा।

शोधकर्ताओं ने पाया कि AI को "अधिक गहराई से सोचने" या तर्क करने में अधिक समय बिताने के लिए मजबूर करने से हमेशा मदद नहीं मिली। वास्तव में, कभी-कभी AI एक गलत दृश्य विवरण पर अटक जाता था और फिर अपने शक्तिशाली तर्क कौशल का उपयोग यह आत्मविश्वास से समझाने के लिए करता था कि वह गलत विवरण क्यों सही था। यह एक ऐसे जासूस की तरह है जो घटनास्थल पर एक लाल जूता देखता है, भ्रमित हो जाता है, और फिर एक शानदार 10 पन्नों की रिपोर्ट लिखता है यह साबित करने के लिए कि लाल जूता संदिग्ध का है, भले ही जूता वास्तव में नीला था।

यह शोध पत्र निष्कर्ष निकालता है कि हालांकि AI चार्ट को समझने में बेहतर हो रहा है, लेकिन डॉक्टरों या इंजीनियरों के लिए वास्तविक जीवन के निर्णय लेने के लिए इस पर भरोसा करने से पहले इसे अभी एक लंबा रास्ता तय करना है। "चार्टोग्राफी" बेंचमार्क अब सभी के उपयोग के लिए खुला है, जो एक कठिन नई बाधा के रूप में कार्य करता है जो डेवलपर्स को ऐसा AI बनाने में मदद करेगा जो केवल अनुमान नहीं लगाता, बल्कि पेशेवर डेटा की जटिल दुनिया को वास्तव में देखता और समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →