← नवीनतम पेपर
💻 computer science

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

यह शोधपत्र GraphVerse प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें ग्राफ-केंद्रित इमेज एडिटिंग रणनीतियाँ और VGR-Score मेट्रिक शामिल हैं, जो सिंगल और पेयर्ड-इमेज सेटिंग्स में ग्राफ-आधारित विजुअल इनपुट्स पर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की धारणा (परसेप्शन), संरचनात्मक समझ और बहु-चरणीय तर्क करने की क्षमता का कड़ाई से मूल्यांकन करता है।

मूल लेखक: Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

प्रकाशित 2026-08-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जासूस बनना सिखा रहे हैं। आप उसे एक बिखरे हुए अपराध स्थल की तस्वीर दिखाते हैं और पूछते हैं, "यह किसने किया?" एक स्मार्ट रोबोट केवल अनुमान नहीं लगाता; वह सुरागों को देखता है, बिंदुओं को जोड़ता है, और कहानी का पता लगाता है। वैज्ञानिक इसे "मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" (MLLMs) कहते हैं। ये सुपर-स्मार्ट कंप्यूटर दिमाग हैं जो एक ही समय में चित्रों को देख सकते हैं और टेक्स्ट को पढ़ सकते हैं। वे सरल कार्यों में बहुत अच्छे होते जा रहे हैं, जैसे यह कहना कि, "वह एक बिल्ली है," या "टेक्स्ट कहता है कि आकाश नीला है।" लेकिन एक पेचीदा हिस्सा है: क्या वे वास्तव में जटिल चित्रों के बारे में सोच सकते हैं? क्या वे कनेक्शनों के एक आरेख (diagram) को देख सकते—जैसे सबवे लाइनों का नक्शा या दोस्तों का जाल—और उसमें छिपे नियमों को समझ सकते हैं, बजाय इसके कि वे केवल वही बताएं जो वे देख रहे हैं? यह बड़ा सवाल है। यदि एक रोबोट केवल एक चित्र का वर्णन कर सकता है लेकिन उसके भीतर के पहेली को हल नहीं कर सकता, तो यह एक ऐसे जासूस की तरह है जो अपराध स्थल का वर्णन तो कर सकता है लेकिन अपराधी को पकड़ नहीं सकता। हमें यह जानने की आवश्यकता है कि क्या ये रोबोट वास्तव में स्मार्ट हैं या केवल अनुमान लगाने में बहुत अच्छे हैं।

यहाँ आता है GraphVerse, एक नया, बेहद चुनौतीपूर्ण परीक्षण जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या ये AI जासूस वास्तव में अपना काम कर सकते हैं। एक "ग्राफ" को स्प्रेडशीट के चार्ट के रूप में नहीं, बल्कि रेखाओं (edges) द्वारा जुड़े बिंदुओं (nodes) के एक ड्राइंग के रूप में समझें। यह हवाई अड्डों का नक्शा, अणुओं में परमाणुओं के जुड़ने का आरेख, या सोशल मीडिया दोस्तों का जाल हो सकता है। शोधकर्ताओं ने इन ग्राफ चित्रों का एक विशाल खेल का मैदान बनाया और AI को "दो शहरों के बीच सबसे छोटा रास्ता खोजें" या "क्या इस नेटवर्क में कोई लूप है?" जैसे प्रश्न हल करने के लिए कहा।

लेकिन यहाँ एक मोड़ है: शोधकर्ता केवल यह नहीं देखना चाहते थे कि AI उत्तर पढ़ सकता है या नहीं। वे यह देखना चाहते थे कि AI कैसे सोचता है। इसके लिए, उन्होंने "ग्राफ-सेंट्रिक इमेज एडिटिंग" नामक कुछ चालाकी भरे तरीके ईजाद किए। कल्पना कीजिए कि आप AI को एक नक्शा दिखाते हैं, लेकिन फिर आप गुप्त रूप से नक्शे के कुछ हिस्सों को इधर-उधर बदल देते हैं, एक हिस्से को उल्टा कर देते हैं, या नेटवर्क के एक हिस्से को लाल पैच के पीछे छिपा देते हैं। यदि AI केवल पैटर्न को याद कर रहा है, तो वह भ्रमित हो जाएगा और असफल हो जाएगा। लेकिन यदि वह वास्तव में संरचना को समझता है, तो वह उस बिखरी हुई, संपादित तस्वीर को देख सकता है, यह पता लगा सकता है कि क्या बदला गया है, और फिर भी पहेली को हल कर सकता है। यह एक जासूस को अपराध स्थल की फोटो देने जैसा है जहाँ फर्नीचर को हिला दिया गया है; एक अच्छा जासूस अभी भी जानता है कि शव कहाँ था, भले ही कुर्सी अब मेज पर हो।

इस पेपर ने AI को ग्रेड देने का एक नया तरीका भी पेश किया, जिसे VGR-Score कहा जाता है। केवल अंतिम उत्तर के आधार पर "पास" या "फेल" देने के बजाय, यह स्कोर जासूस की नोटबुक की जाँच करता है। क्या AI ने सही सुरागों को देखा? क्या उसने निष्कर्ष पर पहुँचने से पहले एक तार्किक कदम उठाया? भले ही AI अंतिम उत्तर गलत दे देता, फिर भी उसे सही ढंग से सोचने के लिए अंक मिल सकते थे।

तो, उन्हें क्या मिला? परिणाम एक वास्तविकता की जाँच (reality check) की तरह थे। यहाँ तक कि सबसे स्मार्ट AI मॉडल भी कड़ी मशक्कत करते दिखे। जब शोधकर्ताओं ने अपने चालाकी भरे एडिटिंग ट्रिक्स का उपयोग किया, तो AI अक्सर भटक गए। वे सरल कार्यों में बहुत अच्छे थे लेकिन जब दृश्य पहेली जटिल हो गई या जब उन्हें एक साथ दो अलग-अलग चित्रों की तुलना करनी थी, तो वे बिखर गए। अध्ययन बताता है कि जबकि ये मॉडल "देखने" में बेहतर हो रहे हैं, वे जो देख रहे हैं उसके बारे में "तर्क करने" (reasoning) में अभी भी बहुत खराब हैं। वे वास्तविक दृश्य संरचना को समझने के बजाय टेक्स्ट-आधारित शॉर्टकट पर निर्भर रहते हैं।

हालाँकि, उम्मीद की एक किरण भी दिखी। जब शोधकर्ताओं ने AI को इन पेचीदा, संपादित पहेलियों पर अधिक प्रशिक्षित किया, तो मॉडल काफी बेहतर हो गए। उन्होंने दृश्य विवरणों पर ध्यान देना सीखा और अनुमान लगाना छोड़ दिया। यह सुझाव देता है कि सही प्रकार के अभ्यास के साथ, ये AI जासूस वास्तविक दृश्य रहस्यों को हल करना सीख सकते हैं, न कि केवल उनका वर्णन करना। यह पेपर निष्कर्ष निकालता है कि GraphVerse हमें स्मार्ट, अधिक विश्वसनीय AI बनाने में मदद करने के लिए एक महत्वपूर्ण उपकरण है जो वास्तव में हमारी जटिल, जुड़ी हुई दुनिया को समझ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →