← नवीनतम पेपर
💬 NLP

VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing

यह शोध पत्र VCG-Bench प्रस्तुत करता है, जो एक एकीकृत बेंचमार्क और "Diagram-as-Code" प्रतिमान है जो पिक्सेल-आधारित संश्लेषण की सीमाओं को दूर करने के लिए mxGraph XML का उपयोग करता है, जिससे संरचित आरेख निर्माण और संपादन कार्यों पर विजन-लैंग्वेज मॉडल्स (Vision-Language Models) का आकलन करने के लिए एक वर्गीकृत डेटासेट और अनुकूलित मूल्यांकन प्रोटोकॉल प्रदान किया जाता है।

मूल लेखक: Xiaoyan Su, Peijie Dong, Zhenheng Tang, Song Tang, Yuyao Zhai, Kaitao Lin, Liang Chen, Gai Yuhang, Yuyu Luo, Qiang Wang, Xiaowen Chu

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoyan Su, Peijie Dong, Zhenheng Tang, Song Tang, Yuyao Zhai, Kaitao Lin, Liang Chen, Gai Yuhang, Yuyu Luo, Qiang Wang, Xiaowen Chu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल फ्लोचार्ट बनाना सिखाने की कोशिश कर रहे हैं, जैसे कि किसी सॉफ़्टवेयर सिस्टम का मैप या कोई व्यावसायिक प्रक्रिया।

समस्या: "पिक्सेल पेंटर" बनाम "आर्किटेक्ट"
वर्तमान में, अधिकांश उन्नत AI मॉडल "पिक्सेल पेंटर्स" (Pixel Painters) की तरह कार्य करते हैं। यदि आप उनसे कोई आरेख (diagram) बनाने के लिए कहते हैं, तो वे चित्र को देखते हैं और बिंदु-दर-बिंदक (पिक्सेल-दर-पिक्सेल) उसे फिर से बनाने की कोशिश करते हैं।

  • दोष: यह एक छपे हुए समाचार पत्र में टाइपो (लिखावट की गलती) को ठीक करने के लिए अक्षरों के ऊपर पेंट करने जैसा है। यदि आप एक लाल बॉक्स को नीले रंग के बॉक्स में बदलना चाहते हैं, तो AI अनजाने में उसके बगल के टेक्स्ट को धुंधला कर सकता है, रेखाओं को अस्पष्ट बना सकता है, या एक नया आकार बना सकता है जो वहां पहले नहीं था। यह अव्यवस्थित है, इसे संपादित करना कठिन है, और अक्सर विवरणों को गलत कर देता है।

समाधान: "ब्लूप्रिंट बिल्डर" (VCG-Bench)
लेखक एक नया तरीका प्रस्तावित करते हैं: "ब्लूप्रिंट बिल्डर" (Blueprint Builder)। चित्र के पिक्सेल पेंट करने के बजाय, AI कोड (विशेष रूप से mxGraph XML नामक भाषा) लिखना सीखता है जो कंप्यूटर को सटीक रूप से बताता है कि आरेख कैसे बनाया जाए।

  • उपमा: इसे इस तरह सोचें जैसे कि आप AI को तैयार किले की फोटो देने के बजाय उसे LEGO निर्देशों का एक सेट दे रहे हैं। यदि आप एक टावर को लाल से नीला करना चाहते हैं, तो आप बस AI को निर्देश देते हैं कि वह लाल LEGO ब्रिक को नीली ब्रिक से बदल दे। बाकी का किला बिल्कुल सही रहता है। रेखाएं स्पष्ट रहती हैं, टेक्स्ट साफ रहता है, और संरचना तार्किक बनी रहती है।

VCG-Bench क्या है?
यह पेपर एक नया "जिम" या टेस्ट ट्रैक पेश करता है जिसे VCG-Bench कहा जाता है, ताकि यह देखा जा सके कि इस "ब्लूप्रिंट" दृष्टिकोण में AI मॉडल कितने कुशल हैं। यह केवल चित्र बनाने के बारे में नहीं है; यह कोड-आधारित आरेख बनाने (generating) और संपादित (editing) करने के बारे में है।

इस टेस्ट ट्रैक में दो मुख्य चुनौतियाँ हैं:

  1. विज़न-टू-कोड (अनुवाद): AI को एक आरेख का चित्र दिखाएं और उससे वह कोड निर्देश लिखने के लिए कहें जो उसे बिल्कुल सटीक रूप से फिर से बना सके।
  2. कोड-टू-कोड (नवीनीकरण): AI को कोड निर्देशों का एक सेट दें और एक सरल कमांड दें जैसे " 'Start' बॉक्स को लाल करें और एक नया स्टेप जोड़ें," और देखें कि क्या वह बाकी चीज़ों को खराब किए बिना कोड को अपडेट कर सकता है।

डेटासेट: 1,449 आरेखों का एक पुस्तकालय
इसका परीक्षण करने के लिए, शोधकर्ताओं ने 1,449 विविध आरेखों का एक विशाल पुस्तकालय बनाया।

  • विविधता: ये केवल साधारण चित्र नहीं हैं। ये 6 बड़ी दुनियाओं को कवर करते हैं: अकादमिक (वैज्ञानिक अनुसंधान), सॉफ्टवेयर (कंप्यूटर सिस्टम), बिजनेस (रणनीति योजनाएं), मैनेजमेंट (प्रोजेक्ट टाइमलाइन), UI/UX (ऐप डिज़ाइन), और जनरल (माइंड मैप्स)।
  • कठिनाई: आरेख "आसान" (सरल फ्लोचार्ट) से लेकर "कठिन" (हजारों कनेक्शन वाले जटिल, घने सिस्टम) तक विस्तृत हैं।

स्कोरकार्ड: हम AI को कैसे ग्रेड करते हैं?
केवल यह कहने के बजाय कि "यह ठीक लग रहा है," यह पेपर एक सख्त, बहु-स्तरीय स्कोरकार्ड का उपयोग करता है:

  • "क्या यह चलता है?" टेस्ट (ESR): क्या कोड वास्तव में काम करता है? क्या कंप्यूटर इसे पढ़ सकता है और बिना क्रैश हुए आरेख बना सकता है? (कई वर्तमान AI मॉडल यहाँ विफल हो जाते हैं; वे ऐसा कोड लिखते हैं जो दिखने में सही लगता है लेकिन वास्तव में कुछ भी निर्माण नहीं करता)।
  • "क्या आपने सुना?" टेस्ट (XDRFR): क्या AI ने आपके विशिष्ट निर्देशों का पालन किया? यदि आपने "रंग बदलने" के लिए कहा था, तो क्या उसने केवल रंग बदला और केवल रंग ही बदला?
  • "कलात्मक दृष्टि" टेस्ट (SCS): क्या अंतिम आरेख पेशेवर दिखता है? क्या रेखाएं सीधी हैं, रंग सुसंगत हैं, और लेआउट संतुलित है?

हमें क्या पता चला?
इस पेपर ने आज के सबसे स्मार्ट AI मॉडलों (जैसे GPT-5, Gemini, और Claude) पर ये परीक्षण चलाए।

  • अच्छी खबर: जब AI को संपादित करने के लिए कोड दिया जाता है (कार्य 2), तो यह सटीक परिवर्तन करने में बहुत अच्छा है। यह एक मास्टर बढ़ई की तरह है जो दीवारों को नुकसान पहुँचाए बिना घर में एक अकेला बोर्ड बदल सकता है।
  • बुरी खबर: जब AI को एक चित्र देखना होता है और शून्य से कोड लिखना होता है (कार्य 1), तो वह संघर्ष करता है। कई मॉडल ऐसा कोड बनाने में विफल रहते हैं जो वास्तव में काम करता है। वे अक्सर बॉक्सों की संख्या गिनने में गलती करते हैं, कनेक्शन गलत कर देते हैं, या ऐसा कोड लिखते हैं जो "टूटा हुआ" है और जिसे रेंडर नहीं किया जा सकता।
  • अंतर: उन मॉडलों के बीच एक बड़ा अंतर है जो आरेख को पढ़ सकते हैं और उन मॉडलों के बीच जो इसे शून्य से पूरी तरह से पुनर्निर्मित कर सकते हैं।

सारांश में
यह पेपर कहता है: "AI को आरेखों के चित्र पेंट करने के लिए कहना बंद करें। उसे निर्देश लिखना सिखाएं।" उन्होंने एक नया, कठोर परीक्षण (VCG-Bench) बनाया है यह साबित करने के लिए कि हालांकि AI कोड-आधारित आरेखों को संपादित करने में बेहतर हो रहा है, लेकिन एक अव्यवस्थित चित्र को एक साफ, संपादन योग्य ब्लूप्रिंट में पूरी तरह से अनुवादित करने के लिए उसे अभी लंबा रास्ता तय करना है। यह उन पेशेवरों के लिए महत्वपूर्ण है जिन्हें ऐसे आरेख चाहिए जो सटीक, संपादन योग्य और विश्वसनीय हों, न कि केवल सुंदर चित्र।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →