← नवीनतम पेपर
💬 NLP

VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?

यह शोध पत्र VisEditBench प्रस्तुत करता है, जो 1,395 मानव-एनोटेटेड कार्यों का एक व्यापक बेंचमार्क है जिसे मल्टीमॉडल फीडबैक के आधार पर विज़ुअलाइज़ेशन कोड को संपादित करने की विज़न-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो वर्तमान मॉडल्स में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और VisEditAgent का प्रस्ताव देता है, जो एक रेंडर-ग्राउंडेड फ्रेमवर्क है जो संपादन सटीकता में काफी सुधार करता है।

मूल लेखक: Mizanur Rahman, Arshia Azimlu, Shadikur Rahman, Md Tahmid Rahman Laskar, Amran Bhuiyan, Shafiq Joty, Enamul Hoque Prince

प्रकाशित 2026-08-12
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Mizanur Rahman, Arshia Azimlu, Shadikur Rahman, Md Tahmid Rahman Laskar, Amran Bhuiyan, Shafiq Joty, Enamul Hoque Prince

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जिसने अभी-अभी एक रेसिपी बुक से एक बेहतरीन ऑमलेट बनाना सीखा है। आप निर्देशों का पालन कर सकते हैं, अंडे फोड़ सकते हैं और पैन को पलट सकते हैं। लेकिन क्या होता है जब आपका दोस्त एक निवाला लेता है, मुँह बनाता है, और कहता है, "इसमें नमक बहुत ज़्यादा है, और नीचे की चीज़ जल गई है"? या क्या होगा अगर वे आपको एक अलग ऑमलेट की फोटो दिखाएं और कहें, "मुझे अपना वाला बिल्कुल ऐसा ही चाहिए"? अचानक, आपका काम सिर्फ एक रेसिपी का पालन करना नहीं रह जाता; यह एक गलती को सुधारने या किसी शैली की नकल करने के बारे में है, जबकि अंडों और आंच को बिल्कुल सही रखना होता है। यह डेटा विज़ुअलाइज़ेशन (data visualization) की दुनिया है, जहाँ कंप्यूटर संख्याओं को चार्ट और ग्राफ़ जैसी तस्वीरों में बदलने की कोशिश करते हैं।

कुछ समय से, वैज्ञानिक कंप्यूटर को इन चित्रों को शून्य से बनाने के लिए "रेसिपी" (कोड) लिखना सिखा रहे हैं। लेकिन वास्तविक दुनिया में, हम शायद ही कभी केवल एक बिल्कुल नई तस्वीर चाहते हैं; आमतौर पर हमारे पास पहले से ही एक मौजूदा तस्वीर होती है जो थोड़ी अजीब दिखती है, या हम इसे किसी रिपोर्ट से मेल खाने के लिए इसकी शैली बदलना चाहते हैं। इसे मल्टीमॉडल फीडबैक (multimodal feedback) कहा जाता है: कंप्यूटर को यह बताने के लिए कि क्या ठीक करना है, टेक्स्ट निर्देशों, चार्ट की वास्तविक तस्वीर और उसे बनाने वाले कोड के मिश्रण का उपयोग करना। बड़ा सवाल यह है: क्या ये स्मार्ट कंप्यूटर वास्तव में देख सकते हैं कि चार्ट में क्या गलत है और नीचे के डेटा को खराब किए बिना उसे ठीक कर सकते हैं?

इस शोध पत्र में, जिसका शीर्षक VisEditBench है, इसी को परखने के लिए एक नया 'प्लेग्राउंड' पेश किया गया है। शोधकर्ताओं ने 1,395 वास्तविक दुनिया की संपादन चुनौतियों (editing challenges) का एक विशाल संग्रह बनाया है, जो AI चार्ट-बनाने वालों के लिए एक "ड्राइविंग टेस्ट" की तरह है। उन्होंने पाया कि हालांकि सबसे अच्छे AI मॉडल कोड लिखने में बेहतर हो रहे हैं, लेकिन वे विजुअल फीडबैक के आधार पर चार्ट को ठीक करने में अभी भी काफी अनाड़ी हैं। शीर्ष मॉडल, Claude-4.6-Sonnet, लगभग 74.46% परीक्षणों को पास करने में सफल रहा, लेकिन अधिकांश ओपन-सोर्स मॉडल संघर्ष करते रहे और 50% से नीचे ही रह गए। सबसे कठिन हिस्सा? एक संदर्भ छवि (reference image) से मेल खाने के लिए चार्ट की शैली को बदलना; यहाँ तक कि सबसे अच्छे मॉडल ने भी केवल 55.71% सही किया।

इन मॉडल्स को बेहतर बनाने में मदद करने के लिए, लेखकों ने VisEditAgent नामक एक नया टूल बनाया है। इसे एक "कोशिश करो, विफल हो और सुधारो" लूप के रूप में समझें। एक बार में उत्तर का अनुमान लगाने के बजाय, यह एजेंट कोड के कुछ अलग संस्करण लिखता है, वास्तव में चार्ट बनाता है, जाँचता है कि क्या वे सही दिख रहे हैं, और फिर उन्हें तब तक बदलता रहता है जब जब तक वे एकदम सही न हो जाएं। जब उन्होंने एक मजबूत मॉडल के साथ इस पद्धति का उपयोग किया, तो सफलता दर 55.75% से बढ़कर 67.99% हो गई। यह सुझाव देता है कि चार्ट को ठीक करने का रहस्य केवल स्मार्ट होना नहीं है; बल्कि अपने काम को देखना, यह महसूस करना कि वह गलत है, और फिर से प्रयास करना है। शोध पत्र निष्कर्ष निकालता है कि हालांकि हम प्रगति कर रहे हैं, कंप्यूटर को एक मानव डिज़ाइनर की देखभाल के साथ विज़ुअलाइज़ेशन को संपादित करना सिखाना अभी भी एक निर्माणाधीन कार्य है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →