← नवीनतम पेपर
🤖 AI

Vector-Bench: Can Models Surgically Edit SVG Code?

यह शोध पत्र Vector-Bench प्रस्तुत करता है, जो निर्देश-आधारित वेक्टर संपादन का मूल्यांकन करने के लिए डिज़ाइन किए गए 40 SVG मरम्मत कार्यों का एक कठोर बेंचमार्क है, जो यह प्रकट करता है कि सबसे शक्तिशाली मॉडल भी अनचाहे तत्वों को बदले बिना अनुरोधित परिवर्तनों को सटीक रूप से लागू करने में संघर्ष करते हैं, और केवल 15.0% पूर्ण विनिर्देश सफलता प्राप्त करते हैं।

मूल लेखक: Yug Aditi Gupta, Prannay Hebbar

प्रकाशित 2026-07-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yug Aditi Gupta, Prannay Hebbar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डिजिटल कलाकार बनना सिखा रहे हैं। आप उसे कोड से बनी एक तस्वीर देते हैं—जैसे कि एक डिजिटल ड्राइंग जो पेंट के बजाय निर्देशों से बनी हो—और आप कहते हैं, "हे, इस तस्वीर में सूरज बहुत बड़ा है; इसे छोटा करो, लेकिन बादलों या पहाड़ों को मत छेड़ना।" यह वेक्टर ग्राफिक्स (vector graphics) की दुनिया है। एक मानक फोटो के विपरीत, जो केवल रंगीन बिंदुओं का एक ग्रिड है, एक वेक्टर इमेज निर्देशों की एक सूची है जो कंप्यूटर को बताती है कि रेखाएं, आकार और रंग कैसे बनाए जाएं। क्योंकि यह कोड है, यदि रोबोट गलत लाइन बदल देता है, तो यह केवल तस्वीर को अजीब नहीं बनाता; यह पूरी फ़ाइल को खराब कर सकता है, जिससे इसे बाद में खोलना या संपादित करना असंभव हो जाता है।

बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: क्या ये स्मार्ट AI मॉडल वास्तव में कोड के एक विशिष्ट हिस्से को ठीक करने के लिए निर्देशों का पालन कर सकते हैं बिना बाकी हिस्से को बिगाड़े? यह एक शेफ से यह पूछने जैसा है कि क्या वह सूप में नमक को बदले बिना तापमान, बर्तन या बगल में रखी ब्रेड की रेसिपी को बदले बिना कर सकता है। यदि AI केवल सूप का स्वाद ठीक कर देता है लेकिन ब्रेड जला देता है, तो यह एक विफलता है, भले ही सूप अच्छा दिख रहा हो। यह निर्देश-आधारित संपादन (instruction-based editing) की चुनौती है: बिल्कुल वही करना जो आपने कहा है, और केवल वही करना जो आपने कहा है, जबकि कोड की अदृश्य संरचना को एकदम सही रखना है।

यहाँ आता है Vector-Bench, एक नया और कठिन परीक्षण जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या AI मॉडल वास्तव में सर्जिकल संपादक (surgical editors) बन सकते हैं। शोधकर्ताओं ने 40 विशिष्ट पहेलियाँ बनाईं जहाँ एक SVG इमेज "खराब" होती है—शायद ट्रेन का दरवाजा गलत जगह तैर रहा है, या जेलीफिश के टेंटेकल्स गायब हैं। उन्होंने AI मॉडलों को एक सरल, मानवीय भाषा वाला निर्देश दिया जैसे, "एम्बर सिग्नल काला पड़ गया है; इसे ठीक करें और स्टेशन को अकेला छोड़ दें।" मॉडलों को सिग्नल को ठीक करने के लिए कोड को फिर से लिखना था, बिना ट्रेन को हिलाए, स्टेशन प्लेटफॉर्म को हटाए, या फ़ाइल फॉर्मेट को तोड़े।

परिणाम थोड़े वास्तविकता का अहसास कराने वाले थे। शोधकर्ताओं ने 3 laक 34 अलग-अलग AI मॉडलों का परीक्षण किया, जिनमें सस्ते, छोटे मॉडलों से लेकर सबसे शक्तिशाली "फ्रंटियर" मॉडल तक शामिल थे। सबसे अच्छा प्रदर्शन करने वाला मॉडल, Claude Sonnet 5, पूरे काम को पूरी तरह से करने में—त्रुटि को ठीक करने, बाकी सब कुछ सुरक्षित रखने और एक वैध फ़ाइल बनाने में—केवल 15.0% बार सफल रहा। यह सही है: सबसे स्मार्ट AI भी 10 में से 8 से अधिक बार निर्देशों का पूरी तरह से पालन करने में विफल रहा।

हालाँकि, कहानी केवल विफलता के बारे में नहीं है; यह इस बारे में है कि वे कैसे विफल हुए। शोध में पाया गया कि मॉडल वास्तव में "ठीक करने" वाले हिस्से में काफी अच्छे थे। औसतन, वे लगभग 43.7% समय अनुरोधित मरम्मत पर दृश्य प्रगति करते थे। वे अक्सर सिग्नल को चमकीला बना सकते थे या दरवाजे को करीब ला सकते थे। लेकिन वे "बाकी को अकेला छोड़ने" वाले हिस्से में बहुत खराब थे। वे अक्सर उन चीजों का नाम बदल देते थे जिन्हें उन्हें नहीं बदलना चाहिए था, असंबंधित वस्तुओं को हिला देते थे, या कोड की संरचना को तोड़ देते थे जिससे फ़ाइल अमान्य हो जाती थी।

अध्ययन स्पष्ट रूप से इस विचार को खारिज करता है कि "अच्छा दिखना" एक ही बात है जो "सही ढंग से काम करना" है। एक मॉडल एक ऐसी छवि बना सकता है जो मानवीय आंखों को ठीक लगी हो, लेकिन यदि अंतर्निहित कोड को फिर से लिखा गया है या क्षतिग्रस्त किया गया है, तो यह एक विफलता है। शोधकर्ताओं ने यह साबित करने के लिए एक सख्त, कंप्यूटरीकृत जज का उपयोग किया जो न केवल चित्र, बल्कि कोड की भी जांच करता है। उन्होंने पाया कि जबकि मॉडल कुछ मरम्मत कर सकते हैं, कोड को बिना किसी नुकसान के सर्जिकल तरीके से संपादित करने की क्षमता अभी भी एक बड़ी बाधा है।

संक्षेप में, यह पेपर सुझाव देता है कि हालांकि AI चित्र बनाने और सुधारने में बेहतर हो रहा है, लेकिन यह उन चित्रों को बनाने वाले कोड के सटीक, सावधान संपादक बनने के लिए अभी भी संघर्ष कर रहा है। "एक बदलाव करने" और "बिना किसी और चीज़ को बिगाड़े सही बदलाव करने" के बीच का अंतर अभी भी बहुत बड़ा है। लेखकों ने अपना सारा डेटा, कोड और परिणाम जारी कर दिए हैं, जो दिखाते हैं कि सबसे महंगे और शक्तिशाली मॉडल भी वर्तमान में उन सटीक सर्जनों की तरह नहीं हैं जिनकी हमें डिजिटल कला को संपादित करने के लिए आवश्यकता है, बल्कि वे उन उत्साही इंटर्न की तरह हैं जो समस्या को तो ठीक कर देते हैं लेकिन गलती से बुकशेल्फ़ को भी गिरा देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →