← नवीनतम पेपर
💻 computer science

Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

यह शोध पत्र Vision2Code को प्रस्तुत करता है, जो एक संदर्भ-कोड-मुक्त (reference-code-free), बहु-डोमेन बेंचमार्क और मूल्यांकन ढांचा है जो मॉडल आउटपुट को रेंडर करके और उन्हें डोमेन-विशिष्ट रूब्रिक्स के साथ स्कोर करके इमेज-टू-कोड जनरेशन का आकलन करता है, जो स्थानिक और जटिल दृश्य डोमेन में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और यह प्रदर्शित करता है कि फ़िल्टर्ड आउटपुट प्रभावी रूप से मॉडल प्रशिक्षण में सुधार कर सकते हैं।

मूल लेखक: Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जटिल चित्र है, जैसे कि घर का ब्लूप्रिंट, एक केमिस्ट्री डायग्राम, या एक वित्तीय चार्ट। अब, कल्पना कीजिए कि आप एक कंप्यूटर से उस तस्वीर को देखकर उसे फिर से बनाने के लिए आवश्यक सटीक निर्देशों (कोड) को लिखने के लिए कहते हैं।

यह Vision2Code पेपर के बारे में है। यह एक नया "टेस्ट" (बेंचमार्क) है जिसे यह देखने के लिए बनाया गया है कि AI मॉडल छवियों को वापस संपादन योग्य कोड (editable code) में बदलने में कितने कुशल हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर के मुख्य विचारों का विवरण दिया गया है:

1. समस्या: "पिक्सेल बनाम ब्लूप्रिंट" का अंतर

एक छवि को केक की एक तस्वीर के रूप में सोचें। यदि आप केवल फोटो देखते हैं, तो आप केक देख सकते हैं, लेकिन आप पिक्सेल को एडिट किए बिना (जो बहुत अस्त-व्यस्त दिखेगा) फ्रॉस्टिंग के स्वाद को आसानी से बदल नहीं सकते या चेरी को हिला नहीं सकते।

हालाँकि, यदि आपके पास रेसिपी (कोड) है, तो आप आसानी से फ्रॉस्टिंग को चॉकलेट में बदल सकते हैं या चेरी को हिला सकते हैं।

  • पुराने टेस्ट: AI के लिए पिछले टेस्ट ऐसे थे जैसे पूछना, "क्या आप इस फोटो जैसा दिखने वाला केक बना सकते हैं?" वे संकीर्ण विषयों (जैसे केवल चार्ट) पर केंद्रित थे या उनके लिए आवश्यक था कि AI के पास तुलना करने के लिए मूल रेसिपी मौजूद हो।
  • नया टेस्ट (Vision2Code): यह टेस्ट पूछता है, "क्या आप केक की इस फोटो को देखकर एक नई रेसिपी लिख सकते हैं, जो इसे फॉलो करने पर बिल्कुल मूल जैसा दिखने वाला और काम करने वाला केक बनाए?" महत्वपूर्ण बात यह है कि टेस्ट AI को मूल रेसिपी नहीं देता; यह केवल फोटो देता है।

2. चुनौती: यह केवल एक प्रकार का ड्राइंग नहीं है

लेखकों ने महसूस किया कि एक बार चार्ट बनाना एक 3D कमरे या सर्किट बोर्ड को बनाने से बहुत अलग है।

  • उपमा: कल्पना कीजिए कि एक टेस्ट है जहाँ आपको एक नक्शा बनाना है।
    • चार्ट/ग्राफ: एक सबवे मैप बनाने जैसा। रेखाओं को जुड़ना चाहिए और स्टेशनों के नाम सही होने चाहिए।
    • केमिस्ट्री: एक अणु (molecule) बनाने जैसा। यदि आप एक परमाणु को दूसरे से बदलते हैं, तो पूरी चीज़ गलत हो जाती है।
    • दस्तावेज़ (Documents): एक घने समाचार पत्र के पन्ने को कॉपी करने जैसा। हर शब्द और कॉलम मायने रखता है।
    • 3D दृश्य (3D Scenes): गहराई वाला कमरा बनाने जैसा। यदि मेज तैरती हुई या सपाट दिखती है, तो ड्राइंग विफल हो जाती है।

Vision2Code छह श्रेणियों में 15 अलग-अलग प्रकार की छवियों को कवर करता है। यह AI ड्राइंग के लिए एक विशिष्ट दौड़ के बजाय "मल्टी-स्पोर्ट" ओलंपिक की तरह है।

3. स्कोरिंग सिस्टम: "कठोर कला समीक्षक" (Strict Art Critic)

आप AI की ड्राइंग को कैसे ग्रेड करेंगे?

  • पुराना तरीका: कुछ टेस्ट केवल नई छवि की पुरानी छवि के साथ पिक्सेल-दर-पिक्सेल तुलना करते थे (जैसे यह देखना कि क्या दो फोटो बिल्कुल समान हैं)। यह बुरा है क्योंकि एक रेखा का मामूली सा खिसकना मानव दृष्टि में एकदम सही लग सकता है लेकिन पिक्सेल चेक में विफल हो सकता है।
  • Vision2Code का तरीका: वे एक VLM Rater (AI जज) का उपयोग करते हैं जो एक सख्त कला समीक्षक की तरह काम करता है।
    • AI कोड बनाता है।
    • कोड चलता है और एक नई छवि बनाता है।
    • "समीक्षक" नई छवि की मूल छवि से तुलना करता है।
    • ट्विस्ट: समीक्षक अलग-अलग कार्यों के लिए अलग-अलग नियम पुस्तिकाएं (rulebooks) उपयोग करता है।
      • केमिस्ट्री डायग्राम के लिए, नियम पुस्तिका कहती है: "यदि परमाणु गलत हैं, तो आपको शून्य मिलेगा, भले ही रंग अच्छे दिख रहे हों।"
      • चार्ट के लिए, नियम पुस्तिका कहती है: "यदि एक्सिस पर नंबर गलत हैं, तो आप फेल हो जाएंगे।"
    • उनके पास "गार्डरेल्स" (guardrails) भी हैं। यदि AI एक बड़ी, स्पष्ट गलती करता है (जैसे अणु को उल्टा बनाना), तो स्कोर को स्वचालित रूप से कम कर दिया जाता है, ताकि AI सुंदर लेकिन गलत ड्राइंग के साथ सिस्टम को धोखा न दे सके।

4. परिणाम: AI कुछ चीजों में अच्छा है, कुछ में बुरा

इस पेपर ने 9 अलग-अलग AI मॉडल का परीक्षण किया (कुछ मुफ्त, कुछ महंगे)।

  • अच्छी खबर: सर्वश्रेष्ठ मॉडल चार्ट और ग्राफ बनाने में बहुत अच्छे होते जा रहे हैं। वे बार ग्राफ को देख सकते हैं और उसे फिर से बनाने के लिए कोड लिख सकते हैं।
  • बुरी खबर: मॉडल जटिल, विशिष्ट कार्यों में संघर्ष करते हैं।
    • 3D दृश्य: वे अक्सर 3D वस्तुओं को 2D में बदल देते हैं, जिससे गहराई का अहसास खत्म हो जाता है।
    • केमिस्ट्री और सर्किट: वे प्रतीकों या कनेक्शनों को मिला देते हैं।
    • दस्तावेज़: वे टेक्स्ट मिस कर देते हैं या लेआउट बिगाड़ देते हैं।
  • निष्कर्ष: सिर्फ इसलिए कि एक AI साधारण ग्राफ बनाने में स्मार्ट है, इसका मतलब यह नहीं है कि वह सर्किट डायग्राम की गहरी संरचना को समझता है। यह कौशल "डोमेन-डिपेंडेंट" (क्षेत्र-निर्भर) है।

5. "सेल्फ-ट्रेनिंग" का तरीका

पेपर ने एक चतुर तरीका भी आजमाया जिससे अधिक मानव शिक्षकों की आवश्यकता के बिना AI को बेहतर बनाया जा सके।

  • विचार: AI एक छवि बनाने की कोशिश करता है। "समीक्षक" उसे ग्रेड देता है।
  • फ़िल्टर: यदि AI पहली कोशिश में अच्छा ग्रेड प्राप्त करता है, लेकिन फिर से अपनी ही ड्राइंग को दोबारा बनाने के लिए कहे जाने पर विफल हो जाता है, तो इसका मतलब है कि AI भाग्यशाली था या उसने पैटर्न को रट लिया था, न कि वास्तव में संरचना को समझा।
  • परिणाम: केवल उन उदाहरणों पर AI को प्रशिक्षित करके जहाँ उसे अच्छा स्कोर मिला लेकिन फिर दूसरी बार में वह लड़खड़ा गया, उन्होंने मॉडल को "ट्रिकी" हिस्सों को सीखने में मदद की। इसने एक छोटे मॉडल (Qwen3.5-9B) के प्रदर्शन को काफी बढ़ा दिया, जिससे यह साबित हुआ कि यह "समीक्षक" AI को बेहतर तरीके से ड्रा करना सिखा सकता है।

सारांश

Vision2Code एक नया, अधिक निष्पक्ष और अधिक व्यापक टेस्ट है। यह यह पूछना बंद करता है कि "क्या यह फोटो जैसा दिखता है?" और यह पूछना शुरू करता है कि "क्या यह कोड वास्तव में छवि की संरचना को फिर से बनाता है?" यह दिखाता है कि जबकि AI सरल चार्ट बनाने में बहुत अच्छा हो रहा है, जटिल वैज्ञानिक आरेख, 3D दृश्य या घने दस्तावेज़ों को पूरी तरह से पुन: बनाने के लिए अभी भी उसका एक लंबा रास्ता तय करना बाकी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →