Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation
यह शोध पत्र Vision2Code को प्रस्तुत करता है, जो एक संदर्भ-कोड-मुक्त (reference-code-free), बहु-डोमेन बेंचमार्क और मूल्यांकन ढांचा है जो मॉडल आउटपुट को रेंडर करके और उन्हें डोमेन-विशिष्ट रूब्रिक्स के साथ स्कोर करके इमेज-टू-कोड जनरेशन का आकलन करता है, जो स्थानिक और जटिल दृश्य डोमेन में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और यह प्रदर्शित करता है कि फ़िल्टर्ड आउटपुट प्रभावी रूप से मॉडल प्रशिक्षण में सुधार कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक जटिल चित्र है, जैसे कि घर का ब्लूप्रिंट, एक केमिस्ट्री डायग्राम, या एक वित्तीय चार्ट। अब, कल्पना कीजिए कि आप एक कंप्यूटर से उस तस्वीर को देखकर उसे फिर से बनाने के लिए आवश्यक सटीक निर्देशों (कोड) को लिखने के लिए कहते हैं।
यह Vision2Code पेपर के बारे में है। यह एक नया "टेस्ट" (बेंचमार्क) है जिसे यह देखने के लिए बनाया गया है कि AI मॉडल छवियों को वापस संपादन योग्य कोड (editable code) में बदलने में कितने कुशल हैं।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर के मुख्य विचारों का विवरण दिया गया है:
1. समस्या: "पिक्सेल बनाम ब्लूप्रिंट" का अंतर
एक छवि को केक की एक तस्वीर के रूप में सोचें। यदि आप केवल फोटो देखते हैं, तो आप केक देख सकते हैं, लेकिन आप पिक्सेल को एडिट किए बिना (जो बहुत अस्त-व्यस्त दिखेगा) फ्रॉस्टिंग के स्वाद को आसानी से बदल नहीं सकते या चेरी को हिला नहीं सकते।
हालाँकि, यदि आपके पास रेसिपी (कोड) है, तो आप आसानी से फ्रॉस्टिंग को चॉकलेट में बदल सकते हैं या चेरी को हिला सकते हैं।
- पुराने टेस्ट: AI के लिए पिछले टेस्ट ऐसे थे जैसे पूछना, "क्या आप इस फोटो जैसा दिखने वाला केक बना सकते हैं?" वे संकीर्ण विषयों (जैसे केवल चार्ट) पर केंद्रित थे या उनके लिए आवश्यक था कि AI के पास तुलना करने के लिए मूल रेसिपी मौजूद हो।
- नया टेस्ट (Vision2Code): यह टेस्ट पूछता है, "क्या आप केक की इस फोटो को देखकर एक नई रेसिपी लिख सकते हैं, जो इसे फॉलो करने पर बिल्कुल मूल जैसा दिखने वाला और काम करने वाला केक बनाए?" महत्वपूर्ण बात यह है कि टेस्ट AI को मूल रेसिपी नहीं देता; यह केवल फोटो देता है।
2. चुनौती: यह केवल एक प्रकार का ड्राइंग नहीं है
लेखकों ने महसूस किया कि एक बार चार्ट बनाना एक 3D कमरे या सर्किट बोर्ड को बनाने से बहुत अलग है।
- उपमा: कल्पना कीजिए कि एक टेस्ट है जहाँ आपको एक नक्शा बनाना है।
- चार्ट/ग्राफ: एक सबवे मैप बनाने जैसा। रेखाओं को जुड़ना चाहिए और स्टेशनों के नाम सही होने चाहिए।
- केमिस्ट्री: एक अणु (molecule) बनाने जैसा। यदि आप एक परमाणु को दूसरे से बदलते हैं, तो पूरी चीज़ गलत हो जाती है।
- दस्तावेज़ (Documents): एक घने समाचार पत्र के पन्ने को कॉपी करने जैसा। हर शब्द और कॉलम मायने रखता है।
- 3D दृश्य (3D Scenes): गहराई वाला कमरा बनाने जैसा। यदि मेज तैरती हुई या सपाट दिखती है, तो ड्राइंग विफल हो जाती है।
Vision2Code छह श्रेणियों में 15 अलग-अलग प्रकार की छवियों को कवर करता है। यह AI ड्राइंग के लिए एक विशिष्ट दौड़ के बजाय "मल्टी-स्पोर्ट" ओलंपिक की तरह है।
3. स्कोरिंग सिस्टम: "कठोर कला समीक्षक" (Strict Art Critic)
आप AI की ड्राइंग को कैसे ग्रेड करेंगे?
- पुराना तरीका: कुछ टेस्ट केवल नई छवि की पुरानी छवि के साथ पिक्सेल-दर-पिक्सेल तुलना करते थे (जैसे यह देखना कि क्या दो फोटो बिल्कुल समान हैं)। यह बुरा है क्योंकि एक रेखा का मामूली सा खिसकना मानव दृष्टि में एकदम सही लग सकता है लेकिन पिक्सेल चेक में विफल हो सकता है।
- Vision2Code का तरीका: वे एक VLM Rater (AI जज) का उपयोग करते हैं जो एक सख्त कला समीक्षक की तरह काम करता है।
- AI कोड बनाता है।
- कोड चलता है और एक नई छवि बनाता है।
- "समीक्षक" नई छवि की मूल छवि से तुलना करता है।
- ट्विस्ट: समीक्षक अलग-अलग कार्यों के लिए अलग-अलग नियम पुस्तिकाएं (rulebooks) उपयोग करता है।
- केमिस्ट्री डायग्राम के लिए, नियम पुस्तिका कहती है: "यदि परमाणु गलत हैं, तो आपको शून्य मिलेगा, भले ही रंग अच्छे दिख रहे हों।"
- चार्ट के लिए, नियम पुस्तिका कहती है: "यदि एक्सिस पर नंबर गलत हैं, तो आप फेल हो जाएंगे।"
- उनके पास "गार्डरेल्स" (guardrails) भी हैं। यदि AI एक बड़ी, स्पष्ट गलती करता है (जैसे अणु को उल्टा बनाना), तो स्कोर को स्वचालित रूप से कम कर दिया जाता है, ताकि AI सुंदर लेकिन गलत ड्राइंग के साथ सिस्टम को धोखा न दे सके।
4. परिणाम: AI कुछ चीजों में अच्छा है, कुछ में बुरा
इस पेपर ने 9 अलग-अलग AI मॉडल का परीक्षण किया (कुछ मुफ्त, कुछ महंगे)।
- अच्छी खबर: सर्वश्रेष्ठ मॉडल चार्ट और ग्राफ बनाने में बहुत अच्छे होते जा रहे हैं। वे बार ग्राफ को देख सकते हैं और उसे फिर से बनाने के लिए कोड लिख सकते हैं।
- बुरी खबर: मॉडल जटिल, विशिष्ट कार्यों में संघर्ष करते हैं।
- 3D दृश्य: वे अक्सर 3D वस्तुओं को 2D में बदल देते हैं, जिससे गहराई का अहसास खत्म हो जाता है।
- केमिस्ट्री और सर्किट: वे प्रतीकों या कनेक्शनों को मिला देते हैं।
- दस्तावेज़: वे टेक्स्ट मिस कर देते हैं या लेआउट बिगाड़ देते हैं।
- निष्कर्ष: सिर्फ इसलिए कि एक AI साधारण ग्राफ बनाने में स्मार्ट है, इसका मतलब यह नहीं है कि वह सर्किट डायग्राम की गहरी संरचना को समझता है। यह कौशल "डोमेन-डिपेंडेंट" (क्षेत्र-निर्भर) है।
5. "सेल्फ-ट्रेनिंग" का तरीका
पेपर ने एक चतुर तरीका भी आजमाया जिससे अधिक मानव शिक्षकों की आवश्यकता के बिना AI को बेहतर बनाया जा सके।
- विचार: AI एक छवि बनाने की कोशिश करता है। "समीक्षक" उसे ग्रेड देता है।
- फ़िल्टर: यदि AI पहली कोशिश में अच्छा ग्रेड प्राप्त करता है, लेकिन फिर से अपनी ही ड्राइंग को दोबारा बनाने के लिए कहे जाने पर विफल हो जाता है, तो इसका मतलब है कि AI भाग्यशाली था या उसने पैटर्न को रट लिया था, न कि वास्तव में संरचना को समझा।
- परिणाम: केवल उन उदाहरणों पर AI को प्रशिक्षित करके जहाँ उसे अच्छा स्कोर मिला लेकिन फिर दूसरी बार में वह लड़खड़ा गया, उन्होंने मॉडल को "ट्रिकी" हिस्सों को सीखने में मदद की। इसने एक छोटे मॉडल (Qwen3.5-9B) के प्रदर्शन को काफी बढ़ा दिया, जिससे यह साबित हुआ कि यह "समीक्षक" AI को बेहतर तरीके से ड्रा करना सिखा सकता है।
सारांश
Vision2Code एक नया, अधिक निष्पक्ष और अधिक व्यापक टेस्ट है। यह यह पूछना बंद करता है कि "क्या यह फोटो जैसा दिखता है?" और यह पूछना शुरू करता है कि "क्या यह कोड वास्तव में छवि की संरचना को फिर से बनाता है?" यह दिखाता है कि जबकि AI सरल चार्ट बनाने में बहुत अच्छा हो रहा है, जटिल वैज्ञानिक आरेख, 3D दृश्य या घने दस्तावेज़ों को पूरी तरह से पुन: बनाने के लिए अभी भी उसका एक लंबा रास्ता तय करना बाकी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।