← नवीनतम पेपर
💻 computer science

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

यह शोध पत्र VFIG को पेश करता है, जो विज़न-लैंग्वेज मॉडल्स का एक परिवार है जो एक बड़े पैमाने के डेटासेट (VFIG-DATA), सुपरवाइज्ड फाइन-ट्यूनिंग और रिइन्फोर्समेंट लर्निंग को संयोजित करने वाले एक कोर्स-टू-फाइन ट्रेनिंग करिकुलम का लाभ उठाकर रास्टराइज़्ड फिगर्स को हाई-फिडेलिटी SVGs में परिवर्तित करता है, और GPT-5.2 के तुलनीय स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने के लिए एक विशेष मूल्यांकन सूट (VFIG-BENCH) का उपयोग करता है।

मूल लेखक: Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Jason Ren, Daniel S Weld, Ranjay Krishna

प्रकाशित 2026-03-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Jason Ren, Daniel S Weld, Ranjay Krishna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक घर का सुंदर, हाथ से बना हुआ ब्लूप्रिंट (खाका) है। यह एकदम सटीक है: आप एक क्लिक से एक दीवार बदल सकते हैं, एक खिड़की बदल सकते हैं, या एक कमरे का आकार बदल सकते हैं क्योंकि यह साफ, गणितीय रेखाओं से बना है। SVG (स्केलेबल वेक्टर ग्राफिक्स) डिजिटल छवियों के लिए बिल्कुल ऐसा ही है।

अब, कल्पना कीजिए कि किसी ने उस ब्लूप्रिंट की फोटो ली, उसे प्रिंट किया, और फिर उसे वापस कंप्यूटर में स्कैन कर लिया। अचानक, यह सिर्फ एक सपाट तस्वीर बन गया (जैसे कि JPEG या PNG)। अब "दीवारें" दीवारें नहीं रहीं; वे केवल रंगीन पिक्सेल मात्र हैं। यदि आप अब एक खिड़की को हिलाना चाहते हैं, तो आपको पुराने वाले को पेंट करके मिटाना होगा और नए सिरे से एक नया बनाना होगा। यह अव्यवस्थपूर्ण है, इसे संपादित करना असंभव है, और यदि आप ज़ूम करते हैं, तो यह धुंधला हो जाता है।

समस्या:
विज्ञान और इंजीनियरिंग की दुनिया में, शोधकर्ता लगातार इन "ब्लूप्रिंट्स" को खो देते हैं। उनके पास अंतिम तस्वीर (स्कैन) तो होती है, लेकिन मूल, संपादन योग्य कोड गायब होता है। इन जटिल आरेखों (diagrams) को फिर से हाथ से बनाना वैसा ही है जैसे कि आर्किटेक्ट के नक्शे खो जाने के बाद, ईंट-दर-ईंट अपने हाथों से एक भव्य गिरजाघर को फिर से बनाने की कोशिश करना। इसमें बहुत समय लगता है और इसके लिए एक विशेषज्ञ की आवश्यकता होती है।

समाधान: VFig
इस शोध पत्र के लेखकों ने एक नया AI बनाया है जिसे VFig (वेक्टर फिगर) कहा जाता है। VFig को एक सुपर-इंटेलिजेंट "रिवर्स इंजीनियर" की तरह समझें जो एक सपाट, अव्यवस्थित आरेख की फोटो देखता है और तुरंत उसका मूल, साफ और संपादन योग्य ब्लूप्रिंट कोड लिख देता है।

उन्होंने इस AI को यह सिखाने के लिए कुछ रचनात्मक उपमाओं का उपयोग किया है:

1. प्रशिक्षण डेटा (Training Data): "कुकिंग बुक" (पाक विधि की पुस्तक)

एक शेफ को खाना बनाना सिखाने के लिए, आपको रेसिपी की आवश्यकता होती है। एक AI को आरेख बनाना सिखाने के लिए, आपको "इमेज + कोड" के विशाल पुस्तकालय की आवश्यकता होती है।

  • चुनौती: मौजूदा लाइब्रेरी सरल रेसिपी (जैसे "एक स्माइली फेस कैसे बनाएं") वाली कुकिंग बुक की तरह थीं। उनके पास जटिल रेसिपी (जैसे "10-चरणीय परमाणु रिएक्टर कैसे बनाएं") नहीं थीं।
  • समाधान: टीम ने VFig-Data बनाया, जो 66,000 जटिल आरेखों वाला एक विशाल नया पुस्तकालय है। उन्होंने केवल कॉपी-पेस्ट नहीं किया; उन्होंने "खराब सामग्री" (जैसे बादलों की फोटो या गणितीय समीकरण) को फ़िल्टर करने के लिए एक पाइपलाइन बनाई और केवल संरचनात्मक आरेखों (फ्लोचार्ट, आर्किटेक्चर, नेटवर्क) को रखा। उन्होंने लाखों सिंथेटिक आरेख भी बनाए ताकि AI हर संभव आकार और तीर (arrow) के संयोजन को देख सके।

2. प्रशिक्षण पद्धति (Training Method): "चलना सीखो, फिर दौड़ना सीखो"

आप एक बच्चे को पहले दिन ही मैराथन दौड़ने के लिए नहीं कह सकते। आप उन्हें पहले बैठना, फिर खड़ा होना और फिर चलना सिखाएंगे।

  • चरण 1 (SFT - सुपरवाइज्ड फाइन-ट्यूनिंग): AI ने पहले सरल आरेखों (जैसे बुनियादी आकार और तीर) पर अभ्यास किया। इसने इसे SVG की "वर्णमाला" सिखाई: एक आदर्श वृत्त, एक सीधी रेखा या एक टेक्स्ट बॉक्स कैसे बनाया जाता है।
  • चरण 2 ("कोर्स-टू-फाइन" करिकुलम): एक बार जब इसने वर्णमाला में महारत हासिल कर ली, तो उन्होंने इसे "उपन्यास" (जटिल वैज्ञानिक पेपर) दिए। इससे इसे यह सीखने में मदद मिली कि उन आकृतियों को एक सुसंगत कहानी (फ्लोचार्ट या सिस्टम डायग्राम) में कैसे व्यवस्थित किया जाए।

3. "आर्ट क्रिटिक" (कला समीक्षक - Reinforcement Learning)

अभ्यास के बाद भी, AI एक ऐसा आरेख बना सकता है जो दिखने में तो सही हो लेकिन संरचनात्मक रूप से गलत हो (जैसे कि एक गलत बॉक्स की ओर इशारा करता हुआ तीर)।

  • पुराना तरीका: केवल यह देखना कि पिक्सेल मूल छवि से मेल खाते हैं या नहीं। यह एक पेंटिंग को केवल रंगों के आधार पर आंकने जैसा है, यह अनदेखा करते हुए कि उसका परिप्रेक्ष्य (perspective) सही है या नहीं।

  • VFig का तरीका: उन्होंने एक रीइन्फोर्समेंट लर्निंग चरण पेश किया। कल्पना कीजिए कि AI एक आरेख बनाता है, और फिर एक सख्त आर्ट क्रिटिक (एक अन्य AI) उसे देखता है। क्रिटिक केवल "अच्छा काम किया" नहीं कहता। वह एक रिपोर्ट कार्ड देता है:

    • क्या आपने सभी हिस्से शामिल किए? (उपस्थिति/Presence)
    • क्या बॉक्स सही स्थानों पर हैं? (लेआउट/Layout)
    • क्या तीर सही चीजों को जोड़ते हैं? (कनेक्टिविटी/Connectivity)
    • क्या टेक्स्ट पठनीय और स्टाइल सही है? (विवरण/Details)

    यदि AI को खराब स्कोर मिलता है, तो वह फिर से प्रयास करता है, क्रिटिक के फीडबैक से सीखता है, और तब तक प्रयास करता है जब तक कि उसे "A" ग्रेड न मिल जाए। यह एक छात्र की तरह है जो परीक्षा देता है, ग्रेड प्राप्त करता है, अपनी गलतियों से पढ़ता है, और तब तक टेस्ट देता रहता है जब तक कि वह उसमें महारत हासिल न कर ले।

4. परिणाम: दिग्गजों को पछाड़ना

टीम ने VFig का परीक्षण अन्य AI मॉडलों और यहाँ तक कि विशाल, महंगे, क्लोज्ड-सोर्स दिग्गजों (जैसे GPT-5.2 और Gemini) के विरुद्ध किया।

  • परिणाम: VFig, जो कि ओपन-सोर्स और मुफ्त में उपयोग के लिए उपलब्ध है, सबसे महंगे और प्रोप्राइटरी AI मॉडलों के बराबर प्रदर्शन करता है। यह एक जटिल वैज्ञानिक आरेख की अव्यवस्थित फोटो ले सकता है और उसे वापस एक साफ, संपादन योग्य कोड फाइल में बदल सकता है जो मूल के लगभग समान दिखता है।

यह क्यों महत्वपूर्ण है

VFig से पहले, यदि कोई वैज्ञानिक अपना डायग्राम सोर्स फाइल खो देता था, तो वह डायग्राम "मृत" हो जाता था—वह केवल एक तस्वीर मात्र रह जाता था। VFig के साथ, उस तस्वीर को पुनर्जीवित किया जा सकता है।

  • छात्रों के लिए: आप किसी पाठ्यपुस्तक से एक डायग्राम ले सकते हैं, उसे कोड में बदल सकते हैं, और अपने स्वयं के प्रेजेंटेशन के लिए उसमें बदलाव कर सकते हैं।
  • इंजीनियरों के लिए: आप मूल CAD फाइलों की आवश्यकता के बिना पुराने तकनीकी मैनुअल को अपडेट कर सकते हैं।
  • सभी के लिए: यह एक स्थिर छवि और एक जीवित, संपादन योग्य दस्तावेज़ के बीच के अंतर को पाटता है।

संक्षेप में: VFig डिजिटल आरेखों के लिए एक 'टाइम मशीन' है। यह एक जमे हुए, अपरिवर्तनीय स्नैपशॉट को लेता है और उसे वापस एक लचीले, संपादन योग्य ब्लूप्रिंट में बदल देता है, जिससे शोधकर्ताओं और डिजाइनरों को सब कुछ फिर से बनाने के दुस्वप्न से मुक्ति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →