← नवीनतम पेपर
💻 computer science

AmodalSVG: Amodal Image Vectorization via Semantic Layer Peeling

AmodalSVG एक नवीन ढांचा पेश करता है जो प्राकृतिक छवियों को पहले रास्टर डोमेन में छिपे हुए वस्तु क्षेत्रों को पुनर्गठित करने के लिए VLM-निर्देशित 'सिमेंटिक लेयर पीलिंग' का उपयोग करके, और फिर स्वतंत्र, संपादन योग्य वेक्टर परतों को उत्पन्न करने के लिए 'एडेप्टिव लेयर्ड वेक्टरिज़ेशन' का उपयोग करके, उन्हें अर्थपूर्ण रूप से व्यवस्थित और ज्यामितीय रूप से पूर्ण SVG में परिवर्तित करता है।

मूल लेखक: Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक व्यस्त सड़क के दृश्य की एक तस्वीर है। फोटो में, एक व्यक्ति लाल कार के सामने चल रहा है, और कार एक कॉफी शॉप के सामने खड़ी है। यदि आप इस फोटो को पेन से ट्रेस करके इसे एक ड्राइंग में बदलना चाहें, तो एक पारंपरिक कंप्यूटर प्रोग्राम केवल उन्हीं हिस्सों को ट्रेस करेगा जिन्हें वह देख सकता है। वह व्यक्ति के पैरों को तो खींचेगा, लेकिन फिर वहां अचानक रुक जाएगा जहां कार उन्हें रोक रही है। वह कार का अगला हिस्सा तो खींचेगा, लेकिन जहां कॉफी शॉप उसके पीछे छिपी है, वहां एक टेढ़ा-मेढ़ा खाली छेद छोड़ देगा।

परिणाम एक बिखरी हुई, टूटी हुई ड्राइंग होगी जहाँ वस्तुएं अधूरी और कटी हुई लगेंगी। आप पूरी तस्वीर को खराब किए बिना व्यक्ति को आसानी से हिला नहीं पाएंगे या कार का रंग नहीं बदल पाएंगे।

AmodalSVG एक नई तकनीक है जो इस समस्या का समाधान करती है। इसे एक "जादुई जासूस" के रूप में सोचें जो केवल वही नहीं देखता जो दिखाई दे रहा है, बल्कि वह पूरी कहानी की कल्पना करता है, जिसमें वे हिस्से भी शामिल हैं जो दृष्टि से ओझल हैं।

यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:

1. "प्याज छीलने" की रणनीति (सिमेंटिक लेयर पीलिंग)

पूरी बिखरी हुई फोटो को एक साथ ट्रेस करने के बजाय, AmodalSVG इस छवि को परतों में अलग करता है, बिल्कुल एक प्याज की तरह।

  • जासूस (VLM): सबसे पहले, एक स्मार्ट AI जासूस (जिसे विजन-लैंग्वेज मॉडल कहा जाता है) फोटो को देखता है और कहता है, "ठीक है, व्यक्ति सामने है, कार उनके पीछे है, और दुकान पीछे है।" यह चीजों की गहराई और क्रम को समझता है।
  • जादुई इरेज़र और फिलर: सिस्टम व्यक्ति को "छीलकर" अलग कर देता है। लेकिन बैकग्राउंड में छेद छोड़ने के बजाय, यह एक जादुई पेंटब्रश (जिसे इनपेंटिंग कहा जाता है) का उपयोग करता है ताकि यह कल्पना की जा सके और भरा जा सके कि व्यक्ति के पीछे कार और दुकान वास्तव में कैसी दिखती हैं।
  • परिणाम: अब, व्यक्ति एक पूर्ण, स्वतंत्र ड्राइंग है, और बैकग्राउंड कार और दुकान की एक पूर्ण, अटूट तस्वीर है। यह प्रक्रिया तब तक दोहराई जाती है जब तक कि हर वस्तु को अपनी स्वयं की पूर्ण, अलग परत में न बदल दिया जाए।

2. "स्मार्ट स्केचर" (एडेप्टिव लेयर्ड वेक्टराइजेशन)

एक बार जब वस्तुओं को अलग और पूर्ण कर लिया जाता है, तो सिस्टम उनमें से प्रत्येक को एक वेक्टर ग्राफिक (SVG) में बदल देता है। वेक्टर ग्राफिक्स गणितीय वक्रों (curves) से बनी ड्राइंग की तरह होते हैं न कि पिक्सेल से, जिसका अर्थ है कि उन्हें धुंधला हुए बिना अनंत रूप से रीसाइज किया जा सकता है।

  • डायनामिक बजटिंग: कल्पना कीजिए कि आप एक जटिल तितली के पंख बना रहे हैं। बारीकियों को सही ढंग से पाने के लिए आपको हजारों छोटी रेखाओं की आवश्यकता होगी। लेकिन एक साधारण नीले आकाश के लिए, आपको केवल कुछ बड़ी रेखाओं की आवश्यकता है।
  • स्मार्ट एडजस्टर: AmodalSVG का "स्मार्ट स्केचर" ड्राइंग प्रक्रिया पर नज़र रखता है। यदि यह कोई धुंधला स्थान या छूटी हुई डिटेल देखता है, तो यह स्वचालित रूप से अधिक रेखाएं जोड़ देता है। यदि यह देखता है कि कोई हिस्सा पहले से ही एकदम सही है या किसी और चीज़ के पीछे छिपा हुआ है, तो यह फ़ाइल को छोटा और कुशल रखने के लिए अनावश्यक रेखाओं को हटा देता है। यह लगातार गुणवत्ता और सरलता के बीच संतुलन बनाता है।

यह एक बड़ी बात क्यों है?

एक फोटो कोलाज और एक लेयर्ड डिज़ाइन फ़ाइल (जैसे फोटोशॉप या इलस्ट्रेटर में होता है) के बीच के अंतर के बारे में सोचें।

  • पुराने तरीके (फोटो कोलाज): यदि आप पारंपरिक वेक्टर इमेजरी में कार का रंग बदलना चाहते हैं, तो आप गलती से उसके पीछे स्थित कॉफी शॉप का रंग भी बदल सकते हैं क्योंकि वे सभी रेखाओं के एक उलझे हुए ढेर में आपस में जुड़े हुए हैं।
  • AmodalSVG (लेयर्ड डिज़ाइन फ़ाइल): क्योंकि यह हर वस्तु को उसकी अपनी पूर्ण, छिपे हुए-मुक्त परत में अलग करता है, इसलिए आप:
    • व्यक्ति को सड़क के दूसरी ओर हिला सकते हैं।
    • कार को लाल से नीला बदल सकते हैं।
    • कॉफी शॉप को पूरी तरह से हटा सकते हैं।
    • व्यक्ति को बिना पिक्सेलेट हुए रीसाइज कर सकते हैं।

यह सब तुरंत होता है क्योंकि कंप्यूटर जानता है कि हर वस्तु वास्तव में कहाँ होनी चाहिए, यहाँ तक कि वे हिस्से भी जो मूल रूप से छिपे हुए थे।

निष्कर्ष

AmodalSVG कंप्यूटर को बाधाओं के "पार देखने" और पर्दे के पीछे की पूरी, पूर्ण दुनिया को फिर से बनाने की क्षमता देने जैसा है। यह एक सपाट, टूटी हुई पिक्सेल फोटो को साफ, संपादन योग्य और बुद्धिमान 3D जैसी वेक्टर परतों के ढेर में बदल देता है, जिससे डिजिटल आर्ट को उन तरीकों से संपादित करना संभव हो जाता है जो पहले असंभव थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →