← नवीनतम पेपर
💻 computer science

AnyStyle: Single-Pass Multimodal Stylization for 3D Gaussian Splatting

AnyStyle एक फीड-फॉरवर्ड फ्रेमवर्क है जो मौजूदा बैकबोन में मल्टीमॉडल (टेक्स्टुअल और विजुअल) कंडीशनिंग को एकीकृत करके ज़ीरो-शॉट, पोज़-फ्री 3D गॉसियन स्प्लेटिंग पुनर्निर्माण और शैलीकरण को सक्षम बनाता है, जो ज्यामितीय गुणवत्ता को बनाए रखते हुए बेहतर स्टाइल नियंत्रणीयता प्रदान करता है।

मूल लेखक: Joanna Kaleta, Bartosz Świrta, Kacper Kania, Tomasz Trzciński, Przemysław Spurek, Marek Kowalski

प्रकाशित 2026-07-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joanna Kaleta, Bartosz Świrta, Kacper Kania, Tomasz Trzciński, Przemysław Spurek, Marek Kowalski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वास्तविक दुनिया के कमरे का 3D मॉडल बनाने की कोशिश कर रहे हैं एक वास्तुकार (architect) के रूप में, लेकिन आपके पास केवल कुछ धुंधली तस्वीरें हैं जो अलग-अलग कोणों से ली गई हैं, और आपको यह भी नहीं पता कि प्रत्येक फोटो खींचते समय कैमरा ठीक कहाँ खड़ा था। लंबे समय तक, ऐसे बिखरे हुए सुरागों से एक पूर्ण 3D दुनिया बनाना एक विशाल जिग्सॉ पहेली को आंखों पर पट्टी बांधकर हल करने जैसा था; कंप्यूटर को दीवारों और फर्नीचर का आकार समझने के लिए घंटों गणितीय गणना करने में लग जाते थे। लेकिन हाल ही में, "3D गॉसियन स्प्लेटिंग" (3D Gaussian Splatting) नामक एक नई तकनीक ने खेल बदल दिया है। इस पद्धति को एक दृश्य को ठोस ईंटों से नहीं, बल्कि अंतरिक्ष में तैरते लाखों छोटे, मुलायम, रंगीन बादलों (गॉसियन्स) से पेंट करने के रूप में सोचें। जब आप उन्हें अलग-अलग कोणों से देखते हैं, तो वे एक ठोस, वास्तविक वस्तु दिखने के लिए आपस में मिल जाते हैं, और वे यह काम अविश्वसनीय रूप से तेजी से करते हैं। यह एक बड़ी बात है क्योंकि इसका मतलब है कि हम अंततः घंटों के बजाय सेकंडों में वीडियो गेम या फिल्मों के लिए 3D दुनिया बना सकते हैं।

हालाँकि, इसमें एक पेच था। जबकि ये नई विधियाँ कमरे के आकार को तेज़ी से बना सकती थीं, वे किसी विशिष्ट कलात्मक शैली के अनुरूप इसके रूप को बदलने में सक्षम नहीं थीं, जैसे कि एक लिविंग रूम की फोटो को वान गॉग (Van Gogh) की पेंटिंग या एक साइबरपंक शहर में बदलना। पिछले प्रयास या तो बहुत धीमे थे, या उनके लिए हर नए स्टाइल के लिए पूरी दुनिया को फिर से सीखना पड़ता था, या वे केवल तभी एक स्टाइल की नकल कर पाते थे जब आप उन्हें एक तस्वीर दिखाते थे, जिससे "इसे नरम किनारों वाली वॉटरकलर पेंटिंग जैसा बनाओ" कहने की गुंजाइश नहीं बचती थी। यहीं पर नया पेपर, "AnyStyle," समस्या को ठीक करने के लिए आता है।

AnyStyle के पीछे के शोधकर्ताओं ने एक चतुर नई प्रणाली बनाई है जो आपको एक दृश्य की उन अव्यवस्थित, बिना पोज़ वाली तस्वीरों को लेने और तुरंत उसे एक पूरी तरह से नए कलात्मक रूप वाली 3D दुनिया में बदलने देती है, और वह भी एक ही, बिजली की तरह तेज़ प्रक्रिया में। जादू यह है कि आपको कंप्यूटर को केवल वह स्टाइल दिखाने की ज़रूरत नहीं है जो आप चाहते हैं; आप बस एक विवरण भी टाइप कर सकते हैं, जैसे "इसे भारी चारकोल स्ट्रोक्स वाले एक स्केच जैसा बनाओ" या "इसे नियॉन-रोशनी वाले साइबरपंक दृश्य में बदलो।" सिस्टम चित्रों और शब्दों दोनों को समझता है, और स्टाइल को सही आकार और रंगों में ढालने के लिए उन्हें आपस में मिला देता है।

यह समझने के लिए कि उन्होंने इसे कैसे अंजाम दिया, कल्पना कीजिए कि कंप्यूटर का मस्तिष्क दो टीमों में विभाजित है। पहली टीम एक "फ्रोजन" (frozen) विशेषज्ञ है जो कभी नहीं बदलती; इसका एकमात्र काम आपकी तस्वीरों को देखना और उनकी ज्यामिति (geometry) को समझना है—कि दीवारें, फर्श और वस्तुएं कहाँ हैं। यह टीम विश्वसनीय और तेज़ है क्योंकि इसे पहले से ही हजारों दृश्यों पर प्रशिक्षित किया गया है। दूसरी टीम "कलाकार" (artist) है, जो प्रयोग करने के लिए स्वतंत्र है। यह टीम पहली टीम से आकार की जानकारी लेती है और स्टाइल के निर्देशों (आपके टेक्स्ट या इमेज से) के साथ मिलकर दृश्य को पेंट करती है। उनके डिज़ाइन का जीनियस हिस्सा एक विशेष "इंजेक्शन" तंत्र है। कलाकार को दुनिया को देखने का तरीका फिर से सिखाने के बजाय, वे स्टाइल निर्देशों को एक गुप्त नोट की तरह कलाकार के वर्कफ़्लो में चुपके से डाल देते हैं। यह नोट कलाकार को बताता है कि कमरे के आकार को बिगाड़े बिना रंगों और बनावट (textures) को कैसे टवीक (tweak) करना है। क्योंकि आकार विशेषज्ञ 'फ्रोजन' है और कलाकार हल्का (lightweight) है, इसलिए पूरी प्रक्रिया एक सेकंड के अंश में होती है—विशेष रूप से, प्रत्येक इनपुट इमेज के लिए 0.1 सेकंड से भी कम समय में।

पेपर दिखाता है कि यह विधि पिछले प्रयासों की तुलना में एक महत्वपूर्ण सुधार है। जबकि अन्य सिस्टम जो एक बार में ऐसा करने की कोशिश करते हैं, अक्सर जटिल निर्देशों का पालन करने में संघर्ष करते हैं या उन्हें हर बार शुरू से प्रशिक्षण की आवश्यकता होती है, AnyStyle एक पूर्व-प्रशिक्षित मॉडल के साथ काम करता है और बस उसके ऊपर एक छोटा, लचीला स्तर जोड़ देता है। शोधकर्ताओं ने अपने सिस्टम का परीक्षण लोगों से परिणामों की तुलना करने के लिए कहा। परिणाम स्पष्ट थे: लोगों ने AnyStyle की छवियों को पसंद किया क्योंकि वे मूल दृश्य के विवरणों को बरकरार रखते हुए इच्छित कला शैली के अधिक करीब थीं। सिस्टम ने यह भी साबित किया कि वह टेक्स्ट और इमेज दोनों को समान रूप से अच्छी तरह से संभाल सकता है, जिससे उपयोगकर्ताओं को एक संदर्भ फोटो के साथ "रंगों को नरम करें" जैसे टेक्स्ट प्रॉम्प्ट का उपयोग करके स्टाइल को परिष्कृत करने की अनुमति मिलती है।

संक्षेप में, लेखकों ने पाया कि "आकार को समझने" के काम को "स्टाइल लागू करने" के काम से अलग करके, और स्टाइल निर्देशों को इंजेक्ट करने का एक स्मार्ट तरीका उपयोग करके जो मौजूदा सिस्टम को तोड़ता नहीं है, वे तुरंत उच्च-गुणवत्ता वाली, शैलीबद्ध (stylized) 3D दुनिया बना सकते हैं। उन्होंने केवल यह सुझाव नहीं दिया कि यह काम कर सकता है; उन्होंने इसे मापा भी है, यह दिखाते हुए कि उनकी विधि वर्तमान अत्याधुनिक (state-of-the-art) उपकरणों की तुलना में बेहतर परिणाम देती है और वह भी घंटों के प्रशिक्षण समय के बिना। इसका मतलब यह है कि निकट भविष्य में, आप अपने बेडरूम की कुछ तस्वीरें ले सकते हैं और तुरंत देख सकते हैं कि वह वॉटरकलर पेंटिंग, कॉमिक बुक सीन या एक भविष्यवादी शहर के रूप में कैसा दिखेगा, और वह भी बिना कंप्यूटर के घंटों तक गणना करने का इंतज़ार किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →