← नवीनतम पेपर
💻 computer science

VolFill: Single-View Amodal 3D Scene Reconstruction with Volumetric Flow Matching

VolFill एक जनरेटिव फ्रेमवर्क है जो ज्यामिति फाउंडेशन मॉडल्स और वॉल्यूमेट्रिक फ्लो मैचिंग का उपयोग करके, एकल RGB इमेज से पूर्ण 3D सीन ज्योमेट्री (छिपी हुई संरचनाओं सहित) को पुनर्गठित करने के लिए एक हाइब्रिड 3D VAE और लेटेंट डिफ्यूजन ट्रांसफॉर्मर का लाभ उठाता है।

मूल लेखक: Tuan Duc Ngo, Chuang Gan, Evangelos Kalogerakis

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tuan Duc Ngo, Chuang Gan, Evangelos Kalogerakis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक चाबी के छेद (keyhole) से एक कमरे को देख रहे हैं। आप एक सोफे का सामने का हिस्सा, एक कॉफी टेबल और एक लैंप देख सकते हैं। लेकिन आप सोफे का पिछला हिस्सा, टेबल के पीछे की दीवार, या लैंप के नीचे का फर्श नहीं देख सकते। अधिकांश कंप्यूटर प्रोग्राम जो इस कमरे को "देखने" की कोशिश करते हैं, वे केवल वही बना पाते हैं जो चाबी के छेद के ठीक सामने है। यदि वे बाकी हिस्से का अनुमान लगाने की कोशिश करते हैं, तो वे अक्सर बिखरे हुए, तैरते हुए बिंदुओं या चित्र में बड़े गड्ढों जैसा परिणाम देते हैं।

VolFill एक नया कंप्यूटर प्रोग्राम है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। यह केवल छिपे हुए हिस्सों का अनुमान नहीं लगाता; यह केवल एक फोटो से पूरे कमरे का एक पूर्ण, ठोस 3D मॉडल बनाता है, जिसमें वे हिस्से भी शामिल हैं जिन्हें आप देख नहीं सकते।

यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "पिक्सेल-अलाइन्ड" (Pixel-Aligned) जाल

सोचिए कि वर्तमान 3D स्कैनर एक ऐसे चित्रकार की तरह हैं जिन्हें केवल उसी कैनवास पर पेंट करने की अनुमति है जहाँ रोशनी पड़ रही है। यदि वे एक कुर्सी को देखते हैं, तो वे सामने की टांगों को बिल्कुल सही तरीके से पेंट कर सकते हैं, लेकिन पीछे की टांगें? वे उन्हें खाली छोड़ देते हैं या बस अनुमान लगाते हैं, जिससे अक्सर एक डगमगाती या टूटी हुई आकृति बन जाती है। वे "दृश्य सतह" (visible surface) तक ही सीमित हैं और वस्तु के बाकी हिस्से की कल्पना नहीं कर सकते।

2. समाधान: "अदृश्य स्याही" का नक्शा (TUDF)

अलग-अलग बिंदुओं (जैसे धूल के बादल) का अनुमान लगाने के बजाय, VolFill पूरे कमरे को एक विशाल 3D ग्रिड के रूप में देखता है, जो जेली (Jell-O) के एक विशाल ब्लॉक की तरह है।

  • ट्रिक: यह TUDF नामक एक विशेष प्रकार के नक्शे का उपयोग करता है। कल्पना कीजिए कि यह नक्शा एक "सतह-से-दूरी" (distance-to-surface) सेंसर की तरह है। ग्रिड का हर एक छोटा क्यूब (cube) जानता है कि वह निकटतम दीवार, फर्श या फर्नीचर से कितनी दूर है।
  • यह क्यों मदद करता है: भले ही कोई दीवार सोफे के पीछे छिपी हो, सोफे के पीछे वाले क्यूब अभी भी जानते हैं कि वे उस छिपी हुई दीवार से कितनी दूर हैं। यह कंप्यूटर को अदृश्य हिस्सों को पूरी तरह से "भरने" की अनुमति देता है, जिससे बिंदुओं के बिखरे हुए बादल के बजाय एक ठोस, निरंतर आकार बनता है।

3. इंजन: "स्मार्ट कंप्रेसर" और "ड्रीमर" (The Dreamer)

इसे काम करने के योग्य बनाने के लिए, VolFill दो मुख्य उपकरणों का उपयोग करता है जो मिलकर काम करते हैं:

  • स्मार्ट कंप्रेसर (Hybrid 3D VAE):
    एक पूरे कमरे का पूर्ण 3D ग्रिड बहुत बड़ा होता है और कंप्यूटर को क्रैश कर सकता है। VolFill इस विशाल ग्रिड को एक छोटे, संक्षिप्त सारांश (latent space) में सिकोड़ने के लिए एक "कंप्रेसर" का उपयोग करता है।

    • उपमा: कल्पना कीजिए कि आप एक शहर के विशाल, विस्तृत ब्लूप्रिंट को इतना मोड़ देते हैं कि वह आपकी जेब में आ जाए, लेकिन बाद में उसे खोलने पर सभी महत्वपूर्ण विवरण बरकरार रहें। यह कंप्रेसर इतना स्मार्ट है कि वह जानता है कि खाली हवा को बहुत अधिक विवरण की आवश्यकता नहीं है, इसलिए यह अपनी मेमोरी को फर्नीचर और दीवारों पर केंद्रित करता है।
  • ड्रीमर (Diffusion Transformer):
    एक बार जब ग्रिड कंप्रेस हो जाता है, तो VolFill गायब हिस्सों को भरने के लिए एक "ड्रीमर" का उपयोग करता है।

    • उपमा: कल्पना कीजिए कि आपके पास एक कमरे का स्केच है, लेकिन उसका आधा हिस्सा मिटा दिया गया है। ड्रीमर एक कलाकार है जो दृश्य भाग को देखता है और कहता है, "ठीक है, कमरे आमतौर पर कैसे दिखते हैं, इसके आधार पर, छिपा हुआ हिस्सा ऐसा होना चाहिए।" यह केवल रैंडम अनुमान नहीं लगाता; यह उन "नियमों" का पालन करता है जिनसे 3D वस्तुएं आपस में जुड़ती हैं।

4. गाइड: "डबल-चेक" प्रणाली

यह सुनिश्चित करने के लिए कि ड्रीमर अजीबोगरीब आकृतियाँ (जैसे कि हवा में तैरती छत) न बना दे, VolFill एक Dual-Conditioning रणनीति का उपयोग करता है। यह एक जासूस की तरह काम करता है जिसके पास सबूत के दो स्रोत हैं:

  1. फोटो: यह छवि के उच्च-स्तरीय "वाइब" (vibe) को देखता है (क्या यह रसोई है? बेडरूम है?)।
  2. दृश्य ज्यामिति (Visible Geometry): यह सटीक मानचित्र प्राप्त करने के लिए एक पूर्व-प्रशिक्षित "विशेषज्ञ" (जिसे MoGe2 कहा जाता है) का उपयोग करता है।
    • उपमा: ड्रीमर एक कलाकार है, लेकिन "दृश्य ज्यामिति" एक सख्त सुपरवाइजर है जो स्केल (रूलर) लेकर खड़ा है। सुपरवाइजर कहता है, "आप सोफे के छिपे हुए पिछले हिस्से की कल्पना कर सकते हैं, लेकिन आपको यह सुनिश्चित करना होगा कि यह उन सामने की टांगों से पूरी तरह जुड़ जाए जिन्हें हम वास्तव में देख सकते हैं।" यह छिपे हुए हिस्सों को भौतिक रूप से यथार्थवादी बनाए रखता है।

5. परिणाम: एक ठोस, साफ मॉडल

जब VolFill अपना काम पूरा कर लेता है, तो यह आपको बिंदुओं का एक बिखरा हुआ बादल नहीं देता है। क्योंकि इसने "दूरी मानचित्र" (TUDF) पद्धति का उपयोग किया है, यह तुरंत उस ग्रिड को एक चिकनी, ठोस मेश (जैसे कि 3D प्रिंटेड वस्तु) में बदल सकता है।

  • तुलना: अन्य विधियाँ आपको ऐसा सोफा दे सकती हैं जो मोतियों की थैली (शोर वाले बिंदु) जैसा दिखता है या जिसके पीछे एक भूतिया दूसरी परत (artifacts) हो। VolFill आपको एक साफ, स्पष्ट, ठोस सोफा देता है जहाँ छिपा हुआ पिछला हिस्सा सामने के हिस्से जितना ही चिकना है।

संक्षेप में: VolFill एक एकल फोटो लेता है, दुनिया को एक स्मार्ट सारांश में संकुचित करता है, सख्त ज्यामितीय नियमों द्वारा निर्देशित एक AI "ड्रीमर" का उपयोग करके छिपे हुए हिस्सों की कल्पना करता है, और फिर इसे एक पूर्ण, ठोस 3D कमरे में खोल देता है जिसमें वे सब कुछ शामिल है जिसे आप नहीं देख सकते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →