← नवीनतम पेपर
💻 computer science

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

यह शोध पत्र एक 3D फाउंडेशनल जनरेटिव मॉडल से मल्टी-स्केल लेटेंट फीचर्स को स्ट्रक्चरल प्रायर्स के रूप में उपयोग करके, एक सिंगल इमेज से यथार्थवादी और सुसंगत ऑर्बिटल वीडियो उत्पन्न करने की एक नवीन विधि प्रस्तावित करता है, जिसे एक मल्टी-स्केल 3D एडेप्टर के माध्यम से बेस वीडियो मॉडल में इंजेक्ट किया जाता है ताकि लॉन्ग-रेंज व्यू एक्सट्रपलेशन में पिक्सेल-वाइज अटेंशन की सीमाओं को दूर किया जा सके।

मूल लेखक: Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li

प्रकाशित 2026-04-15
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके फोन में एक खिलौना कार की एक अकेली फोटो है। आप उसे वीडियो में घूमते हुए देखना चाहते हैं ताकि आप हर कोण से पिछला हिस्सा, किनारे और पहिए देख सकें।

समस्या:
वर्तमान AI वीडियो जनरेटर उन प्रतिभाशाली कलाकारों की तरह हैं जो जो देखते हैं उसकी नकल करने में माहिर हैं, लेकिन वे कल्पना करने में संघर्ष करते हैं। यदि आप उनसे कार का पिछला हिस्सा दिखाने के लिए कहते हैं (जो आपकी फोटो में नहीं है), तो वे अक्सर गलत अनुमान लगाते हैं। वे ऐसा पिछला हिस्सा बना सकते हैं जो सामने जैसा दिखता हो, या पहिए गायब कर सकते हैं, या कार को एक अजीब, पिघले हुए ढेर में बदल सकते हैं। वे "पिक्सेल मैचिंग" (फोटो के डॉट्स को देखने और यह अनुमान लगाने कि वे कहाँ जाते हैं) पर निर्भर करते हैं, जो तब विफल हो जाता है जब दृश्य बहुत अधिक बदल जाता है।

समाधान (यह शोध पत्र):
इस शोध पत्र के लेखक, "Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors," ने एक चतुर तरकीब निकाली है। केवल वीडियो AI से अनुमान लगाने के लिए कहने के बजाय, वे पहले उसे एक 3D ब्लूप्रिंट देते हैं।

यहाँ बताया गया है कि वे इसे कैसे करते हैं, कुछ सरल उपमाओं का उपयोग करके:

1. "द घोस्ट स्कल्प्टर" (3D फाउंडेशन मॉडल)

वीडियो AI द्वारा चित्र बनाना शुरू करने से पहले, वे एक अलग, विशेष AI (एक "3D फाउंडेशन मॉडल", विशेष रूप से Hunyuan3D) को आपकी फोटो देखने और वस्तु के पूरे 3D आकार की कल्पना करने के लिए कहते हैं, यहाँ तक कि उन हिस्सों की भी जिन्हें आप देख नहीं सकते।

  • उपमा: कल्पना कीजिए कि आपके पास एक मूर्ति की फोटो है। एक सामान्य कलाकार सामने के आधार पर पीछे का चित्र बनाने की कोशिश करता है। लेकिन यह "घोस्ट स्कल्प्टर" (भूतिया मूर्तिकार) एक कुशल मूर्तिकार की तरह है जो फोटो को देखता है और तुरंत अपने मन में पूरी मूर्ति का एक सटीक, अदृश्य मिट्टी का मॉडल बना लेता है, जिसमें छिपा हुआ पिछला हिस्सा भी शामिल है।

2. "दो-चरणीय निर्देश" (द प्रायर)

शोध पत्र केवल वीडियो AI को मिट्टी के मॉडल की एक तस्वीर नहीं भेजता है। यह दो विशिष्ट प्रकार के निर्देश भेजता है:

  • बड़ी तस्वीर (ग्लोबल लेटेंट): वस्तु के समग्र आकार का एक सारांश। उपमा: एक त्वरित स्केच जो कलाकार को बताता है, "यह एक कार है, इसके चार पहिए हैं, और यह चौकोर है।"
  • बारीक विवरण (लोकल लेटेंट): विभिन्न कोणों से वस्तु को दिखाने वाले "भूतिया छवियों" का एक सेट। उपमा: संदर्भ फोटो का एक सेट जो कार को साइड, टॉप और बैक से दिखाता है, ताकि कलाकार को पता चल सके कि हेडलाइट्स कैसे मुड़ती हैं या दरवाज़ों के हैंडल कहाँ हैं।

3. "विशेष अनुवादक" (3D अडैप्टर)

वीडियो AI स्वाभाविक रूप से "3D ब्लूप्रिंट" नहीं बोलता। वह "वीडियो पिक्सेल" बोलता है। इसे ठीक करने के लिए, लेखकों ने एक विशेष अडैप्टर (एक अनुवादक) बनाया है।

  • उपमा: वीडियो AI को एक फिल्म निर्देशक के रूप में सोचें जो केवल अंग्रेजी में लिखे गए स्क्रिप्ट को समझता है। 3D ब्लूप्रिंट "स्कल्प्टर" भाषा में लिखा गया है। 3D अडैप्टर उस निर्देशक के कान में ब्लूप्रिंट के निर्देश फुसफुसाने वाला अनुवादक है, जो फिल्म फिल्माते समय उनके बीच खड़ा होता है। यह सुनिश्चित करता है कि निर्देशक (वीडियो AI) कभी भी कार के आकार को न भूले, भले ही कैमरा चारों ओर घूम रहा हो।

यह बेहतर क्यों है?

  • कोई पिघलना नहीं: क्योंकि AI के पास मार्गदर्शक के रूप में "मिट्टी का मॉडल" है, इसलिए कार घूमने पर पिघलती या अपना आकार नहीं बदलती। कार का पिछला हिस्सा बिल्कुल वैसा ही दिखता है जैसा एक असली कार का पिछला हिस्सा होना चाहिए।
  • निरंतरता (Consistency): वीडियो सुचारू रहता है। पहिए अचानक चौकोर ब्लॉक में नहीं बदलते।
  • दक्षता (Efficiency): उन्हें इसे काम करने के लिए एक भारी, जटिल 3D मेश (डिजिटल वायरफ्रेम) बनाने की आवश्यकता नहीं है। वे "लेटेंट फीचर्स" (आकार के संकुचित डिजिटल फुसफुसाहट) का उपयोग करते हैं, जो इस प्रक्रिया को तेज़ और हल्का बनाता है।

परिणाम

जब आप इस पद्धति को चलाते हैं, तो आपको एक ऐसा वीडियो मिलता है जहाँ वस्तु सुचारू रूप से घूमती है, हर कोण से वास्तविक दिखती है, यहाँ तक कि उन हिस्सों से भी जो मूल फोटो में कभी नहीं थे। यह AI को वस्तु की वास्तविक 3D संरचना का "चीट शीट" देने जैसा है ताकि उसे फिर कभी अनुमान न लगाना पड़े।

संक्षेप में: उन्होंने वीडियो AI को वस्तु के पीछे का हिस्सा केवल अनुमान लगाने के बजाय, उसके पहले से बने 3D मानचित्र को देखने के लिए सिखाया, जिसके परिणामस्वरूप ऐसे वीडियो मिलते हैं जो वास्तविक दिखते हैं, सुसंगत रहते हैं, और डिजिटल दुःस्वप्न में नहीं बदलते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →