← नवीनतम पेपर
💻 computer science

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

यह शोध पत्र AnyScene का प्रस्ताव करता है, जो एक एकीकृत ऑक्यूपेंसी-केंद्रित फ्रेमवर्क है जो किसी भी संदर्भ फ्रेम (reference frames) पर निर्भर हुए बिना, मनमाने BEV लेआउट से अत्यधिक नियंत्रणीय, उच्च-सटीक और टेम्पोरल रूप से सुसंगत मल्टी-व्यू ड्राइविंग वीडियो उत्पन्न करने के लिए एक स्पैटियल-टेम्पोरल ऑक्यूपेंसी डिफ्यूजन ट्रांसफॉर्मर और एक ज्योमेट्री-ग्राउंडेड व्यू एक्सपेंशन मॉड्यूल का लाभ उठाता है।

मूल लेखक: Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप शहर की एक सड़क का एक आदर्श, वास्तविक दिखने वाला मूवी बनाना चाहते हैं, लेकिन आपके पास कोई कैमरा क्रू नहीं है, कोई अभिनेता नहीं है, और वास्तव में कोई कारें भी नहीं हैं। इसके बजाय, आपके पास केवल एक साधारण, टॉप-डाउन मैप (जैसे कि वीडियो गेम का मिनी-मैप) है जहाँ आप यह बना सकते हैं कि सड़कें कहाँ होंगी, कारें कहाँ होनी चाहिए, और यहाँ तक कि एक टेक्स्ट नोट के माध्यम से मौसम भी बदल सकते हैं।

यही मूल रूप से AnyScene करता है। यह एक नया कंप्यूटर प्रोग्राम है जो इन सरल, 2D टॉप-डाउन स्केच को पूर्ण, 3D, हाई-डेफिनिशन ड्राइविंग वीडियो में बदल देता है जो वास्तविक और जीवंत लगते हैं।

यह कैसे काम करता है, यहाँ तीन सरल चरणों में रोजमर्रा के उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. "आर्किटेक्ट का ब्लूप्रिंट" (मैप को 3D स्पेस में बदलना)

पुराने तरीके अक्सर सीधे मैप से वीडियो बनाने की कोशिश करते थे, जिससे अक्सर अजीबोगरीब गड़बड़ियाँ होती थीं—जैसे कि एक कार हवा में तैर रही हो या कैमरा हिलने पर कोई इमारत गायब हो जाए।

AnyScene एक अलग दृष्टिकोण अपनाता है। सबसे पहले, यह एक 3D आर्किटेक्ट की तरह काम करता है। यह आपके 2D टॉप-डाउन मैप (इसे "BEV लेआउट" कहा जाता है) को लेता है और पूरे दृश्य का एक "डिजिटल क्ले मॉडल" बनाता है। पेपर में, वे इसे सेमेंटिक ऑक्यूपेंसी (Semantic Occupancy) कहते हैं।

  • उपमा: इसे एक विशाल, अदृश्य ग्रिड के छोटे-छोटे लेगो (Lego) ब्लॉक्स की तरह समझें जो हवा को भर रहे हैं। कुछ ब्लॉक "सड़क" हैं, कुछ "कार" हैं, कुछ "पेड़" हैं, और कुछ "खाली हवा" हैं।
  • जादू: सिस्टम इस लेगो मॉडल को फ्रेम-दर-फ्रेम बनाता है। क्योंकि यह पहले 3D संरचना बनाता है, इसलिए यह सुनिश्चित करता है कि यदि मैप में एक कार सड़क के बाईं ओर है, तो वह 3D दुनिया में भी बाईं ओर ही रहेगी, चाहे कैमरा कैसे भी हिले। यह चीजों को "झटका देने वाला" (jittery) या असंगत दिखने की समस्या को हल करता है।

2. "डायरेक्टर का कैमरा" (मॉडल को मूवी में बदलना)

एक बार जब 3D लेगो मॉडल बन जाता है, तो सिस्टम को उसे वीडियो में बदलने की आवश्यकता होती है। पुराने तरीके एक ऐसे निर्देशक की तरह थे जो एक विशिष्ट कैमरा रिग से बंधे हुए थे; वे केवल निश्चित कोणों से फिल्मा सकते थे या किसी संदर्भ वीडियो की नकल करने की आवश्यकता थी।

AnyScene एक नया मॉड्यूल उपयोग करता है जिसे जियोमेट्री-ग्राउंडेड व्यू एक्सपेंशन (GGVE) कहा जाता है।

  • उपमा: कल्पना कीजिए कि आपके पास एक शहर की एक आदर्श 3D मूर्ति है। AnyScene एक ऐसे निर्देशक की तरह है जो उस मूर्ति के चारों ओर कैमरे के साथ घूम सकता है और किसी भी कोण से उसका फिल्मांकन कर सकता है, यहाँ तक कि उन कोणों से भी जो वास्तविक दुनिया में मौजूद नहीं हैं।
  • जादू: इसे कॉपी करने के लिए किसी संदर्भ वीडियो की आवश्यकता नहीं है। यह 3D लेगो मॉडल को देखता है, गणना करता है कि एक नए कोण से प्रकाश और छाया कैसी दिखनी चाहिए, और फिर वीडियो पिक्सेल उत्पन्न करता है। इसका मतलब है कि आप ड्रोन, कार, या यहाँ तक कि साइकिल पर लगे कैमरे से वीडियो की मांग कर सकते हैं, और यह बिना दोबारा प्रशिक्षित (retrain) हुए तुरंत इसे जेनरेट कर देगा।

3. "अनंत खेल का मैदान" (यह क्यों महत्वपूर्ण है)

पेपर इस बात पर जोर देता है कि यह सिस्टम "नियंत्रणीय" (controllable) है और "कहीं भी" काम करता है।

  • उपमा: इसे एक लेगो सेट की तरह समझें जिसके टुकड़े कभी खत्म नहीं होते। आप न्यूयॉर्क में ट्रैफिक जाम बना सकते हैं, फिर तुरंत मैप को सिंगापुर की एक बरसाती सड़क में बदल सकते हैं, या फिर पूरी तरह से बना बनाया चौराहा बना सकते हैं जो कभी अस्तित्व में नहीं था। सिस्टम उन सभी के लिए वास्तविक वीडियो तैयार करेगा।
  • परिणाम: यह एक साथ 12 अलग-अलग कैमरा व्यू बना सकता है, या उससे भी अधिक, जो एक-दूसरे के साथ पूरी तरह सुसंगत रहेंगे। यदि आप कार हटाने के लिए मैप को एडिट करते हैं, तो वीडियो तुरंत एक खाली सड़क दिखाएगा, और छाया एवं प्रतिबिंब (reflections) अपने आप एडजस्ट हो जाएंगे।

सारांश में

पेपर का दावा है कि AnyScene दो-चरणीय मशीन है:

  1. चरण 1: यह एक सरल टॉप-डाउन ड्राइंग को पढ़ता है और एक सटीक 3D "लेगो दुनिया" (Occupancy) बनाता है।
  2. चरण 2: यह उस 3D दुनिया का उपयोग करके आपके द्वारा चाहे गए किसी भी कैमरा एंगल से, किसी भी मौसम या ट्रैफिक पैटर्न के साथ एक मूवी शूट करता है।

लेखकों ने इसे एक नए, हाई-स्पीड डेटासेट (nuCraftv2) पर टेस्ट किया और दिखाया कि उनकी विधि पिछले सिस्टमों की तुलना में अधिक साफ, सुसंगत और नियंत्रणीय ड्राइविंग वीडियो बनाती है, जो अक्सर ज्यामिति (geometry) को सुसंगत रखने में संघर्ष करते थे या निश्चित कैमरा सेटअप की आवश्यकता रखते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →