← नवीनतम पेपर
💻 computer science

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

OmniX एक फीड-फॉरवर्ड 4D पुनर्निर्माण ढांचा (framework) है जो कॉम्पैक्ट डायनेमिक टोकन का उपयोग करके डायनेमिक मोशन मॉडलिंग को स्टैटिक ज्योमेट्री से अलग करके, एक नए पेश किए गए बड़े पैमाने के सिंथेटिक डेटासेट द्वारा समर्थित, बड़े कैमरा मोशन वाले वीडियो के लिए डेंस 3D पॉइंट ट्रैजेक्टरीज की भविष्यवाणी करता है।

मूल लेखक: Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

प्रकाशित 2026-07-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो गेम में हलचल भरे शहर के चौक को फिर से बनाने की कोशिश कर रहे हैं, लेकिन आपके पास केवल एक हाथ से पकड़े हुए कैमरे की रिकॉर्डिंग है जो चलते हुए लोगों, तेजी से गुजरती कारों और आसमान में घूमते सूरज को रिकॉर्ड कर रहा है। कैमरा झटके से हिलता है, ज़ूम इन और ज़ूम आउट होता है, और इधर-उधर कूदता है। इस तरह के वीडियो से 3D मॉडल बनाने के पिछले अधिकांश प्रयास ऐसे थे जैसे आंखों पर पट्टी बांधकर पहेली सुलझाने की कोशिश करना: या तो उन्होंने चलते हुए लोगों को स्थिर कर दिया (एक्शन को अनदेखा कर दिया) या फिर कैमरा बहुत अधिक हिलने पर भ्रमित हो गए, जिसके परिणामस्वरूप एक धुंधला और टूटा हुआ परिणाम मिला।

यहाँ आता है OmniX, एक नया "फीड-फॉरवर्ड" फ्रेमवर्क (इसे एक सुपर-फास्ट, वन-शॉट रेसिपी समझें) जो अंततः इन डायनेमिक दृश्यों को 4D में पुनर्गठित करने में सक्षम है—इसका मतलब है कि यह 3D आकार साथ ही यह भी कैप्चर करता है कि समय के साथ हर एक बिंदु कैसे चलता है, भले ही कैमरा कितना भी अनियंत्रित क्यों न हो।

जादुई ट्रिक: स्थिर और घूमते हुए हिस्से को अलग करना

पेपर का तर्क है कि पिछले तरीके विफल रहे क्योंकि उन्होंने इमारत के आकार और व्यक्ति के डांस मूव्स को बिना अलग किए, एक साथ समझने की कोशिश की। यह एक मिक्सर के बिना सोलो वायलिन और ड्रम सोलो को एक साथ सुनने जैसा है, जहाँ आप ट्रैक को अलग नहीं कर पाते।

OmniX इसे स्पष्ट रूप से डिसेन्टैंगल (अनमिक्स) करके ठीक करता है। यह बैकग्राउंड (स्थिर ज्यामिति) और फोरग्राउंड (डायनेमिक मोशन) को अलग-अलग सामग्रियों के रूप में मानता है।

  • स्थिर हिस्सा (The Static Part): यह पता लगाता है कि दीवारें और जमीन कहाँ हैं।
  • डायनेमिक हिस्सा (The Dynamic Part): हर एक पिक्सेल की गति को व्यक्तिगत रूप से ट्रैक करने के बजाय (जो धीमा और गणनात्मक रूप से भारी है), OmniX एक चतुर ट्रिक का उपयोग करता है। यह "डायनेमिक टोकन्स" के एक छोटे, स्पार्स (विरल) सेट की पहचान करता है। इन टोकन्स को सुपर-स्काउट्स के रूप में सोचें जिन्हें पूरे भीड़ की गति का मानचित्र बनाने के लिए भेजा गया है। क्योंकि 3D मोशन स्वाभाविक रूप से स्पार्स और व्यवस्थित (लो-रैंक) होता है, ये कुछ स्काउट्स एक "ट्रैजेक्टरी फील्ड" बना सकते हैं—एक ऐसा नक्शा कि वीडियो का हर पिक्सेल, हर कोण से और हर क्षण में कैसे चलेगा।

"वन-पास" की महाशक्ति

पुराने तरीके एक धीमी गति वाले जासूस की तरह काम करते थे, जो फ्रेम दर फ्रेम जांचते थे, "यह बिंदु कहाँ गया?" और फिर "यह आगे कहाँ गया?" और यह प्रक्रिया बार-बार दोहराते थे। इसे "इटरेटिव" (पुनरावृत्ति) कहा जाता है, जो धीमा है।

OmniX अलग है। यह एक ही पास में हर बिंदु के पूरे पथ की भविष्यवाणी करता है। यह एक फिल्म देखने और तुरंत यह जानने जैसा है कि पात्रों का भविष्य का पूरा रास्ता क्या होगा, बिना फिल्म को रोकने या रिवाइंड करने के। यह स्पार्स स्पैटियोटेम्पोरल अटेंशन (SSA) नामक एक नए तंत्र द्वारा संभव बनाया गया है। SSA सबसे महत्वपूर्ण "डायनेमिक टोकन्स" को चुनता है, उन्हें समय के साथ फैलाता है, और उन्हें मोशन को समझने के लिए सभी इमेज डेटा के साथ "बातचीत" करने देता है। फिर, एक डेफॉर्मेबल ट्रैजेक्टरी सैंपलिंग हेड उन स्पार्स सुरागों को लेता है और अंतराल को भरकर पूरे दृश्य के लिए एक सघन, पिक्सेल-परफेक्ट प्रक्षेपवक्र (ट्रैजेक्टरी) प्रदान करता है।

ट्रेनिंग जिम बनाना: UE5 इंजन

आप एक रोबोट को तब तक डांस करना नहीं सिखा सकते जब तक उसने कभी डांस फ्लोर न देखा हो। लेखकों ने महसूस किया कि इस तरह के महत्वाकांक्षी मॉडल को प्रशिक्षित करने के लिए "बड़े कैमरा मोशन" और सटीक 3D लेबल वाले वास्तविक दुनिया के डेटा की कमी है। इसलिए, उन्होंने अपना खुद का जिम बनाया।

अनरियल इंजन 5 (UE5) का उपयोग करके, उन्होंने एक ऑटोमैटिक डेटा इंजन बनाया। उन्होंने स्थिर वातावरण लिया, उसमें गतिशील वस्तुएं (जैसे चलती कारें और लोग) डालीं, और उन्हें एक कस्टम कैमरा सिस्टम के साथ फिल्मायाया जो पागलों की तरह इधर-उधर घूम रहा था।

  • परिणाम: उन्होंने 80,000 दृश्यों और 1.28 मिलियन मल्टी-व्यू वीडियो का एक विशाल डेटासेट तैयार किया।
  • एनोटेशन: प्रत्येक वीडियो के साथ सटीक "ग्राउंड ट्रुथ" लेबल आते हैं: सटीक डेप्थ, कैमरा पोज़ और सघन 3D पॉइंट ट्रैजेक्टरीज। यही सिंथेटिक डेटा था जिसने OmniX को उन जंगली, 180-डिग्री कैमरा स्विंग्स को संभालने के लिए सक्षम बनाया जिन्होंने पिछले मॉडल्स को भ्रमित कर दिया था।

परिणाम: यह कितना अच्छा है?

पेपर ने कई चुनौतियों पर OmniX का परीक्षण किया, और आंकड़े बताते हैं कि यह क्षेत्र में एक नया लीडर है।

  • डेंस 3D पॉइंट ट्रैजेक्टरी: अपने कस्टम वैलिडेशन सेट पर, OmniX ने पिछले सर्वश्रेष्ठ तरीकों (जैसे VDPM और TraceAnything) को बड़े अंतर से पीछे छोड़ दिया। उदाहरण के लिए, "डिस्क जॉइंट वीडियो पेयर्स" (जहाँ आपके पास दो अलग-अलग वीडियो क्लिप हैं जो समय में ओवरलैप नहीं होते हैं) पर, OmniX ने सभी बिंदुओं के लिए APD3D (औसत पॉइंट डिस्टेंस) 0.444 प्राप्त किया, जबकि रनर-अप VDPM के लिए यह 0.306 था। (नोट: इस विशिष्ट मीट्रिक में, उच्च APD3D बेहतर प्रदर्शन को दर्शाता है)। त्रुटि दर भी काफी कम हो गई, जहाँ OmniX ने कुछ सेटिंग्स में EPE (एंड-पॉइंट एरर) 0.101 प्राप्त किया, जबकि VDPM के लिए यह 0.306 था।
  • 3D पॉइंट ट्रैकिंग: TAPVid-3D बेंचमार्क पर, OmniX ने तीन अलग-अलग डेटासेट्स (ADT, DriveTrack, PStudio) पर स्टेट-ऑफ-द-आर्ट परिणाम प्राप्त किए। उदाहरण के लिए, ADT डेटासेट पर, इसने 0.367 का APD3D प्राप्त किया, जो अगले सबसे अच्छे तरीके (VDPM 0.266) को बड़े अंतर से पीछे छोड़ देता है। चूंकि यहाँ उच्च APD3D बेहतर है, यह ट्रैकिंग सटीकता में एक बड़ा सुधार है।
  • अन्य कार्य: इसने वीडियो डेप्थ एस्टीमेशन और कैमरा पोज एस्टीमेशन में भी बहुत अच्छा प्रदर्शन किया, जो KITTI और Sintel जैसे डेटासेट्स पर शीर्ष प्रतिस्पर्धियों के बराबर या उनसे बेहतर रहा।

यह क्या नहीं है (और यह क्या खारिज करता है)

पेपर बहुत स्पष्ट है कि उनके प्रयोगों के आधार पर क्या काम नहीं करता है:

  • स्काउट्स के लिए "सेल्फ-अटेंशन" नहीं: उन्होंने अपने स्पार्स स्पैटियोटेम्पोरल अटेंशन मॉड्यूल में एक "सेल्फ-अटेंशन" लेयर (जहाँ डायनेमिक टोकन्स एक-दूसरे से बात करते हैं) जोड़ने की कोशिश की। परिणाम? इससे लगभग कोई फर्क नहीं पड़ा। पेपर स्पष्ट रूप से इसे अनावश्यक बताते हुए खारिज करता है, जिससे कंप्यूटिंग पावर बचती है।
  • कोई इटरेटिव गेसिंग नहीं: पेपर "इटरेटिवली क्वेरीइंग" (बार-बार पूछने) के पुराने तरीके के खिलाफ तर्क देता है। उनका "वन-पास" दृष्टिकोण सघन भविष्यवाणियों के लिए अधिक तेज़ और सटीक साबित हुआ है।
  • "स्मॉल कैमरा मोशन" की कोई सीमा नहीं: पिछले तरीके जो सघन प्रक्षेपवक्र (ट्रैजेक्टरी) की भविष्यवाणी करते थे, वे उन वीडियो तक सीमित थे जहाँ कैमरा बहुत कम हिलता था। OmniX स्पष्ट रूप से सिद्ध करता है कि यह बड़े कैमरा मोशन (180 डिग्री तक) और यहाँ तक कि टेम्पोरली डिस्क जॉइंट इनपुट (ऐसे वीडियो जो समय में ओवरलैप नहीं होते) के साथ भी काम करता है।

निष्कर्ष

OmniX यह सुझाव देता है कि "क्या चल रहा है" को "क्या खड़ा है" से अलग करके, और 80,000 दृश्यों के विशाल सिंथेटिक डेटासेट पर प्रशिक्षित होकर, हम अंततः एक सिंगल, कुशल पास में अराजक, हैंडहेल्ड वीडियो से डायनेमिक 4D दुनिया को पुनर्गठित कर सकते हैं। यह केवल एक छोटा सुधार नहीं है; लेखक दिखाते हैं कि यह हर बिंदु के चलने के तरीके की भविष्यवाणी करने के लिए एक नया स्टेट-ऑफ-द-आर्ट स्थापित करता है, जो इसे स्वायत्त ड्राइविंग (autonomous driving) और AR/VR कंटेंट क्रिएशन जैसी चीजों के लिए एक शक्तिशाली उपकरण बनाता है।

पेपर यह दावा नहीं करता कि यह ब्रह्मांड के हर संभव परिदृश्य के लिए हल की गई समस्या है, लेकिन उनके 80k दृश्यों और 1.28M वीडियो से मिले प्रमाण मजबूती से संकेत देते हैं कि बड़े, जटिल कैमरा मूवमेंट को संभालने के लिए यह वर्तमान में हमारे पास सबसे मजबूत तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →