← नवीनतम पेपर
🤖 machine learning

ODE-GS: Latent ODEs for Dynamic Scene Extrapolation with 3D Gaussian Splatting

ODE-GS एक नवीन ढांचा है जो 3D गॉसियन मापदंडों के प्रक्षेपवक्रों को न्यूरल ऑर्डिनरी डिफरेंशियल इक्वेशंस (ODEs) के माध्यम से विकसित होने वाले लेटेंट डायनेमिक्स के रूप में मॉडल करके गतिशील 3D दृश्यों के निरंतर-समय भविष्य के एक्सट्रपलेशन (extrapolation) को सक्षम बनाता है।

मूल लेखक: Daniel Wang, Patrick Rim, Tian Tian, Dong Lao, Alex Wong, Ganesh Sundaramoorthi

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Daniel Wang, Patrick Rim, Tian Tian, Dong Lao, Alex Wong, Ganesh Sundaramoorthi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यक्ति के करतब दिखाने (जगलिंग करने) का वीडियो देख रहे हैं। आप देखते हैं कि वे तीन गेंदों को हवा में उछालते हैं, और फिर अचानक वीडियो काला (ब्लैक आउट) हो जाता है।

यदि आपसे पूछा जाए, "दो सेकंड में गेंदें कहाँ होंगी?", तो आपका मस्तिष्क केवल रैंडम अनुमान नहीं लगाएगा। आप अभी देखे गए "भौतिकी" (फिजिक्स) का उपयोग करेंगे—गेंद फेंकने की गति, उड़ान का चाप (आर्क), और गति की लय—ताकि भविष्य का मानसिक सिमुलेशन कर सकें।

3D दृश्यों के लिए वर्तमान AI मॉडल उन लोगों की तरह हैं जो केवल उस वीडियो को "रिवाइंड" या "फास्ट-फॉरवर्ड" कर सकते हैं जो उन्होंने पहले ही देख लिया है। यदि आप उनसे पूछते हैं कि वीडियो खत्म होने के बाद क्या होता है, तो वे भ्रमित हो जाते हैं और दृश्य बिखरने लगता है।

ODE-GS AI को एक "मानसिक भौतिकी इंजन" (मेंटल फिजिक्स इंजन) देने का एक नया तरीका है ताकि वह वास्तव में 3D दृश्य के भविष्य की भविष्यवाणी कर सके।


तीन मुख्य सामग्रियां

यह समझने के लिए कि यह कैसे काम करता है, आइए डांस सीखने के उदाहरण का उपयोग करें।

1. "स्मृति" (3D गॉसियन स्प्लेटिंग - 3D Gaussian Splating)

एक दृश्य को केवल एक सपाट तस्वीर के रूप में देखने के बजाय, AI इसे अंतरिक्ष में तैरते लाखों छोटे, रंगीन "धुंधले बादलों" (जिन्हें गॉसियन कहा जाता है) के रूप में देखता है। इन्हें मंच पर मौजूद व्यक्तिगत नर्तकों के रूप में सोचें। प्रत्येक बादल को अपना रंग, अपना आकार और अपनी स्थिति पता होती है। यह AI को अविश्वसनीय रूप से यथार्थवादी, हाई-डेफिनिशन 3D दुनिया बनाने की अनुमति देता है।

2. "अभ्यास" (इंटरपोलेशन मॉडल - The Interpolation Model)

भविष्य की भविष्यवाणी करने से पहले, AI को वर्तमान में महारत हासिल करनी होती है। यह वीडियो को देखता है और सीखता है कि दिए गए फ्रेम के बीच "नर्तक" कैसे चलते हैं। यह एक नर्तक द्वारा अपनी दिनचचर्या का अभ्यास करने जैसा है ताकि यह सुनिश्चित किया जा सके कि हर कदम सुचारू और पूरी तरह से समयबद्ध हो। एक बार जब यह मौजूदा वीडियो में महारत हासिल कर लेता है, तो हम इस ज्ञान को "फ्रीज" कर देते हैं ताकि यह बुनियादी बातें न भूल जाए।

3. "अंतर्ज्ञान" (द लेटेंट ODE - The Latent ODE)

यही असली जादू है। केवल अगले फ्रेम का अनुमान लगाने के बजाय (जो कि वाक्य में अगले शब्द का अनुमान लगाने जैसा है), AI एक न्यूरल ऑर्डिनरी डिफरेंशियल इक्वेशन (ODE) का उपयोग करता है।

इसे डांस के "प्रवाह" (फ्लो) को सीखना समझें। हर एक स्थिति को याद रखने के बजाय, AI मोमेंटम (संवेग) और गति के नियमों को सीखता है। यह नर्तकों की "वेलोसिटी" (वेग) को सीखता है। क्योंकि यह गति के नियमों को समझता है, यह संगीत (मूल वीडियो) रुकने के बाद भी "गणित" को चालू रख सकता है। यह यह जानने जैसा है कि यदि एक गेंद एक निश्चित गति से ऊपर की ओर जा रही है, तो गुरुत्वाकर्षण अंततः उसे नीचे की ओर खींचेगा ही।


यह एक बड़ी बात क्यों है?

अधिकांश वर्तमान तकनीकें "आउट-ऑफ-डिस्ट्रीब्यूशन" विफलता से जूझती हैं। सरल भाषा में: यदि वे कुछ ऐसा देखते हैं जिसके लिए उन्हें विशेष रूप से प्रशिक्षित नहीं किया गया है, तो वे घबरा जाते हैं और "ग्लिच" युक्त बेतुकी चीजें बनाने लगते हैं।

क्योंकि ODE-GS केवल टाइमस्टैम्प को याद करने के बजाय गति के निरंतर नियमों को सीखता है, इसलिए यह घबराता नहीं है। यह "एक्सट्रपोलेट" (extrapolate) कर सकता—यह एक दृश्य को देख सकता है और कह सकता है, "मैंने पहले यह सटीक क्षण नहीं देखा है, लेकिन मैं जो मोमेंटम देख रहा हूँ, उसके आधार पर, आगे यह होता है।"

परिणाम

परीक्षण में, इस पद्धति ने प्रतिस्पर्धा को पीछे छोड़ दिया। जटिल दृश्यों (जैसे घूमता हुआ पंखा या कमरे में चलता हुआ व्यक्ति) के भविष्य की भविष्यवाणी करने के लिए पूछे जाने पर, यह पिछले तरीकों की तुलना में बहुत अधिक यथार्थवादी और दृश्य रूप से सटीक रहा। यह केवल यह अनुमान नहीं लगाता कि चीजें कहाँ जाती हैं; यह वास्तविकता की लय को समझता है।

संक्षेप में: ODE-GS AI को अतीत को केवल दोबारा चलाने वाले दर्शक से बदलकर एक ऐसे दूरदर्शी में बदल देता है जो भविष्य की कल्पना कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →