← नवीनतम पेपर
🤖 AI

SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion

यह शोध पत्र SceneAdapt प्रस्तुत करता है, जो एक दो-चरणीय अनुकूलन ढांचा (two-stage adaptation framework) है जो मोशन इनबिट्वीनिंग (motion inbetweening) और नवीन आर्किटेक्चरल परतों (CaKey और SceneCo) का लाभ उठाता है ताकि बड़े पैमाने पर युग्मित टेक्स्ट-सीन-मोशन डेटासेट की आवश्यकता के बिना, टेक्स्ट से अर्थपूर्ण रूप से विविध और दृश्य-जागरूक मानव गति निर्माण को सक्षम बनाया जा सके।

मूल लेखक: Jungbin Cho, Minsu Kim, Jisoo Kim, Ce Zheng, Laszlo A. Jeni, Ming-Hsuan Yang, Youngjae Yu, Seonjoo Kim

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jungbin Cho, Minsu Kim, Jisoo Kim, Ce Zheng, Laszlo A. Jeni, Ming-Hsuan Yang, Youngjae Yu, Seonjoo Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक निर्देशक हैं जो एक फिल्म का दृश्य फिल्माने की कोशिश कर रहे हैं। आपके पास दो बहुत ही विशिष्ट, लेकिन परस्पर विरोधी समस्याएँ हैं:

  1. स्क्रिप्ट (The Script): आपको अभिनेता को आपके स्क्रिप्ट के आधार पर विविध और जटिल, भावनात्मक क्रियाएं करने की आवश्यकता है (जैसे, "बास्केटबॉल ड्रिबल करना," "टैंगो डांस करना," "घबराहट में भागना")।
  2. सेट (The Set): आप फर्नीचर से भरे एक वास्तविक कमरे में शूटिंग कर रहे हैं। अभिनेता दीवारों के आर-पार नहीं जा सकता, कॉफी टेबल से टकराकर गिर नहीं सकता, या सोफे के भीतर से नहीं गुजर सकता। उन्हें भौतिक स्थान का सम्मान करना चाहिए।

समस्या:
AI की दुनिया में, हमारे पास डेटा की दो अलग-अलग "लाइब्रेरी" हैं, जो आपस में बात नहीं करती हैं:

  • लाइब्रेरी A (द स्क्रिप्ट): इसमें टेक्स्ट विवरणों के साथ लाखों मानवीय गतिविधियाँ शामिल हैं। यहाँ का AI "डांस" या "भागना" समझने में बहुत अच्छा है, लेकिन इसे दीवारों का कोई ज्ञान नहीं है। यदि आप इसे भागने के लिए कहते हैं, तो यह दीवार के आर-पार भाग सकता है क्योंकि इसे नहीं पता कि दीवार मौजूद है।
  • लाइब्रेरी B (द सेट): इसमें वास्तविक कमरों में लोगों के घूमने के वीडियो हैं। यह AI जानता है कि कुर्सियों और मेजों से कैसे बचना है, लेकिन यह केवल "बैठना" या "आगे बढ़ना" जैसी कुछ बुनियादी क्रियाएं ही जानता है। यह "बास्केटबॉल ड्रिबल करने" जैसे जटिल स्क्रिप्ट को नहीं समझ सकता।

एक विशाल लाइब्रेरी बनाना जिसमें जटिल स्क्रिप्ट और वास्तविक कमरे दोनों हों, बेहद महंगा और कठिन है। यह दुनिया के हर संभव कमरे में हर संभव मूवी सीन फिल्माने जैसा है।

समाधान: सीनअडैप्ट (SceneAdapt)
इस शोध पत्र के लेखकों ने एक चतुर दो-चरणीय "ट्रेनिंग कैंप" बनाया है जिसे SceneAdapt कहा जाता है। एक नई लाइब्रेरी बनाने के बजाय, उन्होंने एक मौजूदा AI (लाइब्रेरी A से) को कमरे का सम्मान करना (लाइब्रेरी B से) सिखाया, और इसके लिए एक गुप्त पुल (bridge) का उपयोग किया।

यह प्रक्रिया इस प्रकार काम करती है, एक सरल उपमा का उपयोग करते हुए:

चरण 1: "खाली जगह भरने वाला" पुल (The "Fill-in-the-Blanks" Bridge)

सबसे पहले, वे लाइब्रेरी A वाले AI को एक नया खेल सिखाते हैं: मोशन इनबिटवीनिंग (Motion Inbetweening)

कल्पना कीजिए कि आपके पास एक कॉमिक बुक है। आपके पास क्रिया की शुरुआत में पात्र का चित्र और अंत में चित्र है, लेकिन बीच के पन्ने खाली हैं। AI का काम उन खाली फ्रेमों को भरना है ताकि गति सुचारू (smooth) हो सके।

  • यह क्यों किया जाता है? यह कार्य AI को बिना किसी टेक्स्ट विवरण के ज्यामिति (geometry) और प्रवाह (flow) को समझने में मदद करता है। यह सीखता है, "यदि मेरा हाथ यहाँ है और मेरा पैर वहाँ है, तो मेरा शरीर इस विशिष्ट पथ के माध्यम से जाना चाहिए।"
  • सीक्रेट सॉस (CaKey): उन्होंने AI में एक विशेष "हाइलाइटर" टूल (जिसे CaKey कहा जाता है) जोड़ा। यह टूल केवल शुरुआत और अंत के बिंदुओं (keyframes) को हाइलाइट करता है और बाकी चीज़ को AI पर छोड़ देता है। यह सुनिश्चित करता है कि AI अपनी मूल टेक्स्ट स्क्रिप्ट को समझने की क्षमता खोए बिना इस नई ज्यामितीय कुशलता को सीख सके।

चरण 2: "रूम अवेयरनेस" अपग्रेड (The "Room Awareness" Upgrade)

अब जब AI खाली जगहों को सुचारू रूप से भरने में सक्षम हो गया है, तो वे दूसरा चरण पेश करते हैं: सीन-अवेयर इनबिटवीनिंग (Scene-Aware Inbetweening)

अब, वे AI को कॉमिक बुक साथ ही कमरे का एक 3D मैप देते हैं। AI को फिर से खाली जगहों को भरना होता है, लेकिन इस बार उसे यह सुनिश्चित करना होगा कि पात्र मेज या दीवार से न टकराए।

  • सीक्रेट सॉस (SceneCo): उन्होंने AI में एक नया "स्पॉटलाइट" सिस्टम (जिसे SceneCo कहा जाता है) जोड़ा। कल्पना कीजिए कि कमरा छोटे-छोटे बल्बों का एक विशाल ग्रिड है। जैसे-जैसे पात्र चलता है, AI एक क्रॉस-अटेंशन मैकेनिज्म का उपयोग करके पूछता है, "हे, इस समय मेरे पैरों के ठीक सामने क्या है?" यह गतिशील रूप से कमरे के उस विशिष्ट हिस्से को देखता है जो उस क्षण के लिए प्रासंगिक है।
  • परिणाम: AI पात्र की गतिविधियों को बाधाओं के बीच से बुनना सीख जाता है, ठीक वैसे ही जैसे एक वास्तविक व्यक्ति करेगा।

अंतिम जादू का खेल (The Final Magic Trick)

एक बार प्रशिक्षण पूरा हो जाने के बाद, आप AI से कुछ भी पूछ सकते हैं: "एक व्यक्ति कुर्सी से बचते हुए बास्केटबॉल ड्रिबल कर रहा है।"

  • चरण 1 के कारण, AI ड्रिबल करना जानता है (टेक्स्ट लाइब्रेरी से)।
  • चरण 2 के कारण, AI कुर्सी से बचना जानता है (रूम लाइब्रेरी से)।
  • ब्रिज (Bridge) के कारण, यह बिना किसी बड़ी और महंगी डेटासेट के, इन दोनों को पूरी तरह से जोड़ देता है।

यह एक बड़ी बात क्यों है?

  • कोई "घोस्ट वॉकिंग" नहीं: इससे पहले, AI पात्र अक्सर दीवारों के आर-पार चलते थे क्योंकि उन्हें कमरे का ज्ञान नहीं था। अब, वे भौतिकी (physics) का सम्मान करते हैं।
  • कोई "रोबोटिक मूवमेंट" नहीं: पहले, कमरों का सम्मान करने वाला AI केवल चलने या बैठने जैसी सरल चीजें ही कर सकता था। अब, वे जटिल और अभिव्यंजक क्रियाएं कर सकते हैं।
  • दक्षता (Efficiency): उन्हें कमरों में अभिनेताओं के हजारों घंटों के वीडियो की आवश्यकता नहीं पड़ी। उन्होंने बस दो मौजूदा लाइब्रेरी का उपयोग किया और उनके बीच एक पुल बना दिया।

संक्षेप में: SceneAdapt एक ऐसे प्रतिभाशाली अभिनेता को लेने जैसा है जो स्क्रिप्ट की हर लाइन जानता है लेकिन उसने कभी सेट नहीं देखा, और एक स्टंट डबल को लेने जैसा है जो खतरनाक सेट पर नेविगेट करना जानता है लेकिन स्क्रिप्ट नहीं पढ़ सकता। उन्हें "खाली जगह भरने" का एक सरल खेल एक साथ सिखाकर, वे एक आदर्श टीम बन जाते हैं जो बिना किसी फर्नीचर से टकराए, किसी भी कमरे में कोई भी जटिल दृश्य प्रदर्शित कर सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →