← नवीनतम पेपर
💻 computer science

ActionPlan: Future-Aware Streaming Motion Synthesis via Frame-Level Action Planning

ActionPlan एक एकीकृत मोशन डिफ्यूजन फ्रेमवर्क पेश करता है जो उच्च-गुणवत्ता वाले ऑफलाइन जनरेशन, रियल-टाइम फ्यूचर-अवेयर स्ट्रीमिंग और ज़ीरो-शॉट मोशन एडिटिंग को एक ही मॉडल के भीतर एक साथ प्राप्त करने के लिए प्रति-फ्रेम एक्शन प्लान और लेटेंट-विशिष्ट डिफ्यूजन स्टेप्स का उपयोग करता है।

मूल लेखक: Eric Nazarenus, Chuqiao Li, Yannan He, Xianghui Xie, Jan Eric Lenssen, Gerard Pons-Moll

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eric Nazarenus, Chuqiao Li, Yannan He, Xianghui Xie, Jan Eric Lenssen, Gerard Pons-Moll

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म निर्देशित कर रहे हैं, लेकिन कलाकारों को काम पर रखने के बजाय, आप एक रोबोट से आपके द्वारा लिखे गए स्क्रिप्ट के आधार पर एक जटिल नृत्य की दिनचर्या (dance routine) करने के लिए कह रहे हैं।

समस्या:
अधिकांश वर्तमान AI मोशन जनरेटर दो अलग-अलग प्रकार के निर्देशकों की तरह हैं:

  1. "परफेक्ट प्लानर" (ऑफलाइन): यह निर्देशक फिल्म शुरू होने से पहले पूरी स्क्रिप्ट को शुरू से अंत तक पढ़ लेता है। उसे पता होता है कि कब अभिनेता को कूदना चाहिए, घूमना चाहिए और गिरना चाहिए। परिणाम एक परफेक्ट फिल्म होती है। लेकिन, वे तब तक फिल्मिंग शुरू नहीं कर सकते जब तक पूरी स्क्रिप्ट लिखी न जाए। यदि आप फिल्मिंग के दौरान स्क्रिप्ट बदलना चाहते हैं, तो वे जम (freeze) जाते हैं।
  2. "स्ट्रीम-ऑफ-कॉन्शियसनेस" एक्टर (स्ट्रीमिंग): यह कलाकार आपके पहले शब्द बोलते ही प्रदर्शन करना शुरू कर देता है। वे तेज़ हैं और लाइव वीडियो गेम के लिए बेहतरीन हैं। लेकिन क्योंकि उन्हें नहीं पता कि आगे क्या होने वाला है, वे अक्सर गड़बड़ी कर देते हैं। यदि आप कहते हैं, "आगे चलो, फिर एक कार्टव्हील करो, फिर बैठ जाओ," तो वे शायद आगे चल देंगे, कार्टव्हील करना भूल जाएंगे, और बस बैठ जाएंगे क्योंकि उन्होंने "भविष्य" को नहीं देखा था।

समाधान: ActionPlan
यह पेपर ActionPlan पेश करता है, जो एक नया AI सिस्टम है जो एक सुपर-स्मार्ट स्टेज मैनेजर की तरह दोनों काम पूरी तरह से कर सकता है।

यह कैसे काम करता है, यहाँ एक सरल उपमा (analogy) दी गई है:

1. "चीट शीट" (द एक्शन प्लान)

सिर्फ बड़े स्क्रिप्ट ("चलो, मुड़ो, बैठो") को पढ़ने के बजाय, ActionPlan पहले स्क्रिप्ट को फ्रेम-दर-फ्रेम चीट शीट में तोड़ देता है।

  • पुराना तरीका: "चलो, मुड़ो, बैठो।"
  • ActionPlan का तरीका: "फ्रेम 1: चलो। फ्रेम 2: चलो। फ्रेम 3: चलो। फ्रेम 4: मुड़ो। फ्रेम 5: मुड़ो। फ्रेम 6: बैठो।"

यह वास्तविक गति शुरू होने से पहले एक विस्तृत, सेकंड-दर-सेकंड का रोडमैप तैयार करता है। यह "फ्यूचर-अवेयर" (भविष्य को जानने वाला) हिस्सा है। रोबोट को ठीक पता होता है कि चलते समय भी आगे क्या होने वाला है।

2. "टू-ट्रैक" निर्माण

एक घर बनाने के बारे में सोचें।

  • ट्रैक A (ब्लूप्रिंट): AI पहले ब्लूप्रिंट (एक्शन प्लान) बनाता है। यह तय करता है कि हर क्षण में क्या होना चाहिए।
  • ट्रैक B (निर्माण): एक बार ब्लूप्रिंट तैयार हो जाने के बाद, AI घर बनाना (वास्तविक मोशन) शुरू करता है।

क्योंकि ब्लूप्रिंट पहले से मौजूद है, इसलिए निर्माण टीम (मोशन जनरेटर) को अनुमान लगाने की आवश्यकता नहीं होती। वे बस योजना का पालन करते हैं। इसका मतलब है कि वे घर बनाते समय भी निर्माण कर सकते हैं, भले ही आप उन्हें अभी भी नए निर्देश दे रहे हों, बिना मूल डिज़ाइन से पटरी से उतरे।

3. जादुई ट्रिक: "फ्लेक्सिबल टाइम"

आमतौर पर, AI मॉडल कठोर होते हैं। या तो वे एक साथ पूरे वीडियो पर काम करते हैं (धीमे) या एक-एक सेकंड करके (तेज़ लेकिन मूर्ख)।

ActionPlan "हेटरोजीनियस नॉइज़ शेड्यूलिंग" (Heterogeneous Noise Scheduling) नामक एक चतुर ट्रिक का उपयोग करता है।

  • कल्पना कीजिए कि आप एक भित्ति चित्र (mural) पेंट कर रहे हैं।
  • एक्शन प्लान एक स्केच की तरह है। AI बहुत तेज़ी से अपना स्केच पूरा कर लेता है।
  • मोशन पेंटिंग है। AI पहले कुछ सेकंड पेंट करता है, फिर तुरंत अगले कुछ सेकंड पेंट करना शुरू कर देता है, जबकि वह अभी भी पहले कुछ सेकंड को और बेहतर बना रहा होता है।
  • यह पेंटरों की एक टीम की तरह है जहाँ कुछ बैकग्राउंड पर काम कर रहे हैं, कुछ फोरग्राउंड पर, और कुछ बस किनारों को फिनिशिंग दे रहे हैं, और वे सभी एक ही समय में काम कर रहे हैं। यह इसे अविश्वसनीय रूप से तेज़ (पिछले तरीकों की तुलना में 5 गुना तेज़) बनाता है लेकिन गुणवत्ता को उच्च बनाए रखता है।

यह एक बड़ी बात क्यों है?

  • कोई "ड्रिफ्टिंग" नहीं: यदि आप रोबोट को कहते हैं "चलो, कूदो और गेंद पकड़ो," तो पुराने स्ट्रीमिंग रोबोट शायद चलेंगे, कूदेंगे, और फिर गेंद पकड़ना भूल जाएंगे क्योंकि वे कहानी से भटक गए। ActionPlan "गेंद पकड़ने" वाले हिस्से को याद रखता है क्योंकि उसने पहले ही इसे चीट शीट पर लिख लिया था।
  • लाइव एडिटिंग: क्योंकि AI "चीट शीट" को समझता है, आप स्ट्रीम के दौरान ही कह सकते हैं, "वास्तव में, कूदने के बजाय, एक कार्टव्हील करो," और यह पूरे वीडियो को फिर से शुरू किए बिना, भविष्य के फ्रेमों को मेल खाने के लिए तुरंत समायोजित कर सकता है।
  • खाली जगह भरना: आप इसे एक शुरुआती मुद्रा (start pose) और एक अंतिम मुद्रा (end pose) दे सकते हैं, और यह बीच के हिस्से को पूरी तरह से भर देगा, जैसे कि एक जादुई पुल निर्माता।

सारांश में

ActionPlan एक ऐसे रोबोट की तरह है जिसके पास एक क्रिस्टल बॉल है। एक भी कदम उठाने से पहले, उसने गति के पूरे भविष्य को "देख" लिया है। यह इसे एक लाइव वीडियो गेम चरित्र की तरह तेज़ होने की अनुमति देता है लेकिन एक हॉलीवुड फिल्म निर्देशक की तरह सटीक और योजनाबद्ध नियोजन के साथ। यह AI को एक रोडमैप प्रदान करके "तेज़ बनाम अच्छा" की पुरानी समस्या को हल करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →