← नवीनतम पेपर
🤖 machine learning

MotionCFG: Boosting Motion Dynamics via Stochastic Concept Perturbation

यह शोधपत्र MotionCFG का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो स्पष्ट नकारात्मक प्रॉम्प्ट्स (negative prompts) को अप्रत्यक्ष हार्ड नेगेटिव एंकर्स (implicit hard negative anchors) बनाने के लिए स्टोकेस्टिक कॉन्सेप्ट परटर्बेशन (stochastic concept perturbation) से बदलकर टेक्स्ट-टू-वीडियो मोशन डायनेमिक्स को बढ़ाता है और जटिल अवधारणाओं को निर्देशित करता है, जिससे न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ सिमेंटिक बायस (semantic bias) से बचते हुए टेम्पोरल विवरणों को परिष्कृत किया जा सके।

मूल लेखक: Byungjun Kim, Soobin Um, Jong Chul Ye

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Byungjun Kim, Soobin Um, Jong Chul Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली, लेकिन थोड़े आलसी कलाकार से एक बिल्ली के बाड़ (fence) के ऊपर से कूदने का वीडियो बनाने के लिए कह रहे हैं।

आप कलाकार को यह प्रॉम्प्ट देते हैं: "एक बिल्ली बाड़ के ऊपर से कूद रही है।"

समस्या: "आलसी" कलाकार
वर्तमान AI वीडियो जनरेटरों (कलाकारों) की एक बुरी आदत है। क्योंकि उन्होंने बिल्लियों के बाड़ पर बैठे हुए या बस स्थिर खड़े होने की लाखों तस्वीरें देखी हैं, इसलिए वे अक्सर सबसे आसान और सुरक्षित विकल्प को चुन लेते हैं। भले ही आप कूदने के लिए कहें, AI अक्सर ऐसा वीडियो बनाता है जहाँ बिल्ली बस थोड़ी सी तैरती हुई (hover) लगती है या बाड़ हिलती है, लेकिन बिल्ली शायद ही कोई हलचल करती है। यह ऐसा है जैसे कलाकार गलती करने से डर रहा हो, इसलिए वह सुरक्षित खेलता है और आपको एक "स्थिर" (static) इमेज दे देता है जो वीडियो जैसी दिखती है।

इसे ठीक करने के लिए, लोग आमतौर पर AI को यह बताने की कोशिश करते हैं कि उसे क्या नहीं करना है। वे एक "नेगेटिव प्रॉम्प्ट" जोड़ते हैं जैसे: "कोई स्थिर चित्र नहीं, कोई धुंधली गति नहीं।"
लेकिन यह एक शेफ को यह कहने जैसा है कि, "सूप नमकीन मत बनाना, उसे ठंडा मत बनाना, उसे पानी जैसा पतला मत बनाना।" शेफ भ्रमित हो जाता है। "स्थिरता" से बचने की कोशिश में, वह अनजाने में बिल्ली के आकार को बिगाड़ सकता है, जिससे वह एक पिघले हुए ढेर (blob) जैसी दिखने लगती है। शोध पत्र इसे "कंटेंट-मोशन ड्रिफ्ट" (Content-Motion Drift) कहता है: गति को ठीक करने की कोशिश में, आप अनजाने में वस्तु को ही बिगाड़ देते हैं।

समाधान: MotionCFG (द "नॉइज़" ट्रिक)
इस पेपर के लेखकों ने एक चतुर, ट्रेनिंग-मुक्त (training-free) तरीका निकाला है। शब्दों के माध्यम से AI को यह बताने के बजाय कि उसे क्या नहीं करना है, वे सीधे AI के मस्तिष्क में थोड़ा सा नियंत्रित अराजक (controlled chaos/noise) पेश करते हैं।

यहाँ इसकी उपमा (analogy) दी गई है:

  1. मुख्य शब्द की पहचान करें: AI आपके प्रॉम्प्ट को पढ़ता है और एक स्मार्ट असिस्टेंट (LLM) का उपयोग करके "एक्शन वर्ड्स" (क्रिया वाले शब्द) को पहचानता है। "A cat jumping" में, यह "jumping" को पहचानता है।
  2. "धुंधला" संस्करण: AI "jumping" शब्द का एक दूसरा, गुप्त संस्करण बनाता है। लेकिन इस बार, यह उसमें थोड़ा सा स्टैटिक नॉइज़ (static noise) जोड़ देता है, जैसे रेडियो का वॉल्यूम तब तक बढ़ाना जब तक कि वह फजी (fuzzy) न हो जाए। यह धुंधला संस्करण एक "खराब कूद" या "भ्रमित कूद" का प्रतिनिधित्व करता है।
  3. तुलना (The Contrast): अब, AI के पास निर्देश के दो संस्करण हैं:
    • संस्करण A (साफ): "Jumping" (स्पष्ट, तीक्ष्ण)।
    • संस्करण B (नॉइज़ी): "Jum...ping?" (धुंधला, खराब)।
  4. दबाव (The Push): AI को निर्देश दिया जाता है: *"वीडियो को संस्करण A जैसा दिखाओ, लेकिन इसे संस्करण B से दूर धकेलो (push away)।"*

चूंकि संस्करण B एक "खराब, आलसी या भ्रमित" कूद का प्रतिनिधित्व करता है, इसलिए इससे दूर धकेलने से AI को एक कूद का सबसे अधिक गतिशील और ऊर्जावान संस्करण खोजने के लिए मजबूर किया जाता है। यह एक धावक को यह कहने जैसा है, "थके हुए व्यक्ति की तरह मत चलो (नॉइज़ी संस्करण); दौड़ो जैसे तुम किसी रेस में हो!"

"पीसवाइज" शेड्यूल (समय का महत्व)
लेखकों ने यह भी गौर किया कि यदि आप इस "धकेलने" वाले बल को पूरे समय चालू रखते हैं, तो वीडियो गड़बड़ हो जाता है।

  • शुरुआती चरण: आपको यह तय करने के लिए एक मजबूत बल की आवश्यकता होती है कि बिल्ली कैसे चलती है (trajectory)।
  • अंतिम चरण: आप बस बिल्ली के फर और बाड़ को स्पष्ट रूप से पेंट करना चाहते हैं। यदि आप यहाँ बहुत ज़ोर से धक्का देते रहते हैं, तो बिल्ली कुत्ते में बदलने लग सकती है।

इसलिए, वे एक पीसवाइज शेड्यूल (Piecewise Schedule) का उपयोग करते हैं: वे "नॉइज़ पुश" को वीडियो बनाने के केवल पहले 10-20% के दौरान लागू करते हैं (गति निर्धारित करने के लिए), और फिर वे इसे बंद कर देते हैं ताकि AI विवरणों को साफ सुथरे ढंग से पूरा कर सके।

यह क्यों शानदार है?

  1. कोई ट्रेनिंग की आवश्यकता नहीं: आपको AI को फिर से यह सिखाने की ज़रूरत नहीं है कि कैसे हिलना है। आप बस वीडियो जेनरेट करते समय गणित (math) में बदलाव करते हैं।
  2. बिल्ली को सुरक्षित रखता है: "नेगेटिव प्रॉम्प्ट" पद्धति के विपरीत, यह बिल्ली को पिघलने नहीं देता। यह बिल्ली को बिल्ली जैसा ही रखता है, बस अधिक सक्रिय बनाता है।
  3. यह अन्य चीजों पर भी काम करता है: लेखकों ने दिखाया कि यह ट्रिक गिनती जैसी कठिन चीजों पर भी काम करती है। यदि आप "तीन घोड़े" मांगते हैं, तो AI अक्सर चार या पांच दिखा देता है। "तीन" शब्द में शोर (noise) जोड़ने से, AI को "गलत नंबरों" से दूर धकेलने के लिए मजबूर किया जाता है और वह ठीक तीन पर टिका रहता है।

सारांश में
MotionCFG एक ऐसे चुंबकीय प्रतिकर्षण क्षेत्र (magnetic repulsion field) की तरह है जो "बोरिंग, आलसी या गलत" विचारों के चारों ओर बनाया गया है। आपके द्वारा चाही गई क्रिया का एक धुंधला, खराब संस्करण बनाकर, और AI को उस धुंधले संस्करण से जितना संभव हो सके दूर रहने के लिए कहकर, आप इसे एक ऐसा वीडियो बनाने के लिए मजबूर करते हैं जो अधिक स्पष्ट, तेज़ और गतिशील हो, बिना तस्वीर को खराब किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →