← नवीनतम पेपर
💻 computer science

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

FlowLong एक प्रशिक्षण-मुक्त (training-free), आर्किटेक्चर-अज्ञेय (architecture-agnostic) इन्फरेंस-टाइम विधि है जो टेम्पोरल कंसिस्टेंसी और विजुअल फिडेलिटी सुनिश्चित करने के लिए मैनिफोल्ड-कंस्ट्रेंड ट्वीडी मैचिंग (manifold-constrained Tweedie matching) और स्टोकेस्टिक अर्ली-फेज सैंपलिंग (stochastic early-phase sampling) के माध्यम से ओवरलैपिंग स्लाइडिंग विंडोज़ को ब्लेंड करके लंबे वीडियो जेनरेट करती है, जिसमें अतिरिक्त मॉडल ट्रेनिंग की आवश्यकता नहीं होती है।

मूल लेखक: Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार है जो सुंदर, हाई-डेफिनिशन दृश्य बना सकता है, लेकिन उसका एक सख्त नियम है: वह एक बार में केवल एक पोस्टकार्ड के आकार के कैनवास पर ही काम कर सकता है। यदि आप उससे पूरी फिल्म बनाने के लिए कहते हैं, तो वह थक जाता है, उसकी शैली बदल जाती है, या उसके पात्र बार-बार एक ही तरह की हरकतें करने लगते हैं।

यही वर्तमान AI वीडियो जनरेटरों के साथ समस्या है। वे छोटे क्लिप (जैसे कि एक पोस्टकार्ड) बनाने में बेहतरीन हैं, लेकिन जब आप उनसे एक लंबी फिल्म बनाने के लिए कहते हैं, तो गुणवत्ता बिगड़ जाती है, कहानी भटक जाती है, या गति रोबोटिक और दोहराव वाली हो जाती है।

FlowLong एक नया "निर्देशक" है जो इन कलाकारों को बिना उन्हें फिर से प्रशिक्षित किए या उनकी शैली बदले लंबी फिल्में बनाने में मदद करता है। यह दो चतुर तरीकों का उपयोग करता है: द ओवरलैप ब्लेंड (The Overlap Blend) और द फ्रेश स्टार्ट (The Fresh Start)

1. द ओवरलैप ब्लेंड (Tweedie Matching)

कल्पना कीजिए कि आप एक लंबा भित्ति चित्र (mural) बनाना चाहते हैं, लेकिन आपका कलाकार एक बार में केवल 10 फीट का हिस्सा ही पेंट कर सकता है।

  • पुराना तरीका: आप कलाकार को पहला 10 फीट पेंट करने के लिए कहते हैं, फिर कैनवास बदलते हैं और अगला 10 फीट पेंट करते हैं। समस्या क्या है? पहले भाग का अंत दूसरे भाग की शुरुआत से थोड़ा अलग दिख सकता है। रंग बदल सकते हैं, या पात्र का हाथ अलग स्थिति में हो सकता है।
  • FlowLong का तरीका: आप कलाकार को पहला 10 फीट पेंट करने के लिए कहते हैं, लेकिन साथ ही उसे अगला 10 फीट भी पेंट करने के लिए कहते हैं, यह सुनिश्चित करते हुए कि पहले भाग के अंतिम 2 फीट और दूसरे भाग के पहले 2 फीट आपस में ओवरलैप (एक दूसरे के ऊपर) हों।
  • जादू: FlowLong दोनों ओवरलैपिंग सेक्शनों में से सबसे "साफ" संस्करण वाले चित्र को लेता है और उन्हें एक मूवी के 'सीमलेस क्रॉस-फेड' की तरह पूरी तरह से मिला देता है। यह सुनिश्चित करता है कि दोनों सेक्शनों के बीच का संक्रमण (transition) सुचारू और सुसंगत हो। यह दो अलग-अलग पेंटिंग्स को इस बात पर सहमत होने के लिए मजबूर करता है कि साझा हिस्सा कैसा दिखना चाहिए।

2. द फ्रेश स्टार्ट (Stochastic Early-Phase Sampling)

यहाँ पेचीदा हिस्सा है: भले ही आप ओवरलैप को पूरी तरह से मिला लें, लेकिन कलाकार अभी भी एक ही ढर्रे में फंस सकता है। यदि वह दूसरे सेक्शन की शुरुआत एक थोड़े अलग विचार के साथ करता है, तो उसका दिमाग वापस अपने मूल, अलग रास्ते पर जा सकता है, जिससे फिल्म बाद में असंबद्ध लग सकती है।

  • समस्या: इसे ऐसे सोचें जैसे दो यात्री अलग-अलग रास्तों पर चलना शुरू करते हैं। भले ही वे एक पुल (ओवरलैप) पर मिल जाएं, वे तुरंत अपने पुराने अलग रास्तों पर वापस जा सकते हैं क्योंकि उनमें "जड़ता" (inertia) होती है।
  • FlowLong का समाधान: प्रक्रिया की शुरुआत में ही (जब छवि अभी केवल शोर/नॉइज़ का एक धुंधला बादल होती है), FlowLong कलाकार को एक हल्की सी "झटका" (shake) देता है। यह मिश्रण में थोड़ा सा नया रैंडमनेस (शोर) डाल देता है।
  • परिणाम: यह झटका यात्रियों की पुरानी आदतों को तोड़ देता है। यह दो अलग-अलग सेक्शनों को तब तक आपस में घुलने-मिलने के लिए मजबूर करता है जब तक कि वे धुंधले हों। एक बार जब वे सामान्य दिशा पर सहमत हो जाते हैं, तो FlowLong उन्हें हिलाना बंद कर देता है और उन्हें सुचारू रूप से (deterministically) फिनिश लाइन तक जाने देता है। यह सुनिश्चित करता है कि पूरी फिल्म एक ही ट्रैक पर रहे और अपनी तेज, उच्च-गुणवत्ता वाली बारीकियों को न खोए।

यह क्यों महत्वपूर्ण है

  • पुनः प्रशिक्षण की आवश्यकता नहीं: आपको कलाकार को नए करतब सिखाने की जरूरत नहीं है। आपको बस उन्हें अपना काम व्यवस्थित करने के लिए निर्देशों का एक नया सेट देना है। यह किसी भी वीडियो AI मॉडल के साथ सीधे काम करता है।
  • बहुमुखी (Versatile): यह केवल वीडियो के लिए ही नहीं है। पेपर दिखाता है कि यह यह भी कर सकता है:
    • वीडियो और ऑडियो को एक साथ उत्पन्न करना (जैसे कि साउंडट्रैक के साथ एक फिल्म)।
    • टेक्स्ट को 3D दुनिया में बदलना (एक विवरण से 3D दृश्य बनाना)।
  • बेहतर गुणवत्ता: अन्य तरीकों के विपरीत जो वीडियो को लंबा तो बनाते हैं लेकिन वे दोहराव वाले लूप या भटकने वाली त्रुटियों से भरे होते हैं, FlowLong लंबे वीडियो बनाता है जो सुसंगत, विविध और उच्च-गुणवत्ता वाले रहते हैं।

संक्षेप में

FlowLong AI कलाकारों के लिए एक स्मार्ट प्रोडक्शन मैनेजर की तरह है। उन्हें अकेले लंबी फिल्म बनाने के संघर्ष में छोड़ने के बजाय, यह काम को ओवरलैपिंग हिस्सों में तोड़ देता है, किनारों को पूरी तरह से मिला देता है, और शुरुआत में उन्हें एक हल्का सा धक्का देता है ताकि वे सुनिश्चित कर सकें कि वे सभी एक ही पृष्ठ पर हैं। परिणाम एक लंबी, सुसंगत और उच्च-गुणवत्ता वाली वीडियो है जिसे मूल AI को फिर से प्रशिक्षित किए बिना बनाया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →