← नवीनतम पेपर
💬 NLP

TTOM: Test-Time Optimization and Memorization for Compositional Video Generation

TTOM एक प्रशिक्षण-मुक्त ढांचा है जो लेआउट-अटेंशन उद्देश्यों द्वारा निर्देशित नए मापदंडों को अनुकूलित करके और स्ट्रीमिंग इन्फरेंस के लिए एक पैरामीट्रिक मेमोरी तंत्र का उपयोग करके कंपोजिशनल वीडियो जनरेशन को बढ़ाता है, जिससे प्रत्यक्ष लेटेंट हस्तक्षेप के बिना बेहतर टेक्स्ट-इमेज संरेखण और सामान्यीकरण प्राप्त होता है।

मूल लेखक: Leigang Qu, Ziyang Wang, Na Zheng, Wenjie Wang, Liqiang Nie, Tat-Seng Chua

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leigang Qu, Ziyang Wang, Na Zheng, Wenjie Wang, Liqiang Nie, Tat-Seng Chua

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अविश्वसनीय रूप से प्रतिभाशाली लेकिन थोड़ा अनाड़ी वीडियो निर्देशक है। यह निर्देशक (AI मॉडल) सुंदर दृश्य बनाने में माहिर है, लेकिन यदि आप उनसे कुछ विशिष्ट करने के लिए कहते हैं जैसे कि "एक रोबोट और एक जादूगर को एक-दूसरे के करीब चुपके से आते हुए दिखाओ जबकि चार पांडा बांस खा रहे हों," तो वे अक्सर भ्रमित हो जाते हैं। वे शायद रोबोट को पीछे की ओर चलते हुए दिखा देंगे, पांडा को भूल जाएंगे, या जादूगर को गलत दिशा में तैरते हुए दिखा देंगे। वे कंपोजिशन (composition) में संघर्ष करते हैं—यानी कई विशिष्ट चीजों को एक विशिष्ट तरीके से एक साथ रखने में।

यह पेपर इस समस्या को ठीक करने के लिए एक नई विधि पेश करता है जिसे TTOM (टेस्ट-टाइम ऑप्टिमाइज़ेशन एंड मेमोराइजेशन) कहा जाता है। TTOM को एक स्मार्ट सहायक और पिछले सफलताओं के व्यक्तिगत पुस्तकालय के रूप में समझें।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "वन-ऑफ" (One-Off) का संघर्ष

आमतौर पर, जब आप AI से कोई वीडियो बनाने के लिए कहते हैं, तो वह हर अनुरोध को एक बिल्कुल नए, अलग घटना के रूप में मानता है। उसे याद नहीं रहता कि उसने पाँच मिनट पहले "रोबोट बाईं ओर चल रहा है" का वीडियो बनाया था। उसे हर बार शून्य से "रोबोट बाईं ओर चल रहा है" के भौतिक विज्ञान और तर्क को समझना पड़ता है। इससे जटिल दृश्यों में गलतियाँ होती हैं।

2. समाधान: TTOM की दो महाशक्तियाँ

महाशक्ति A: "रिहर्सल" (टेस्ट-टाइम ऑप्टिमाइज़ेशन)

वीडियो बनाने के लिए आँख बंद करके काम करने के बजाय, TTOM अंतिम कट से पहले रुक जाता है।

  • उपमा: कल्पना कीजिए कि निर्देशक को स्क्रिप्ट मिलती है ("रोबोट और जादूगर चुपके से आते हैं...")। फिल्मांकन से पहले, वे एक त्वरित रिहर्सल करते हैं।
  • यह कैसे काम करता है: AI एक स्मार्ट सहायक (एक लार्ज लैंग्वेज मॉडल) का उपयोग करके एक रफ मैप बनाता है कि सब कुछ कहाँ होना चाहिए (एक "लेआउट")। फिर, यह वीडियो जनरेशन प्रक्रिया को थोड़ा बदलता है ताकि यह सुनिश्चित हो सके कि रोबोट वास्तव में बाईं ओर चले और जादूगर दाईं ओर चले, जो उस मैप से मेल खाता हो।
  • परिणाम: वीडियो बहुत अधिक सटीकता के साथ जेनरेट होता है क्योंकि AI ने इस विशिष्ट अनुरोध के लिए विशेष रूप से गतिविधियों का "रिहर्सल" किया है।

महाशक्ति B: "व्यक्तिगत पुस्तकालय" (पैरामेट्रिक मेमोराइजेशन)

यही असली गेम-चेंजर है। रिहर्सल खत्म होने और वीडियो परफेक्ट होने के बाद, TTOM "रिहर्सल नोट्स" को फेंक नहीं देता है।

  • उपमा: कल्पना कीजिए कि निर्देशक "चीट शीट्स" (cheat sheets) का एक पुस्तकालय रखता है। यदि अगला प्रॉम्प्ट है "एक बिल्ली बाईं ओर चलती है," तो निर्देशक शून्य से शुरुआत नहीं करता। वे पुस्तकालय में देखते हैं, "बिल्ली बाईं ओर चल रही है" वाली चीट शीट ढूंढते हैं, और उसे एक शुरुआती बिंदु के रूप में उपयोग करते हैं।
  • यह कैसे काम करता है:
    • इन्सर्ट (Insert): यदि AI एक नई समस्या हल करता है (जैसे, "एक नीला पक्षी ऊपर उड़ रहा है"), तो वह समाधान (वे विशिष्ट सेटिंग्स जिन्हें उसने बदला था) अपने मेमोरी लाइब्रेरी में सहेज लेता है।
    • रीड (Read): यदि कोई नया प्रॉम्प्ट आता है जो समान है (जैसे, "एक लाल पक्षी ऊपर उड़ रहा है"), तो AI उस "नीले पक्षी" वाली सेटिंग्स को उठाता है, उसे लोड करता है, और उसे एक हेड स्टार्ट के रूप में उपयोग करता है।
    • अपडेट (Update): यदि नया पक्षी थोड़ा अलग तरह से उड़ता है, तो AI चीट शीट में सुधार करता है और बेहतर संस्करण को वापस लाइब्रेरी में सहेज देता है।
    • डिलीट (Delete): यदि लाइब्रेरी बहुत भर जाती है, तो वह नए के लिए जगह बनाने के लिए पुरानी या कम उपयोग की जाने वाली चीट शीट्स को हटा देता है।

3. यह क्यों एक बड़ी बात है

  • यह काम करते-करते सीखता है: अन्य तरीकों के विपरीत, जो वीडियो बनने के बाद सब कुछ भूल जाते हैं, TTOM हर वीडियो के साथ स्मार्ट होता जाता है। यह वस्तुओं के हिलने और आपस में जुड़ने का "विश्व ज्ञान" (world knowledge) विकसित करता है।
  • यह तेज़ है: क्योंकि यह हर बार पूर्ण रिहर्सल करने के बजाय अपनी लाइब्रेरी से चीट शीट को बस "पढ़" सकता है, इसलिए यह समान अनुरोधों के लिए बहुत कुशल हो जाता है।
  • यह "अनाड़ीपन" को ठीक करता है: पेपर दिखाता है कि यह विधि संख्याओं को संभालने (पांडा की गिनती), स्थानिक संबंधों (कौन किसके बाईं ओर है) और जटिल गतियों को संभालने की AI की क्षमता में भारी सुधार करती है।

सारांश

TTome को एक ऐसे वीडियो जनरेटर के रूप में देखें जो एक ऐसे जीनियस से जो सब कुछ भूल जाता है, बदलकर एक अनुभवी पेशेवर बन जाता है जिसके पास एक विशाल अनुभव लॉग है।

  1. प्लान (Plan): यह एक मैप बनाता है कि क्या होना चाहिए।
  2. रिहर्सल (Rehearse): यह मैप से मेल खाने के लिए वीडियो को ट्यून करता है।
  3. याद रखना (Remember): यह "परफेक्ट ट्यून" को एक लाइब्रेरी में सहेजता है।
  4. पुन: उपयोग (Reuse): अगली बार, यह नए वीडियो को और भी बेहतर और तेज़ बनाने के लिए उस ट्यून को लाइब्रेरी से निकालता है।

परिणाम? वीडियो वास्तव में आपके निर्देशों का पालन करते हैं, भले ही वे निर्देश जटिल हों और उनमें कई चलती-फिरती चीजें शामिल हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →