Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning
تقدم الورقة البحثية FlexTI2V، وهي طريقة خالية من التدريب تتيح توليد فيديو مرن من النص والصورة عبر عكس الصور إلى ضوضاء كامنة واستخدام استراتيجية تبديل الرقع العشوائية الديناميكية لدمج شروط بصرية تعسفية في نماذج تحويل النص إلى فيديو الحالية دون الحاجة إلى ضبط دقيق.
المؤلفون الأصليون:Bolin Lai, Sangmin Lee, Xu Cao, Xiang Li, James M. Rehg
تخيل أن لديك مخرج أفلام سحرياً يُدعى AI. هذا المخرج موهوب للغاية في صنع أفلام بناءً على أوصافك الصوتية (مثل "شخص يركب موجة"). ومع ذلك، لدى هذا المخرج قاعدة صارمة: لا يمكنه رؤية صورك. إذا كنت تريد أن يبدو الفيلم تماماً مثل صورة معينة تملكها، فعادة ما يتعين عليك استئجار فريق من المهندسين الباهظي التكلفة لإعادة تدريب عقل المخرج، وهو أمر يستغرق أسابيع ويكلف ثروة.
تقدم هذه الورقة البحثية FlexTI2V، وهي طريقة ذكية "لا تتطلب تدريباً" تسمح لك بإعطاء هذا المخرج الذكي صوراً محددة لاستخدامها كدليل، دون الحاجة إلى إعادة تدريبه أو إنفاق قرش واحد.
إليك كيف يعمل الأمر، مقسماً عبر تشبيهات بسيطة:
1. المشكلة: المخرج "الجامد"
قبل هذه الورقة، إذا كنت تريد صنع فيديو حيث يبدأ الشخص في وضعية واحدة (الصورة أ) وينتهي في وضعية أخرى (الصورة ب)، فقد كنت محدوداً.
الطريقة القديمة: كان بإمكانك فقط جعل الفيديو يبدأ عند البداية أو ينتهي عند النهاية. لم يكن بإمكانك القول: "ابدأ هنا، افعل هذا الفعل في المنتصف، وانتهِ هناك".
التكلفة: لتغيير القواعد، كان عليك "ضبط" (fine-tuning) الذكاء الاصطناعي، وهو ما يشبه استئجار مخرج جديد لكل نوع جديد من الفيديوهات التي تريد صنعها. كان ذلك بطيئاً، مكلفاً، وغير مرن.
2. الحل: FlexTI2V (الغراء السحري)
ابتكر المؤلفون طريقة تسمى FlexTI2V. فكر فيها كأنها قابس محول عالمي. يمكنك توصيل أي عدد من الصور في أي مكان في الجدول الزمني للفيديو، وسيقوم الذكاء الاصطناعي بدمجها معاً بشكل سحري.
التشبيه: تخيل أنك تصنع منحوتة من الطين. عادةً ما يصنع الذكاء الاصطناعي المنحوتة بأكملها من كتلة طين بناءً على صوتك. FlexTI2V تسمح لك بالضغط بأشكال طينية جاهزة (صورك) في أماكن محددة من المنحوتة بينما لا تزال قيد التشكيل، ويقوم الذكاء الاصطناعي بتنعيم الباقي حولها.
3. كيف يعمل: خدعة "تبديل الرقع" (Patch Swap)
السر يكمن في تقنية تسمى التبديل العشوائي للرقع (Random Patch Swapping). إليك السحر خطوة بخوة:
الخطوة 1: "الصور الشبحية": أولاً، تأخذ هذه الطريقة صورك وتحولها إلى "أشباح ضوضائية" (ضوضاء رياضية) تبدو مثل الصور ولكنها جاهزة للمزج في عملية صنع الفيديو.
الخطوة 2: التبديل: بينما يبدأ الذكاء الاصطناعي في رسم الفيديو إطاراً تلو الآخر، فإنه عادةً ما يخمن ما سيحدث بعد ذلك. FlexTI2V تقاطع هذه العملية. فهي تأخذ قطعة صغيرة ("رقعة") من تخمين الذكاء الاصطناعي الحالي وتستبدلها بقطعة من صورتك.
التشبيه: تخيل أن الذكاء الاصطناعي يرسم جدارية. كل بضع ثوانٍ، يتوقف، يأخذ مربعاً صغيراً من الطلاء من صورتك المرجعية، ويلصقه على لوحته. يفعل ذلك بشكل عشوائي، لذا فهو لا ينسخ الصورة فحسب؛ بل "يتعلم" الأسلوب والشكل منها.
الخطوة 3: التحكم الديناميكي: هذا هو الجزء الذكي.
إذا كان إطار الفيديو قريباً جداً من صورتك، فسيقوم الذكاء الاصطناعي بتبديل الكثير من الرقع لضمان أن يبدو تماماً مثل صورتك.
إذا كان إطار الفيديو بعيداً عن صورتك، فسيقوم الذكاء الاصطناعي بتبديل عدد أقل من الرقع. هذا يمنح الذكاء الاصطناعي "حرية إبداعية" لابتكار حركات وانتقالات جديدة حتى لا يبدو الفيديو متجمداً أو متصلباً.
4. ماذا يمكنه أن يفعل؟ ("السكين السويسري" للفيديو)
لأن هذه الطريقة مرنة للغاية، فهي توحد العديد من مهام الفيديو المختلفة في مهمة واحدة:
تحريك الصور (Image Animation): تحويل صورة ثابتة واحدة إلى فيديو متحرك.
الإرجاع للخلف (Rewinding): ابدأ بفيديو واجعله يعمل بالعكس للوصول إلى صورة محددة.
الاستكمال البيني (Interpolation): لديك صورة لعداء في البداية وصورة له عند خط النهاية. FlexTI2V تملأ الفراغ في المنتصف، لتخلق حركة الجري بينهما.
التوسيع الخارجي (Outpainting): لديك صورة في منتصف فيديو. FlexTI2V تولد ما يحدث قبل وبعدها.
5. لماذا يعد هذا أمراً هاماً؟
لا يتطلب تدريباً: لا تحتاج إلى كمبيوتر خارق أو أسابيع من الوقت. إنه يعمل فوراً على نماذج الذكاء الاصطناعي الموجودة.
مرن: يمكنك وضع صورة واحدة، أو 3 صور، أو 10 صور في أي مكان.
جودة عالية: تظهر التجارب أنه ينشئ فيديوهات أكثر سلاسة وواقعية من الطرق "المجانية" السابقة، والتي كانت غالباً ما تبدو ضبابية أو مليئة بالأخطاء التقنية.
ملخص
فكر في FlexTI2V كأنه جهاز تحكم عن بعد عالمي لتوليد الفيديو. بدلاً من الحاجة إلى جهاز تحكم مختلف (نموذج مدرب مختلف) لكل مهمة فيديو محددة، يتيح لك هذا الجهاز الواحد الإشارة إلى أي صورة، وقول "ضع هذه هنا"، وسيقوم الذكاء الاصطناعي فوراً بإنشاء فيلم سلس وعالي الجودة يحترم صورك مع اتباع تعليماتك النصية. إنه يجعل صناعة الفيديو متاحة ومرنة للجميع.
إليك ملخص تقني مفصل لورقة البحث بعنوان "توليد موحد من النص والصورة إلى الفيديو: نهج خالٍ من التدريب للتحكم المرن في العناصر البصرية" (FlexTI2V).
1. تعريف المشكلة
تعالج الورقة البحثية القيود التي تواجه نماذج توليد النص-إلى-فيديو (T2V) و النص-الصورة-إلى-فيديو (TI2V) الحالية.
القيود الحالية: تعتمد طرق TI2V الحالية عادةً على ضبط دقيق (Fine-tuning) للنماذج التأسيسية باستخدام بيانات مقترنة من نصوص وصور وفيديوهات. هذا الأمر مكلف حاسوبياً، ويتطلب مجموعات بيانات ضخمة، ويحمل خطر إدخال تحيز في البيانات. علاوة على ذلك، فإن هذه النماذج جامدة؛ فهي تدعم فقط إعدادات التحكم المحددة مسبقاً (مثل تحريك الصور حيث تكون الصورة هي الإطار الأول، أو استكمال الإطارات حيث تكون الصور هي الإطارات الأول والأخير).
الهدف: يحدد المؤلفون مشكلة TI2V عامة حيث يجب على النموذج إنشاء فيديو بناءً على عدد عشوائي من الصور (N) موضوعة في مواقع عشوائية (p) داخل تسلسل الفيديو، بتوجيه من وصف نصي. وهذا يوحد مهام مثل تحريك الصور، وإعادة تشغيل الفيديو (Rewinding)، والتوسيع الخارجي (Outpainting)، واستكمال الإطارات (Frame Interpolation) في إطار عمل واحد.
2. المنهجية: FlexTI2V
الحل المقترح، FlexTI2V، هو نهج خالٍ من التدريب (Training-free) يقوم بتعديل عملية الاستدلال لنماذج انتشار (Diffusion Models) جاهزة للاستخدام (سواء كانت تعتمد على UNet أو Transformer) دون تحديث أوزان النموذج. وهو يعمل في الفضاء الكامن (Latent Space) لنموذج الانتشار.
يتكون الأسلوب من ثلاث مراحل أساسية:
أ. عكس صورة الشرط والتهيئة (Condition Image Inversion and Initialization)
العكس (Inversion): يتم ترميز صور الشرط المدخلة إلى تمثيلات كامنة ثم "عكسها" إلى تمثيلات مشوشة (x~t) عند كل خطوة إزالة تشويش t باستخدام عملية عكس تعتمد على DDPM.
تهيئة الضجيج (Noise Initialization): يتم تكرار التمثيل المشوش النهائي لصورة الشرط (x~T) وتكديسه على طول البعد الزمني ليكون بمثابة الضجيج الأولي (zT) لتوليد الفيديو. هذا يحافظ على الهيكل العام لصورة الشرط.
ب. استبدال الإطارات (Frame Replacement)
في خطوات زمنية محددة تقابل المواقع المرغوبة لصور الشرط (p)، يتم استبدال تمثيلات إطارات الفيديو في الفضاء الكامن مباشرة بتمثيلات صورة الشرط المعكوسة (x~t). يضمن ذلك ظهور صور الشرط بدقة في الإطارات المحددة.
هذا هو الابتكار الرئيسي في الورقة البحثية. لمنع فقدان الميزات البصرية لصور الشرط أثناء الانتشار الزمني لنموذج الانتشار، يقوم الأسلوب بحقن الإشارات البصرية صراحة في كل إطار فيديو.
الآلية: في كل خطوة إزالة تشويش، يتم تبديل جزء عشوائي من الرقع (العناصر المكانية) في تمثيل إطار الفيديو الحالي مع رقع من أقرب تمثيل لصورة الشرط.
التحكم الديناميكي: لموازنة الدقة (الالتزام بالصورة) و الإبداع (توليد حركة سلسة)، يتم ضبط نسبة التبديل (P) وعدد الخطوات (t) ديناميكياً بناءً على المسافة بين الإطار الحالي وصورة الشرط:
بالقرب من صورة الشرط: يتم استخدام نسبة تبديل عالية وخطوات أكثر لفرض محاذاة بصرية قوية.
بعيداً عن صورة الشرط: يتم تقليل التبديل أو إيقافه للسماح للنموذج بتوليد حركة وانتقالات إبداعية دون أن يكون "متجمداً" بسبب الميزات البصرية الثابتة للصورة.
الصياغة الرياضية: يتم التحكم في التبديل بواسطة قناع ثنائي (Binary Mask) يتم إنشاؤه بناءً على دالة اضمحلال (Decay function) بالنسبة لمؤشر الإطار وموقع صورة الشرط.
3. المساهمات الرئيسية
صياغة موحدة للمشكلة: تحدد الورقة رسمياً مهمة TI2V عامة تستوعب المهام المحددة الموجودة (التحريك، إعادة التشغيل، التوسيع الخارجي، استكمال الإطارات) في إطار عمل واحد مرن يدعم أي عدد N وأي موقع p.
المرونة الخالية من التدريب: يقدم FlexTI2V طريقة "وصل وشغل" (Plug-and-play) تعمل مع نماذج T2V سابقة التدريب دون الحاجة لضبط دقيق، مما يلغي الحاجة لإعادة التدريب المكلفة ومجموعات البيانات الضخمة.
تبديل الرقع العشوائي (RPS): استراتيجية مبتكرة لحقن الميزات البصرية المحلية في عملية إزالة التشويش، مما يوفق بفعالية بين مسارات إزالة التشويش المتباينة للنصوص والصور.
استراتيجية التحكم الديناميكي: آلية لتعديل قوة التحكم البصري بناءً على القرب من الإطار، مما يمنع "تجمد" الفيديو مع الحفاظ على دقة عالية.
4. النتائج التجريبية
قيم المؤلفون FlexTI2V على مجموعة بيانات UCF-101 ومجموعة بيانات اصطناعية، مقارنة بالنماذج القائمة على التدريب ذات الحالة الراهنة (مثل DynamiCrafter) والنماذج الخالية من التدريب (مثل TI2V-Zero و TRF).
الأداء الكمي:
مسافة الفيديوهات فريشيه (FVD): حقق FlexTI2V درجات FVD أقل بكثير (مما يشير إلى جودة فيديو أعلى) عبر جميع المهام (التحريك، إعادة التشغيل، التوسيع الخارجي، استكمال الإطارات). على سبيل المثال، في تحريك الصور، حسن FVD من 210.77 (DynamiCrafter) إلى 125.49.
مقاييس CLIP: تفوق على النماذج المرجعية في CLIP-T (المحاذاة بين النص والفيديو) و CLIP-I (التشابه بين الصورة والفيديو)، مما أظهر التزاماً أفضل بكل من المطالبات (Prompts) والشروط البصرية.
دراسة المستخدم: فضل المقيمون البشريون فيديوهات FlexTI2V على النماذج المرجعية في معظم الحالات من حيث المحاذاة مع المطالبات والصور.
الكفاءة:
يتميز FlexTI2V بكفاءة عالية، حيث يستغرق 2.71 ثانية فقط لتوليد فيديو مكون من 16 إطاراً على وحدة معالجة رسومات NVIDIA H100.
في المقابل، استغرقت الطرق ذات الترتيب الذاتي (Autoregressive) مثل TI2V-Zero نحو 275.14 ثانية بسبب التوليد المتسلسل للإطارات وخطوات إعادة أخذ العينات المتعددة.
التعميم: نجح الأسلوب في التعميم على بنيات مختلفة (ModelScopeT2V القائم على UNet و Wan2.1 القائم على Transformer) وعلى إعدادات تحكم متنوعة (من 1 إلى 3 صور في مواقع عشوائية).
5. الأهمية والأثر
ديمقراطية توليد الفيديو: من خلال إزالة الحاجة إلى الضبط الدقيق، يخفض FlexTI2V حاجز الدخول لتوليد الفيديو المخصص، مما يسمح للمستخدمين بتكييف النماذج التأسيسية القوية مع احتياجات التحكم البصري المحددة بأقل قدر من الموارد الحسابية.
المرونة: يحل مشكلة "الجمود" في النماذج الحالية، مما يتيح سيناريوهات معقدة مثل إدراج كائن في منتصف الفيديو أو إعادة تشغيل مشهد، وهي أمور كانت مستحيلة سابقاً دون إعادة التدريب.
أساس للأعمال المستقبلية: تسلط الورقة الضوء على أن الأساليب الخالية من التدريب يمكن أن تحقق أداءً متفوقاً على النماذج المتخصصة التي خضعت للضبط الدقيق من حيث التعميم والكفاءة، مما يشير إلى اتجاه جديد في أبحاث التحكم في توليد الفيديو.
القيود الملحوظة: لا يزال الأسلوب يعاني مع انتقالات زوايا الكاميرا المعقدة بين صور الشرط، ويرث التحيزات (مثل العلامات المائية) من النموذج التأسيسي الأساسي.