← أحدث الأبحاث
🤖 machine learning

Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning

تقدم الورقة البحثية FlexTI2V، وهي طريقة خالية من التدريب تتيح توليد فيديو مرن من النص والصورة عبر عكس الصور إلى ضوضاء كامنة واستخدام استراتيجية تبديل الرقع العشوائية الديناميكية لدمج شروط بصرية تعسفية في نماذج تحويل النص إلى فيديو الحالية دون الحاجة إلى ضبط دقيق.

المؤلفون الأصليون: Bolin Lai, Sangmin Lee, Xu Cao, Xiang Li, James M. Rehg

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bolin Lai, Sangmin Lee, Xu Cao, Xiang Li, James M. Rehg

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مخرج أفلام سحرياً يُدعى AI. هذا المخرج موهوب للغاية في صنع أفلام بناءً على أوصافك الصوتية (مثل "شخص يركب موجة"). ومع ذلك، لدى هذا المخرج قاعدة صارمة: لا يمكنه رؤية صورك. إذا كنت تريد أن يبدو الفيلم تماماً مثل صورة معينة تملكها، فعادة ما يتعين عليك استئجار فريق من المهندسين الباهظي التكلفة لإعادة تدريب عقل المخرج، وهو أمر يستغرق أسابيع ويكلف ثروة.

تقدم هذه الورقة البحثية FlexTI2V، وهي طريقة ذكية "لا تتطلب تدريباً" تسمح لك بإعطاء هذا المخرج الذكي صوراً محددة لاستخدامها كدليل، دون الحاجة إلى إعادة تدريبه أو إنفاق قرش واحد.

إليك كيف يعمل الأمر، مقسماً عبر تشبيهات بسيطة:

1. المشكلة: المخرج "الجامد"

قبل هذه الورقة، إذا كنت تريد صنع فيديو حيث يبدأ الشخص في وضعية واحدة (الصورة أ) وينتهي في وضعية أخرى (الصورة ب)، فقد كنت محدوداً.

  • الطريقة القديمة: كان بإمكانك فقط جعل الفيديو يبدأ عند البداية أو ينتهي عند النهاية. لم يكن بإمكانك القول: "ابدأ هنا، افعل هذا الفعل في المنتصف، وانتهِ هناك".
  • التكلفة: لتغيير القواعد، كان عليك "ضبط" (fine-tuning) الذكاء الاصطناعي، وهو ما يشبه استئجار مخرج جديد لكل نوع جديد من الفيديوهات التي تريد صنعها. كان ذلك بطيئاً، مكلفاً، وغير مرن.

2. الحل: FlexTI2V (الغراء السحري)

ابتكر المؤلفون طريقة تسمى FlexTI2V. فكر فيها كأنها قابس محول عالمي. يمكنك توصيل أي عدد من الصور في أي مكان في الجدول الزمني للفيديو، وسيقوم الذكاء الاصطناعي بدمجها معاً بشكل سحري.

  • التشبيه: تخيل أنك تصنع منحوتة من الطين. عادةً ما يصنع الذكاء الاصطناعي المنحوتة بأكملها من كتلة طين بناءً على صوتك. FlexTI2V تسمح لك بالضغط بأشكال طينية جاهزة (صورك) في أماكن محددة من المنحوتة بينما لا تزال قيد التشكيل، ويقوم الذكاء الاصطناعي بتنعيم الباقي حولها.

3. كيف يعمل: خدعة "تبديل الرقع" (Patch Swap)

السر يكمن في تقنية تسمى التبديل العشوائي للرقع (Random Patch Swapping). إليك السحر خطوة بخوة:

  • الخطوة 1: "الصور الشبحية": أولاً، تأخذ هذه الطريقة صورك وتحولها إلى "أشباح ضوضائية" (ضوضاء رياضية) تبدو مثل الصور ولكنها جاهزة للمزج في عملية صنع الفيديو.
  • الخطوة 2: التبديل: بينما يبدأ الذكاء الاصطناعي في رسم الفيديو إطاراً تلو الآخر، فإنه عادةً ما يخمن ما سيحدث بعد ذلك. FlexTI2V تقاطع هذه العملية. فهي تأخذ قطعة صغيرة ("رقعة") من تخمين الذكاء الاصطناعي الحالي وتستبدلها بقطعة من صورتك.
    • التشبيه: تخيل أن الذكاء الاصطناعي يرسم جدارية. كل بضع ثوانٍ، يتوقف، يأخذ مربعاً صغيراً من الطلاء من صورتك المرجعية، ويلصقه على لوحته. يفعل ذلك بشكل عشوائي، لذا فهو لا ينسخ الصورة فحسب؛ بل "يتعلم" الأسلوب والشكل منها.
  • الخطوة 3: التحكم الديناميكي: هذا هو الجزء الذكي.
    • إذا كان إطار الفيديو قريباً جداً من صورتك، فسيقوم الذكاء الاصطناعي بتبديل الكثير من الرقع لضمان أن يبدو تماماً مثل صورتك.
    • إذا كان إطار الفيديو بعيداً عن صورتك، فسيقوم الذكاء الاصطناعي بتبديل عدد أقل من الرقع. هذا يمنح الذكاء الاصطناعي "حرية إبداعية" لابتكار حركات وانتقالات جديدة حتى لا يبدو الفيديو متجمداً أو متصلباً.

4. ماذا يمكنه أن يفعل؟ ("السكين السويسري" للفيديو)

لأن هذه الطريقة مرنة للغاية، فهي توحد العديد من مهام الفيديو المختلفة في مهمة واحدة:

  • تحريك الصور (Image Animation): تحويل صورة ثابتة واحدة إلى فيديو متحرك.
  • الإرجاع للخلف (Rewinding): ابدأ بفيديو واجعله يعمل بالعكس للوصول إلى صورة محددة.
  • الاستكمال البيني (Interpolation): لديك صورة لعداء في البداية وصورة له عند خط النهاية. FlexTI2V تملأ الفراغ في المنتصف، لتخلق حركة الجري بينهما.
  • التوسيع الخارجي (Outpainting): لديك صورة في منتصف فيديو. FlexTI2V تولد ما يحدث قبل وبعدها.

5. لماذا يعد هذا أمراً هاماً؟

  • لا يتطلب تدريباً: لا تحتاج إلى كمبيوتر خارق أو أسابيع من الوقت. إنه يعمل فوراً على نماذج الذكاء الاصطناعي الموجودة.
  • مرن: يمكنك وضع صورة واحدة، أو 3 صور، أو 10 صور في أي مكان.
  • جودة عالية: تظهر التجارب أنه ينشئ فيديوهات أكثر سلاسة وواقعية من الطرق "المجانية" السابقة، والتي كانت غالباً ما تبدو ضبابية أو مليئة بالأخطاء التقنية.

ملخص

فكر في FlexTI2V كأنه جهاز تحكم عن بعد عالمي لتوليد الفيديو. بدلاً من الحاجة إلى جهاز تحكم مختلف (نموذج مدرب مختلف) لكل مهمة فيديو محددة، يتيح لك هذا الجهاز الواحد الإشارة إلى أي صورة، وقول "ضع هذه هنا"، وسيقوم الذكاء الاصطناعي فوراً بإنشاء فيلم سلس وعالي الجودة يحترم صورك مع اتباع تعليماتك النصية. إنه يجعل صناعة الفيديو متاحة ومرنة للجميع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →