← أحدث الأبحاث
💻 computer science

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

يقدم Pusa V1.0 طريقة غير تدميرية للتكيف مع الخطوات الزمنية المتجهة (VTA) تتيح تحكماً زمنياً دقيقاً وصفرياً (zero-shot)—بما في ذلك تحويل الصور إلى فيديو، وتكييف إطارات البداية والنهاية، وتمديد الفيديو—في نماذج انتشار الفيديو مسبقة التدريب مع الحفاظ الكامل على القدرات التوليدية الأصلية للنموذج الأساسي.

المؤلفون الأصليون: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طباخاً ماهراً بارعاً جداً في طهي نوع معين من الأطباء وهو: تحويل النص إلى فيديو (Text-to-Video). تعطيه وصفة (مطالبة نصية)، فيقوم هو بإعداد فيديو لذيذ. هذا الطباخ هو "النموذج الأساسي" (وتحديداً نموذج يسمى Wan-T2V).

ومع ذلك، هناك مشكلة. إذا أردت إعطاء الطباخ مكوناً أولياً محدداً (مثل صورة قطة) وقلت له: "اصنع فيديو يبدأ بهذه القطة"، فإنه يصاب بالارتباك. في الطريقة القديمة المتبعة، كان على الطباخ تعلم طريقة جديدة تماماً للطهي من الصفر، وغالباً ما كان ينسى كيفية طهي الأطباق الأصلية في هذه العملية. هذا يشبه إجبار الطباخ على نسيان تدريبه الطهوي بالكامل لمجرد تعلم خدعة واحدة جديدة.

إليك Pusa V1.0.

المشكلة: "الساعة الجامدة"

تعمل نماذج الفيديو الحالية مثل ساعة متزامنة وجامدة. تخيل أن الفيديو عبارة عن صف من قطع الدومينو المتساقطة. في هذه النماذج القديمة، يجب أن تسقط كل قطعة دومينو (إطار) بنفس السرعة والوقت تماماً.

  • إذا أردت أن تظل القطعة الأولى واقفة (صورتك الابتدائية) بينما تسقط بقية القطع، فإن الساعة ستتعطل.
  • لإصلاح ذلك، تحاول النماذج الأخرى "إعادة تدريب" الطباخ، وهو أمر مكلف وبطيء، وغالباً ما يؤدي إلى تدمير قدرته على طهي الأطباق الأصلية.

الحل: "أجهزة التحكم عن بعد الفردية"

يقدم Pusa مفهوماً يسمى تكييف الخطوات الزمنية المتجهية (Vectorized Timestep Adaptation - VTA).

بدلاً من وجود ساعة رئيسية واحدة للفيديو بأكم، يمنح Pusa كل إطار جهاز تحكم عن بعد خاص به.

  • الإطار الأول (صورتك الابتدائية) يحصل على جهاز تحكم مضبوط على وضع "إيقاف مؤقت".
  • الإطار الثاني يحصل على جهاز تحكم مضبوط على "تحرك ببطء".
  • الإطار الثالث يحصل على جهاز تحكم مضبوط على "تحرك بسرعة".

هذا يسمح للذكاء الاصطناعي بتطوير كل إطار بشكل مستقل. الإطار الأول يبقى تماماً كما وضعته، بينما يتدفق باقي الفيديو بشكل طبيعي حوله.

الخدعة السحرية: الجراحة "غير المدمرة"

الجزء الأكثر إثارة للإعجاب في Pusa هو كيفية تعلمه لهذا الأمر.

  • الطريقة القديمة: لتعلم خدعة "البدء بصورة"، كان على النماذج القديمة (مثل Wan-I2V) الخضوع لعملية إصلاح شاملة ومدمرة. كان عليهم إعادة التدريب على ملايين الأمثلة، مما يعني عملياً إعادة بناء دماغ الطباخ. كان ذلك يكلف ثروة من قدرات الحوسبة وغالباً ما يجعلهم ينسون مهمة تحويل النص إلى فيديو الأصلية.
  • طريقة Pusa: يقوم Pusa بإجراء تعديلات "جراحية". هو لا يعيد بناء دماغ الطباخ؛ بل يضيف فقط أداة صغيرة متخصصة (الخطوة الزمنية المتجهية) إلى الدماغ الموجود بالفعل.
    • تشبيه: تخيل أن الطباخ يعرف بالفعل كيف يطهي بشكل مثالي. بدلاً من طرده وتوظيف طباخ جديد، أنت فقط تعطيه مؤقتاً (Timer) محدداً يخبره بالضبط متى يتوقف عن تحريك الوعاء الأول. مهارات الطباخ الأساسية تظل سليمة بنسبة 100%.

النتائج: رخيصة، سريعة، ومتعددة الاستخدامات

لأن Pusa لا يحتاج إلى إعادة تعلم كل شيء من الصفر، فإن النتائج مذهلة:

  1. كفاءة فائقة: بينما احتاجت النماذج الأخرى إلى ملايين الأمثلة وميزانيات حوسبة ضخمة (تكلف أكثر من 100,000 دولار من قدرة الحوسبة)، حقق Pusa نتائج رفيعة المستوى باستخدام 4,000 مثال فقط وجزء ضئيل من التكلفة (حوالي 500 دولار).
  2. قدرات خارقة بدون تدريب مسبق (Zero-Shot): لأن دماغ الطباخ لم يتم مسحه أو الكتابة فوقه، لم يتعلم Pusa فقط كيفية البدء بصورة، بل اكتسب فوراً القدرة على القيام بخدع معقدة أخرى دون أي تدريب إضافي، مثل:
    • إطارات البداية والنهاية: إعطاء الذكاء الاصطناعي صورة للبداية وصورة للنهاية، وجعله يملأ المنتصف.
    • توسيع الفيديو: أخذ فيديو قصير وجعل امتداده سلساً وطويلاً.
    • تحويل النص إلى فيديو: احتفظ بقدرته الأصلية على صنع فيديوهات من المطالبات النصية بشكل مثالي.

الملخص

Pusa V1.0 يشبه ترقية محرك سيارة دون تفكيك السيارة. من خلال منح كل إطار "قرص ضبط الوقت" الخاص به بدلاً من إجبارهم على السير في خطوة واحدة متزامنة، يمكن للنموذج التعامل مع مهام الفيديو المعقدة (مثل البدء بصورة محددة) بكفاءة مذهلة. إنه يحافظ على ذكاء النموذج الأصلي مع فتح قدرات جديدة ومرنة، مما يجعل توليد الفيديو عالي الجودة أرخص بكثير وأكثر سهولة في الوصول إليه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →