PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models
يقدم "PropFly" مسار تدريب للتحرير القائم على الانتشار يلغي الحاجة إلى مجموعات البيانات المقترنة المكلفة من خلال الاستفادة من الإشراف الفوري من نماذج انتشار الفيديو سابقة التدريب لتخليق أزواج كامنة متنوعة (مصدر-محرر) عبر تغيير مقاييس الـ CFG، مما يمكن محولاً (adapter) من تعلم تحريات عالية الجودة ومتسقة زمنياً من خلال مطابقة التدفق المعدلة بالتوجيه (Guidance-Modulated Flow Matching).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مقطع فيديو منزلياً لكلبك وهو يركض في حديقة. تريد تعديل الفيديو بحيث يبدو الكلب وكأنه تنين، لكنك تريد أن يركض التنين تماماً بنفس الطريقة التي ركض بها الكلب، مع نفس الخلفية ونفس الرياح التي تهب عبر الأشجار.
القيام بذلك يدوياً هو كابوس. أما القيام به باستخدام الذكاء الاصطناعي الحالي، فهو يشبه محاولة وصف التنين لرسام ينسى باستمرار ما قلته له، أو يرسم التنين ولكنه ينسى جعله يركض.
PropFly هي طريقة جديدة تحل هذه المشكلة. إليك كيف تعمل، مشروحة بتبسيطات تشبيهية:
1. المشكلة: معضلة "الزوج"
لتعليم الذكاء الاصطناعي كيفية تعديل الفيديوهات، تحتاج عادةً إلى مكتبة ضخمة من أزواج "قبل وبعد". أنت بحاجة إلى آلاف الفيديوهات التي تعرض "سيارة عادية" ونفس الفيديو تماماً يظهر "سيارة سايبربانك".
- المشكلة: صنع هذه الأزواج مكلف للغاية وبطيء. الأمر يشبه توظيف جيش من الفنانين لإعادة رسم كل إطار من كل فيلم لإنشاء مجموعة بيانات تدريبية.
2. الحل: "المعلم الفوري" (الإشراف أثناء التشغيل)
بدلاً من توظيف جيش من الفنانين لصنع بيانات التدريب مسبقاً، يستخدم PropFly ذكاءً اصطناعياً مدرباً مسبقاً (نموذج انتشار فيديو - Video Diffusion Model) ليكون بمثابة معلم حي.
فكر في هذا الذكاء الاصطناعي المدرب مسبقاً كشيف (طباخ) ماهر يعرف كيف يطبخ أي طبق بإتقان.
- الطريقة القديمة: تطلب من الشيف أن يطبخ 10,000 وجبة، ثم تحفظها، وبعد ذلك تحاول التعلم منها.
- طريقة PropFly: تطلب من الشيف أن يطبخ وجبة الآن، ولكنك تطلب منه نسختين منها فوراً:
- النسخة (أ) (المصدر): طبق عادي بسيط (مثل برجر سادة).
- النسخة (ب) (الهدف): نسخة فاخرة وحارة من نفس الطبق تماماً (مثل برجر حار).
السحر يكمن في أن الشيف يصنع كلتا النسختين من نفس المكونات في اللحظة ذاتها. ولأن كلتيهما تنبعان من "مصدر" واحد، فإن شكل الخبز واللحم والخبز يكون متطابقاً. الاختلاف الوحيد هو مستوى التوابل (التغيير في الأسلوب أو الشيء).
3. السر: "مقبض التحكم في الصوت" (CFG)
كيف يصنع الشيف طبقين مختلفين فوراً؟
يستخدم PropFly إعداداً يسمى التوجيه الخالي من التصنيف (Classifier-Free Guidance - CFG)، والذي يعمل مثل مقبض التحكم في مستوى الصوت للإبداع.
- صوت منخفض (CFG منخفض): يتبع الذكاء الاصطناعي التعليمات بدقة ولكنه يظل قريباً جداً من الفيديو الأصلي. هذه هي "المصدر".
- صوت مرتفع (CFG مرتفع): يقوم الذكاء الاصطناعي برفع مستوى الإبداع. يأخذ نفس الفيديو ويطبق عليه "فلتر أسلوب" ثقيل (مثل تحويله إلى لوحة زيتية، أو تغيير الطقس، أو استبدال الشيء). هذا هو "الهدف".
ولأن الذكاء الاصطناعي يولد كليهما من نفس نقطة البداية "المشوشة"، فإن الحركة (ركض الكلب) تظل متزامنة تماماً، لكن المظهر (الكلب مقابل التنين) يتغير.
4. الطالب: "المحول" (Adapter)
لا يقوم PropFly بإعادة تدريب الشيف الماهر بأكمله (نموذج الذكاء الاصطناعي الكبير). بدلاً من ذلك، يقوم بإرفاق محول صغير قابل للتدريب (يسمى "الطالب") بالشيف.
- الطالب يشاهد المصدر (الفيديو العادي) والهدف (الفيديو الحار).
- يتعلم الطالب: "آه، عندما أرى برجر سادة والمستخدم يريد برجراً حاراً، يجب عليّ إضافة هذه التوابل المحددة إلى الفيديو بأكمله، وليس فقط إلى الإطار الأول."
- يتعلم الطالب كيفية نشر (propagate) التغيير. يتعلم كيف يأخذ المظهر "الحار" من الإطار الأول ويطبقه على كل إطار يليه، مما يحافظ على سلاسة الحركة.
5. النتيجة: تعديل قوي
لأن الطالب تعلم من هذه الأزواج "المولدة فورياً"، فقد أصبح بارعاً في التعديل.
- طرق التوجيه بالنص (الطريقة القديمة): تخبر الذكاء الاصطناعي "اجعله تنيناً"، وقد يصنع تنيناً يمشي مثل البشر أو ينسى الخلفية.
- PropFly: تظهر له إطاراً واحداً لتنين، فيقول لك: "فهمت! أعرف تماماً كيف أحول الفيديو بأكمله إلى تنين مع الحفاظ على حركة ركض الكلب بدقة تامة."
ملخص التشبيه
تخيل أنك تتعلم رسم سيارة متحركة.
- الطريقة القديمة: تُعطى صورة لسيارة حمراء وصورة لسيارة زرقاء، لكنهما بزوايا مختلفة قليلاً. عليك أن تخمن كيف ترسم السيارة الزرقاء وهي تتحرك.
- PropFly: لديك كاميرا سحرية. تلتقط صورة لسيارة حمراء. تقوم بتدوير قرص، وفوراً، تظهر لك الكاميرا نفس السيارة، في نفس الوضعية تماماً، ولكنها مطلية باللون الأزرق. تتدرب على هذا آلاف المرات على التوالي. الآن، يمكنك النظر إلى أي فيديو لسيارة حمراء ومعرفة كيفية طلاءها باللون الأزرق فوراً مع الحفاظ على دوران العجلات بشكل مثالي.
باختصار: يعلم PropFly الذكاء الاصطناعي كيفية تعديل الفيديوهات من خلال السماح له بالتدرب على أمثلة "مولدة فورياً"، حتى لا يحتاج إلى مكتبة ضخمة ومكلفة من الأمثلة المعدة مسبقاً ليتعلم كيف يكون مبدعاً ومتسقاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.