ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models
يقدم ForgeWM إطار تدريب تدريجي يحول مولدات الفيديو ثنائية الاتجاه إلى نماذج عالم فعالة ومنخفضة زمن الاستجابة وقليلة الخطوات، قادرة على محاذاة عناصر التحكم في الألعاب المنفصلة والمستمرة بدقة مع توليد الفيديو، محققاً أداءً هو الأفضل في فئته من حيث الجودة ودقة التحكم من خلال تقنيات مثل تقطير الاتساق السببي وبروتوكول النشر ثنائي المسار مع تحسين وقت إعادة التشغيل.
تخيل عالماً لا يكتفي فيه حاسوبك بمشاهدة فيلم، بل يلعب اللعبة الموجودة بداخله بالفعل، متوقعاً بدقة ما سيحدث تالياً بناءً على الأزرار التي تضغطها. هذا هو مجال نماذج عوالم الفيديو (video world models)، وهو فرع من فروع الذكاء الاصطناعي يحاول محاكاة الواقع. فكر في الأمر كأنه قاصّ ذكي جداً قرأ كل كتاب في المكتبة ويمكنه تخيل الفصل التالي فوراً. عادةً ما يكون هؤلاء القاصّون بارعين في كتابة قصص طويلة ومفصلة، لكنهم بطيئون. إذا كنت تريد لعب لعبة فيديو في الوقت الفعلي، فأنت بحاجة إلى قاصّ يمكنه همس الجملة التالية فوراً، وإلا ستتوقف اللعبة وتتعرض للتأخر (lag). التحدي يكمن في أن جعل هذه النماذج سريعة غالباً ما يجعلها خرقاء؛ فقد تنسى ما أخبرتها به للتو أو تخطئ في اتجاه شخصيتك. تعالج هذه الورقة البحثية المشكلة المعقدة المتمثلة في تعليم الذكاء الاصطناعي كيف يكون سريعاً كالبرق ومطيعاً تماماً لضوابطك في آن واحد، مع الحفاظ على مظهر الفيديو حاداً وواقعياً.
إليك ForgeWM، وهو إطار عمل جديد يعمل مثل رئيس طهاة يدرب فريقاً من مساعدي الطهاة لطهي نفس الوجبة اللذيذة في أوقات مختلفة. بدأ الباحثون بنموذج ذكاء اصطناعي قوي وبطيء الحركة يمكنه توليد الفيديو في أي اتجاه (بالنظر للأمام أو للخلف عبر الزمن). كان هدفهم هو تحويله إلى نموذج "بضع خطوات" (few-step model) — وهو نموذج يمكنه توليد الثواني القليلة القادمة من الفيديو في خطوة واحدة أو اثنتين أو أربع خطوات سريعة بدلاً من عملية طويلة وبطيئة. وقد وجدوا أن مجرد تسريع النموذج لم ينجح لأن الذكاء الاصطناعي كان يرتبك بسبب أخطائه أثناء محاولته التنبؤ بالمستقبل.
ولحل هذه المشكلة، طور الفريق وصفة تدريب مكونة من أربع مراحل. أولاً، علموا النموذج أساسيات عالم اللعبة. ثم أجبروه على تعلم كيفية التحرك للأمام عبر الزمن باستخدام أمثلة نظيفة ومثالية فقط (مثل طالب ينسخ خط معلم مثالي). بعد ذلك، جعلوا النموذج يتدرب بمفرده، ولكن مع وجود شبكة أمان تصحح أخطاءه فوراً. وأخيراً، تركوا النموذج ينطلق بحرية في لعبة محاكية، ليعلمه مطابقة التوزيع الحقيقي لكيفية سير اللعبة فعلياً. والنتيجة هي مجموعة من "الطلاب" المتخصصين: نموذج الخطوة الواحدة لاستجابات فورية وزمن انتقال منخفض، ونموذج الخطوتين لتحقيق توازن بين السرعة والجودة، ونموذج الأربع خطوات للحصول على دقة بصرية أعلى.
تظهر الورقة أن هذه النماذج تعمل بشكل رائع للغاية. في الاختبارات باستخدام لعبة ماين كرافت (Minecraft)، استطاع نموذج الخطوة الواحدة توليد فيديو بسرعة 72.10 إطاراً في الثانية (FPS)، وهي سرعة كافية للعب سلس في الوقت الفعلي، مع فهم أوامر لوحة المفاتح والماوس بدقة عالية. أما نموذج الأربع خطوات فقد أنتج جودة بصرية أفضل، متفوقاً على الأنظمة الرائدة الأخرى في مدى مطابقته للحركة المقصودة وعناصر التحكم. ومن المثير للاهتمام أن الباحثين اكتشفوا أنك لست بحاجة دائماً لإعادة تدريب النموذج للحصول على جودة أفضل. فقد قدموا حيلة "تحسين وقت إعادة التشغيل" (Replay-Time Refinement): إذا سجلت جلسة لعب سريعة بخطوة واحدة، يمكنك لاحقاً أخذ ذلك الفيديو المسجل و"إعادة تشويشه" (re-noise)، أي الطلب من نفس النموذج تنظيفه وإضافة تفاصيل إليه دون تغيير المسار الذي سلكته. هذا الفيديو المحسّن بدا جيداً تقريباً كما لو أن النموذج قد اتخذ أربع خطوات لتوليده من الصفر، لكنه حافظ على نفس وجهة النظر وتخطيط المشهد الذي عشته تماماً.
كما أظهر الفريق أن طريقة التدريب هذه ليست مقتصرة على ماين كرافت فقط. فقد طبقوا نفس الوصفة على ألعاب التصويب من منظور الشخص الأول (FPS) التي يتم التحكم فيها عبر وحدة تحكم الألعاب (gamepad)، مما أدى لإنشاء نموذج يسمى ForgeWM-CrossFPS نجح في توليد فيديو لألعاب مثل Halo Infinite و Modern Warfare. وبينما تشير الورقة إلى أن هذه النماذج لا تزال تظهر بعض التراجع عبر فترات طويلة جداً (مثل فقدان هيكل الكتل بعد 22 ثانية)، فإن النتائج تشير إلى أن ForgeWM يوفر طريقة قوية ومرنة لبناء نماذج عوالم فيديو تكون قابلة للتحكم وسريعة في آن واحد. ويقترح المؤلفون أنه من خلال فصل الحاجة إلى الاستجابة الفورية عن الحاجة إلى المرئيات عالية الجودة، يمكننا الحصول على أفضل ما في العالمين في الذكاء الاصطناعي التفاعلي.
ملخص تقني: ForgeWM – التدريب السببي التصاعدي لنماذج عالم الفيديو ذات الخطوات القليلة والمشروطة بالأفعال
بيان المشكلة تهدف نماذج عالم الفيديو المشروطة بالأفعال إلى محاكاة الحالات البصرية المستقبلية من الملاحظات والأفعال دون الحاجة إلى محرك رسوميات صريح. ومع ذلك، يتطلب النشر التفاعلي توليدًا سببيًا (التنبؤ بالمستقبل بناءً على البيانات الماضية فقط)، واستجابة مستمرة للتحكم، وعدد منخفض من خطوات إزالة الضجيج (denoising steps) لإغلاق حلقة التحكم في الوقت الفعلي. تنشأ التحديات الحالية لأن ضغط أخذ العينات العدواني (خطوات أقل لإزالة الضجيج) يغذي الأخطاء البصرية، وأخطاء الأفعال، وأخطاء الذاكرة المخبئية (cache) في الكتل (chunks) اللاحقة، مما يربط بين الدقة، والقدرة على التحكم، والاستقرار متعدد الكتل. وتتضمن عناصر التحكم الأصلية في الألعاب حالات لوحة مفاتيح منفصلة وحركة ماوس مستمرة تصل بمعدل إطارات الفيديو. يجب أن تظل هذه العناصر متوافقة مع الكتل الكامنة (latent chunks) المضغوطة زمنيًا أثناء التدريب السببي والانتشار التكراري (autoregressive rollout). وتواجه الطرق الحالية صعوبة في الحفاظ على واجهات التحكم هذه ومحاذاة الفعل مع الكامن (action-to-latent alignment) عند الانتقال من بيانات التدريب النظيفة إلى التاريخ غير المثالي الناتج عن التوليد الذاتي.
المنهجية: إطار عمل ForgeWM يقدم المؤلفون ForgeWM، وهو إطار عمل تصاعدي مكون من أربع مراحل يحول مولد فيديو ثنائي الاتجاه ومشروط بالأفعال إلى نماذج عالم سببية فعالة ومتخصصة في ميزانيات محددة. يعمل إطار العمل على أساس تهيئة مشتركة ويستخدم واجهة أفعال نمطية للحفاظ على عناصر التحكم المنفصلة والمستمرة المتوافقة مع إطار الزمن.
تتكون عملية التدريب من أربع مراحل متميزة:
المرحلة 0: التكيف مع النطاق ثنائي الاتجاه. يتم تكييف مولد أساسي مع نطاق اللعبة المستهدف (مثل Minecraft) باستخدام أهداف مطابقة التدفق (flow-matching) مع انتباه ثنائي الاتجاه لكامل المقطع. تعمل هذه النسخة كـ "مزيل ضجيج حقيقي مجمد" للمراحل اللاحقة وكـ "معلم للنطاق" (Domain Teacher).
المرحلة 1: التدريب السببي القسري للمعلم (Teacher-Forced). يتم إنشاء فرع ثانٍ من نفس القاعدة ولكن مع استبدال الانتباه الزمني الكامل بانتباه سببي مقسم إلى كتل. يقوم التدريب بدمج تدفقات الرموز (tokens) النظيفة والمشوشة، حيث ينتبه الجزء المشوش فقط إلى الأجزاء السابقة النظيفة وإلى نفسه. هذا يعلم النموذج نمط التنفيذ السببي دون تعريضه لأخطاء الانتشار الخاصة به.
المرحلة 2: تهيئة الاتساق السببي. بدءًا من نسخة المرحلة 1، يقوم إطار العمل بإجراء تقطير اتساق سببي عبر الإنترنت. يأخذ المعلم المجمد (من المرحلة 1) خطوة واحدة من "إقلر" (Euler step) موجهة بتصنيف خالي من التوجيه نحو توزيع البيانات. يتم تدريب شبكة الطالب على مطابقة التنبؤ النظيف للنقطة المتقدمة للمعلم. هذا يهيئ أخذ عينات بخطوات قليلة دون الحاجة إلى مجموعة بيانات مسار غير متصلة بالإنترنت.
المرحلة 3: مطابقة التوزيع في الوقت الفعلي (On-Policy). يقوم الطالب بعملية انتشار ذاتي تكراري، مشروطًا بتاريخه الذي تم توليده سابقًا. يعمل هدف مطابقة التوزيع (DMD) على محاذاة "مزيل الضجيج المزيف" للطالب مع "مزيل الضجيج الحقيقي المجمد" (من المرحلة 0). هذا يقلل من عدم التطابق الناتج عن التدريب القسري للمعلم. يتم تدريب طلاب منفصلين لميزانيات إزالة ضجيج مستقرة تتراوح بين خطوة واحدة، وخطوتين، و4 خطوات.
استراتيجية النشر يستخدم ForgeWM بروتوكول نشر مزدوج المسار:
التفاعل عبر الإنترنت: يستخدم الطالب الأصلي ذو الخطوات المنخفضة (1، 2، أو 4 خطوات) للتحكم في الوقت الفعلي وزمن الوصول المنخفض.
تحسين وقت إعادة التشغيل (Replay-Time Refinement): بعد التفاعل، يمكن تحسين المسودة المحفوظة (المسار الذي مر به المستخدم)؛ حيث يقوم الطالب المنشور بإعادة تشويش الكتل المحفوظة عند وقت تدفق متوسط، ثم يقوم بإزالة الضجيج باستخدام جدول زمني أكبر (مثل 4 خطوات) مع الحفاظ على الأفعال المسجلة والبادئة السببية. هذا يحسن الجودة البصرية دون الحاجة إلى نموذج محسن منفصل أو نسخة أخرى.
المساهمات الرئيسية
إطار عمل من أربع مراحل: طريقة لتحويل المولدات ثنائية الاتجاه إلى نماذج عالم سببية متخصصة في الميزانية عبر التكيف مع النطاق، والتدريب القسري للمعلم، وتهيئة الاتساق، ومطابقة التوزيع في الوقت الفعلي.
الحفاظ على التحكم: يحافظ إطار العمل على محاذاة عناصر التحكم المنفصلة (لوحة المفاتيح) والمستمرة (الماوس/لوحة الألعاب) المتوافقة مع معدل الإطارات طوال عملية ضغط الكامن، والتدريب السببي، والانتشار التكراري.
نقاط التشغيل والتحسين: توفير نقاط تشغيل متميزة بـ 1 و2 و4 خطوات، وبروتوكول إعادة تشغيل يعزز الجودة دون الإنترنت مع الحفاظ على المسار الفعلي بدقة.
النتائج تم التقييم على مسارات Minecraft المزدوجة ونطاق FPS منفصل (CrossFPS):
الأداء: في Minecraft، تتفوق متغيرات ForgeWM على الأنظمة المقيمة (Matrix-Game 2.0, HY-WorldPlay) في جودة التصوير، والاتفاق مع ملف الحركة المرجعي، ودقة إشارة الفعل (KCtrl)، ودقة تحكم الماوس. يحقق ForgeWM-1 أعلى إنتاجية لتوليد الإطارات (72.10 إطارًا في الثانية).
تفضيل البشر: في دراسة عمياء، حصل ForgeWM-4 على 68.8% من تفضيلات الجودة البصرية و57.6% من تفضيلات دقة الفعل مقابل النماذج المرجعية.
تحسين وقت إعادة التشغيل: يحقق تحسين وقت إعادة التشغيل جودة مرجعية مقاربة للتوليد المباشر بـ 4 خطوات (LPIPS ~0.6155 مقابل 0.6168)، ولكنه يقلل بشكل كبير من المسافة إلى المسودة المحفوظة (Ddraft 0.1970 مقابل 0.6187)، مما يحافظ بفعالية على مسار المستخدم مع تحسين الدقة البصرية.
التعميم: نجحت وصفة المراحل الأربع نفسها في الانتقال إلى أسلوب لعب FPS المتحكم فيه بلوحة الألعاب (Halo Infinite, Modern Warfare)، مما أنتج طالبًا سببيًا مع عناصر تحكم متوافقة.
الأهمية يزعم البحث أن ForgeWM يوفر إطار عمل فعالًا لـ نماذج عالم الفيديو القابلة للتحكم ذات الخطوات القليلة. تكمن أهميته الأساسية في حل مشكلة اقتران الدقة والقدرة على التحكم في الإعدادات التفاعلية من خلال الحفاظ على واجهات التحكم الأصلية للألعاب أثناء الانتقال من التوليد ثنائي الاتجاه إلى التوليد السببي ذي الخطوات القليلة. ومن خلال فصل التفاعل الحرج لزمن الوصول عن التحسين الاختياري للجودة، فإنه يعالج القيود العملية للمحاكاة في الوقت الفعلي مع الحفاظ على الاتساق البصري والديناميكي العالي. يوضح العمل أن الطلاب المتخصصين في الميزانية يمكنهم العمل عند ميزانيات إزالة ضجيج مستقرة تبلغ 1 أو 2 أو 4 خطوات دون التضحية بالمحاذاة المطلوبة للتحكم الدقيق في الوكيل.