StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation
تُعد StreamDiffusionV2 خط تدفق (pipeline) قابل للتوسع ولا يتطلب تدريباً، يتيح بثاً فيديو تفاعلياً في الوقت الفعلي باستخدام نماذج الانتشار بالفيديو عبر دمج الجدولة الواعية بـ SLO، والتحكم الواعي بالحركة، والتنسيق المتوازي لتحقيق زمن انتقال فائق الانخفاض وإنتاجية عالية على مجموعات وحدات معالجة الرسومات غير المتجانسة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول رسم لوحة فنية رائعة على قماش، ولكن عليك إنهاء اللوحة بأكملها قبل أن تتمكن من عرض أول ضربة فرشاة للجمهور. هكذا تعمل مولدات الفيديو الحالية بالذكاء الاصطناعي: فهي تخطط للفيلم بأكمله، وتحسب كل إطار دفعة واحدة، ثم تبدأ في العرض. هذا الأمر رائع من حيث الجودة، ولكنه سيء للغاية فيما يتعلق بالتفاعل المباشر.
StreamDiffusionV2 يشبه رساماً سحرياً يمكنه البدء في عرض أول ضربة فرشاة لك في أقل من نصف ثانية، ويستمر في الرسم إطاراً تلو الآخر في الوقت الفعلي، دون أن تومض الصورة أو تخرج القصة عن مسارها.
إليك تفصيل لكيفية قيامهم بذلك، باستخدام بعض التشبيهات من الحياة اليومية:
1. المشكلة: عنق زجاجة "التجميع" (Batching)
الطريقة القديمة (التوليد غير المتصل - Offline Generation):
تخيل مخبزاً لا يخبز الخبز إلا عندما تكتمل لديه طلبات كافية لملء شاحنة كاملة. ينتظر حتى تكتمل 100 طلبة، يخبزها جميعاً معاً، ثم يقوم بتوصيلها. هذا فعال للمخبز (إنتاجية عالية)، ولكن إذا طلبت رغيفاً واحداً، فعليك الانتظار لساعات.
- بمصطلحات الذكاء الاصطناعي: تنتظر نماذج الفيديو الحالية لمعالجة كتل ضخمة مكونة من 80 إطاراً أو أكثر في وقت واحد. يتسبب هذا في تأخير كبير قبل بدء الفيديو (وقت الوصول إلى الإطار الأول).
طريقة StreamDiffusionV2:
هذا النظام يشبه عربة طعام (Food Truck) تطهو برجر واحداً في اللحظة التي تطلب فيها. هي لا تنتظر تجمع الحشود، بل تكيف سرعتها بناءً على عدد الأشخاص الموجودين في الطابور الآن.
- الابتكار: يستخدمون "مجدول دفعات مدرك لزمن الاستجابة" (SLO-aware Batching Scheduler). بدلاً من إجبار الذكاء الاصطناعي على الانتظار لحزمة كبيرة، يقرر ديناميكياً: "حسناً، سأعالج إطارين الآن للحفاظ على استمرار البث، ثم 4 إطارات إذا كان الكمبيوتر في حالة خمول". هذا يضمن وصول الإطار الأول فوراً (في أقل من 0.5 ثانية) ووصول كل إطار تالٍ في وقته المحدد.
2. المشكلة: القصة "المتذبذبة" (Drifting)
الطريقة القديمة:
تخيل حكواتي يروي قصة لمدة 10 ساعات. إذا لم يراجع ملاحظاته، فبحلول الساعة الخامسة، قد يكون قد نسي اسم الشخصية الرئيسية، أو ربما تغيرت البيئة من غابة إلى صحراء. يُسمى هذا "الانجراف الزمني" (Temporal Drift).
- بمصطلحات الذكاء الاصطناعي: تفقد نماذج الفيديو القياسية تركيزها عبر البث الطويل. "رموز المصب" (Sink Tokens) -التي تعمل كمرتكزات لذاكرة الذكاء الاصطناعي- تصبح قديمة، ويبدأ الفيديو في الظهور بشكل غريب أو ضبابي.
طريقة StreamDiffusionV2:
هذا النظام لديه محرر ذكي يجلس بجانب الحكواتي. كل بضع دقائق، يهمس المحرر: "مهلاً، تذكر أن الشخصية ترتدي قبعة حمراء؟ تأكد من الحفاظ على ذلك".
- الابتكار: يستخدمون "رموز المصب التكيفية وتحديث RoPE" (Adaptive Sink Tokens and RoPE Refresh). يقوم النظام بتحديث "مرتكزات الذاكرة" باستمرار لتتوافق مع المطالبة (Prompt) والسياق البصري الحالي. إذا تغير المشهد، يعيد النظام ضبط ساعته الداخلية حتى لا يفقد المسار الزمني. هذا يحافظ على استقرار الفيديو لساعات، وليس لثوانٍ فقط.
3. المشكلة: الحركة السريعة "المضببة"
الطريقة القديمة:
تخيل أنك تحاول التقاط صورة لسيارة سباق. إذا كانت إعدادات الكاميرا الخاصة بك مضبوطة لزهرة بطيئة الحركة، فستظهر السيارة كبقعة ضبابية.
- بمصطلحات الذكاء الاصطناعي: معظم نماذج الذكاء الاصطناعي مدربة على فيديوهات بطيئة وهادئة. عندما تطلب منها توليد مشهد قتال سريع أو سيارة سباق، تحاول "تنعيم" المشهد أكثر من اللازم، مما يؤدي إلى ظهور آثار "الخيال" (Ghosting) أو "التمزق" (Tearing) (حيث تنقسم الصورة).
طريقة StreamDiffusionV2:
هذا النظام لديه مستشعر حركة مدمج في الكاميرا.
- الابتكار: يستخدمون "متحكم ضوضاء مدرك للحركة" (Motion-Aware Noise Controller).
- إذا كان المشهد بطيئاً (شخص يتحدث)، يصبح الذكاء الاصطناعي "عدوانياً" ويضيف تفاصيل دقيقة لجعل الصورة تبدو واضحة وحادة.
- إذا كان المشهد سريعاً (سيارة تمر بسرعة)، يصبح الذكاء الاصطناعي "محافظاً"، حيث يقوم بتنعيم الأمور بما يكفي لمنع تمزق الصورة، مع الحفاظ على وضوح الحركة. الأمر يشبه مصوراً يغير العدسات تلقائياً بناءً على سرعة الموضوع الذي يصوره.
4. المشكلة: "الازدحام المروري" مع تعدد وحدات المعالجة الرسومية (GPUs)
الطريقة القديمة:
تخيل محاولة بناء منزل باستخدام 4 فرق بناء. إذا كان على الفريق 1 أن ينتظر الفريق 2 حتى ينتهي من وضع الأساسات قبل أن يبدأوا في بناء الجدران، وإذا كان عليهم جميعاً الصراخ لإعطاء التعليمات عبر الموقع، فسيقضون وقتاً في الانتظار أكثر من العمل الفعلي.
- بمصطلحات الذكاء الاصطناعي: استخدام عدة وحدات معالجة رسومية (أجهزة كمبيوتر) يؤدي عادةً إلى تأخيرات في التواصل. "التوازي التسلسلي" (Sequence Parallelism) -الذي يقسم العمل حسب الوقت- يسبب الكثير من عمليات نقل البيانات بين الرقائق، مما يبطئ كل شيء.
طريقة StreamDiffusionV2:
لقد بنوا خط تجميع يعمل بسير ناقل (Conveyor Belt).
- الابتكار: يستخدمون "تنسيق خطوط الإنتاج" (Pipeline Orchestration). بدلاً من انتظار بناء المنزل بالكامل، يقوم الفريق 1 بطلاء الجدران بينما يقوم الفريق 2 بتركيب السقف، والفريق 3 يركب النوافذ، وكل ذلك في نفس الوقت. كما يستخدمون "مجدول الكتل" (Block Scheduler) للتأكد من عدم بقاء أي فريق عاطلاً عن العمل بانتظار الفريق التالي. هذا يسمح لهم باستخدام 4 وحدات معالجة رسومية قوية للحصول على سرعة تقارب 4 أضعاف دون "الازدحام المروري" الناتج عن نقل البيانات.
النتيجة: لماذا يجب أن تهتم؟
قبل هذا، كان إنتاج الفيديو عالي الجودة بالذكاء الاصطناعي يشبه السيارة الفاخرة: باهظة الثمن، بطيئة في الانطلاق، وصعبة القيادة في الوقت الفعلي.
StreamDiffusionV2 يحوله إلى قطار سريع وموثوق:
- السرعة: يبدأ الفيديو في 0.5 ثانية (أسرع من رمشة عينك).
- الأداء: يمكنه توليد 58 إلى 64 إطاراً في الثانية (جودة سينمائية سلسة) على أجهزة الكمبيوتر القوية القياسية.
- سهولة الوصول: يعمل على كل شيء، من جهاز كمبيوتر واحد قوي إلى خوادم ضخمة، مما يعني أن كلاً من صانع محتوى مستقل على يوتيوب ومنصة بث ضخمة يمكنهما استخدامه.
باختصار، لقد وجدوا طريقة لجعل توليد الفيديو بالذكاء الاصطناعي لحظياً، مستقراً، وسريعاً بما يكفي للبث المباشر، مما يفتح الباب أمام المضيفين الافتراضيين التفاعليين، وبث الألعاب في الوقت الفعلي، وتحرير الفيديو الفوري.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.