يقدم هذا البحث One-DVA، وهو مشفر تلقائي للفيديو يعتمد على تقنية الـ transformer، يتغلب على قيود النماذج الحالية من خلال توظيف الترميز القائم على الاستعلام مع إسقاط متغير الطول وفك تشفير قائم على الانتشار لتحقيق ضغط تكيفي وإعادة بناء عالية الجودة للفيديو.
تخيل أنك تريد إرسال فيديو عالي الدقة لقطة ترتدي نظارات شمسية عبر الإنترنت. عادةً، يشبه هذا الأمر محاولة إرسال صندوق خشبي ضخم وثقيل يحتوي على كل طوبة من طوبات مبنى ما. إنها عملية بطيئة، مكلفة، وتستهلك مساحة كبيرة بلا داعٍ، خاصة إذا كان الفيديو مجرد صورة ثابتة للقطة وهي تجلس في مكانها.
أدوات ضغط الفيديو الحالية تشبه الصناديق الجاهزة والصلبة؛ فهي تجبر كل فيديو على الدخول في صندوق بنفس الحجم، بغض النظر عما إذا كان الفيديو عبارة عن عرض شرائح ممل أو مشهد مطاردة مليء بالحركة. إذا كان الفيديو بسيطاً، يكون الصندوق كبيراً جداً (مما يهدر المساحة). وإذا كان الفيديو معقداً، يكون الصندوق صغيراً جداً (مما يسحق التفاصيل). كما أن الآلة التي تفتح هذه الصناديق (المفكك/Decoder) هي روبوت جامد يحاول تخمين الأجزاء المفقودة، مما يؤدي غالباً إلى فيديوهات ضبابية أو غريبة المظهر.
تقدم الورقة البحثية One-DVA، وهو نظام جديد يعمل مثل خدمة توصيل ذكية ومتغيرة الشكل مع فنان مبدع في فريق فك التعبئة. وإليك كيف يعمل:
1. الساعي الذكي (المُشفّر/The Encoder)
بدلاً من إجبار كل فيديو على الدخول في صندوق ثابت الحجم، يستخدم One-DVA "ساعياً ذكياً" يعتمد على تقنية تسمى Transformer.
الحجم المتكيف: فكر في هذا كأنه ساعٍ يعاين الفيديو أولاً. إذا كان الفيديو لقطة هادئة نائمة، يقوم الساعي بتعبئتها في ظرف صغير وخفيف الوزن. أما إذا كان الفيديو لمطاردة سيارات فوضوية، فيستخدم الساعي صندوقاً أكبر وأكثر متانة. وهذا ما يسمى الترميز متغير الطول (variable-length encoding)؛ فهو يستخدم فقط القدر الذي يحتاجه الفيديو فعلياً من "المساحة" (الرموز/tokens).
آلية الاستعلام (The Query Mechanism): تخيل أن لدى الساعي فريقاً من الكشافة المتخصصين (يُطلق عليهم "الاستعلامات/queries"). يقوم هؤلاء الكشافة بمسح الفيديو واختيار التفاصيل الأكثر أهمية فقط لوضعها في الطرد، متجاهلين الضجيج الممل في الخلفية.
2. الفنان المبدع (مفكك الانتشار/The Diffusion Decoder)
بمجرد وصول الفيديو إلى وجهته، فإنه يحتاج إلى فك تعبئته. الأنظمة القديمة استخدمت روبوتاً جامداً يحاول إعادة بناء الفيديو بدقة من البقايا، وغالباً ما يفشل عندما تنقص بعض التفاصيل.
فك التعبئة التوليدي: يستخدم One-DVA مفكك انتشار (Diffusion Decoder)، وهو يشبه فناناً مبدعاً. فبدلاً من مجرد محاولة "إصلاح" الأجزاء الضبابية، يفهم هذا الفنان "أسلوب" الفيديو. إذا نقص تفصيل ما من الطرد (لأن الفيديو تم ضغطه بشدة)، يستخدم الفنان معرفته بكيفية عمل العالم لـ "يرسم" التفاصيل المفقودة بشكل واقعي. الفرق هو بين روبوت يحاول لصق مزهرية مكسورة بدقة تامة، وبين فنان يمكنه إعادة رسم الزهرة المفقودة بناءً على بقية باقة الزهور.
3. التدريب على مرحلتين (التدريب/The Practice)
لجعل هذا النظام يعمل، قام الباحثون بتدريبه في مرحلتين متميزتين، مثل طالب يتعلم حرفة ما:
المرحلة الأولى (المعلم الصارم): أولاً، علموا النظام أن يكون مُعبئاً ومفككاً مثالياً دون استخدام أي اختصارات. أُجبر "الفنان" على العمل مع لوحة بيضاء (ضجيج عشوائي)، مما جعل "المُشفّر" يتعلم ضرورة تضمين كل تفصيل أساسي في الطرد. هذا ضمن أن تكون القاعدة صلبة.
المرحلة الثانية (الممارسة الإبداعية): بمجرد وضع الأساس، أدخلوا مفهوم "تغيير الشكل" (الطول المتغير) و"الفنان المبدع" (الانتشار/diffusion). علموا النظام كيفية التعامل مع المعلومات المفقودة بسلاسة، وتعلم كيفية ملء الفجوات بحيث يبدو الفيديو النهائي حاداً وواضحاً حتى عندما يكون الطرد صغيراً جداً.
لماذا يهم هذا الأمر (وفقاً للورقة البحثية)
تدعي الورقة أن هذا النظام الجديد يحقق هدفين رئيسيين:
الكفاءة: يمكنه ضغط الفيديوهات بكفاءة أكبر بكثير من الطرق القديمة لأنه لا يهدر المساحة في الفيديوهات البسيطة.
الجودة: حتى عند ضغطه بشدة، يمكن لمفكك "الفنان المبدع" إعادة بناء الفيديو بجودة عالية، متفوقاً أو مساوياً لأفضل أنظمة 3D-CNN الموجودة.
جاهزية المستقبل: نظرًا لأن النظام بارع جداً في إنشاء نسخة "كامنة" (latent) نظيفة من الفيديو، فإنه يعمل كقاعدة مثالية لتوليد فيديوهات جديدة من الأوصاف النصية لاحقاً.
باختاً، One-DVA هو ضاغط فيديو يعرف متى يكون مقتصداً ومتى يكون سخياً، ومفكك تعبئة هو فنان وليس روبوتاً، مما يضمن ظهور الفيديو الخاص بك بشكل رائع مهما كان حجم الطرد صغيراً.
ملخص تقني: المشفر التلقائي لانتشار الفيديو أحادي البعد المتكيف (One-DVA)
1. بيان المشكلة
تعتمد نماذج توليد الفيديو الحديثة بشكل كبير على مشفرات الفيديو التلقائية لضغط فيديوهات فضاء البكسل إلى تمثيلات كامنة. ومع ذلك، تعاني مشفرات الفيديو التلقائية الحالية من ثلاث عيوب حرجة:
الضغط ثابت المعدل: تستخدم النماذج الحالية عددًا ثابتًا من الرموز (tokens) بغض النظر عن تعقيد الفيديو؛ مما يهدر الرموز في الفيديوهات البسيطة ويفشل في تحسين الكفاءة، حيث تتطلب المشاهد البسيطة رموزًا أقل من تلك التي تحتوي على أنسجة وحركة معقدة.
بنى CNN غير مرنة: تعتمد الشبكات العصبية الالتفافية (CNNs) التقليدية على نوى (kernels) ثابتة الحجم ومسبقات مصممة بشريًا، مما يجعلها غير ملائمة لمعالجة مدخلات متغيرة الشكل أو فك تشفير كامنات متغيرة الطول.
المفككات ذات المسار الحتمي: المفكات التقليدية حتمية وتواجه صعوبة في استعادة التفاصيل المناسبة من الكامنات عالية الضغط. عندما يكون عدد الرموز منخفضًا، يضطر الضغط مع فقدان البيانات (lossy compression) إلى استنتاج التفاصيل المفقودة، مما يؤدي غالبًا إلى أخطاء في إعادة البناء.
2. المنهجية
يقترح المؤلفون المشفر التلقائي لانتشار الفيديو أحادي البعد (One-DVA)، وهو إطار عمل قائم على المحولات (transformer) مصمم للترميز أحادي البعد المتكيف وفك التشفير القائم على الانتشار.
البنية
المشفر (Vision Transformer قائم على الاستعلام): يستخدم المشفر بنية Vision Transformer (ViT) لاستخراج الميزات الزمانية المكانية من إطارات الفيديو المدخلة. وهو يوظف استعلامات أحادية البمع (1D queries) قابلة للتعلم تتفاعل مع هذه الميزات عبر الانتباه الذاتي لاستخراج المحتوى البصري الأساسي. وينتج عن ذلك تمثيل كامن هجين يتكون من:
الكوامن الهيكلية: مستمدة من بنية ViT، وتلتقط الهيكل المكاني.
تسلسل الكامن أحادي البعد: يتم استخراجه عبر آلية الاستعلام.
الحذف المتغير الطول (Variable-Length Dropout): يتم تطبيق استراتيجية تدريب "ماتريوشكا" (matryoshka) حيث تقوم آلية حذف طول متغير بقطع التسلسل الكامن أحادي البعد ديناميكيًا من الذيل باتجاه الرأس. يتم أخذ عينة من نسبة الحذف بناءً على درجة الحركة المحسوبة من فروق البكسل، مما يسمح للنموذج بتكييف حجم الكامن مع تعقيد الفيديو.
المفكك (Diffusion Transformer في فضاء البكسل): المفكك هو Diffusion Transformer (DiT) يعمل في فضاء البكسل. يعامل التمثيلات الكامنة (الهيكلية وأحادية البعد) كمدخلات شرطية ويقوم بعملية انتشار لإعادة بناء الفيديو. هذا النهج التوليدي يسم يسمح للمفكك بتعلم توزيع مجموعة البيانات والتعويض عن التفاصيل المحذوفة.
استراتيجية التدريب
يستخدم One-DVA استراتيجية تدريب من مرحلتين لضمان دقة إعادة البناء والقدرة التوليدية العالية:
المرحلة الأولى: التدريب المسبق الحتمي: يتم تحسين المشفر لاستخراج الميزات الحرجة. يتلقى المفكك ضوضاء عشوائية نقية (متجاوزًا عملية الانتشار) وكامل المدخلات الكامنة. هذا يجبر المشفر على التقاط جميع المعلومات الضرورية دون الاعتماد على المسبقات التوليدية للمفكك.
المرحلة الثانية: التدريب اللاحق العشوائي: يتم إدخال أخذ عينات زمن الخطوة للانتشار (diffusion timestep sampling) والحذف متغير الطول. يتم تدريب النموذج باستخدام دالة خسارة مركبة تشمل خسارة الانتشار (flow-matching)، والخسارة الإدراكية، وتباعد KL (لتنظيم توزيع الكامن)، وخسارة REPA.
التكيف من أجل التوليد اللاحق
لدعم نماذج الانتشار الكامنة (LDM) اللاحقة:
محاذاة الفضاء الكامن: يقوم حد تنظيمي بمحاذاة الكوامن أحادية البعد مع الكوامن الهيكلية عبر تقليل مسافة جيب التمام وتعظيم التشابه الذاتي، مما يحقن المسبقات الهيكلية في الاستعلامات أحادية البعد المرنة.
ضبط المفكك الدقيق: يتم ضبط المفكك بدقة باستخدام كوامن مأخوذة عينة من LDM المدرب (بدلاً من الكوامن الأصلية المشفرة). هذا يسد الفجوة بين التدريب والاستنتاج، مما يقلل من العيوب الناتجة عن أخطاء التنبؤ في العملية التوليدية.
3. المساهمات الرئيسية
الترميز أحادي البعد المتكيف: تقديم مشفر قائم على المحولات مع آليات قائمة على الاستعلام وحذف متغير الطول، مما يسمح بنسب ضغط ديناميكية مصممة خصيصًا لمحتوى الفيديو.
فك التشفير التوليدي: تنفيذ محول انتشار في فضاء البكسل كمفكك، مما ينقل نموذج إعادة البناء من الخرائط الحتمية إلى التوليد الشرطي لاستعادة التفاصيل المفقودة.
التدريب والمحاذاة على مرحلتين: خط تدريب مبتكر يفصل بين تحسين استخراج الميزات والفك التوليدي، مقترنًا بتقنيات محاذاة وضبط دقيق محددة لتحسين الفضاء الكامن لعمليات توليد الفيديو اللاحقة.
4. النتائج التجريبية
تم تقييم النموذج في مهام إعادة بناء وتوليد الفيديو (من الفئة إلى الفيديو ومن النص إلى الفيديو).
أداء إعادة البناء: عند نسب الضغط القياسية (4×16×16)، يحقق One-DVA مقاييس إعادة بناء (PSNR, SSIM, rFVD) تضاهي أو تتفوق على نماذج VAEs ثلاثية الأبعاد (3D-CNN) المتطورة (مثل CogVideoX, HunyuanVideo, Wanx2.1/2.2).
PSNR: 36.48 (مقابل 35.54 لـ HunyuanVideo).
rFVD: 56.96 (الأقل هو الأفضل).
الضغط المتكيف: تظهر التجارب أن أطوال الكامن المتكيفة (بناءً على درجات الحركة) تتفوق على النماذج المرجعية ثابتة الطول. الفيديوهات ذات الحركة العالية تتطلب كوامن أطول للحفاظ على الجودة، بينما يمكن ضغط الفيديوهات البسيطة بشكل أكثر عدوانية.
جودة التوليد: عند استخدامه كبنية أساسية لنماذج الانتشار الكامنة، يحقق One-DVA قيمة gFVD للفئة إلى الفيديو تبلغ 210.9، مما يطابق أداء Hi-VAE + DiT.
تؤكد دراسات الاستئصال (Ablation studies) أن خطوة ضبط المفكك الدقيق أمر بالغ الأهمية؛ حيث يؤدي إهمالها إلى انخفاض كبير في الأداء (gFVD 274.2).
استخدام الكوامن الهيكلية فقط (0% أحادي البعد) يعطي نتائج معقولة ولكنه محدود بسبب نقص المعلومات عالية التردد.
5. الأهمية والادعاءات
يدعي البحث أن One-DVA ينجح في توحيد الترميز أحادي البعد المتكيف وفك التشفيد التوليدي القائم على الانتشار ضمن إطار عمل واحد للمحولات. تكمن أهميته الأساسية في:
الكفاءة: من خلال دعم الترميز متغير الطول، فإنه يحسن استخدام الرموز، ويتجنب الهدر في المحتوى البسيط.
المرونة: يتغلب على الصلابة الهيكلية لشبكات CNN، مما يسمح بمدخلات ومخرجات بأشكال عشوائية عبر آليات الانتباه.
إعادة البناء التوليدي: يعيد صياغة إعادة بناء الفيديو كمهة فرعية توليدية، مما يمكّن النموذج من استعادة التفاصيل المفقودة أثناء الضغط الشديد من خلال تعلم توزيع البيانات.
التوافق اللاحق: يوفر الإطار فضاءً كامنًا ومفككًا تم تنظيمهما وضبطهما بدقة لدعم نماذج الانتشار الكامنة عالية الجودة لتوليد الفيديو.
يخلص المؤلفون إلى أن One-DVA يحقق جودة إعادة بناء تضاهي نماذج VAEs ثلاثية الأبعاد المتقدمة، مع توفير المرونة والقدرات التوليدية المطلوبة للتركيب الفيديوي من الجيل التالي.