← أحدث الأبحاث
🤖 machine learning

LVSA: Training-Free Sparse Attention for Long Video Diffusion

تُعد LVSA آلية انتباه ذات تخلخل كتل (block-sparse attention) لا تعتمد على نموذج محدد ولا تتطلب تدريباً، حيث تجمع بين النوافذ المهيكلة والمرتكزات العالمية الدوارة لتسريع استنتاج نماذج الانتشار للفيديوهات الطويلة بشكل كبير وتوسيع آفاق التوليد مع الحفاظ على جودة الفيديو أو تحسينها، إلى جانب تقديم VQeval لتقييم أكثر دقة للجودة.

المؤلفون الأصليون: Gael Glorian, Ioannis Lamprou, Zhen Zhang, Yujie Yuan, Hongsheng Liu

نُشر 2026-06-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Gael Glorian, Ioannis Lamprou, Zhen Zhang, Yujie Yuan, Hongsheng Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول إخراج فيلم باستخدام مساعد ذكاء اصطناٍعي ذكي للغاية، ولكنه يشعر ببعض الارتباك. هذا المساعد بارع في صنع مقاطع قصيرة، ولكن عندما تطلب منه صنع فيلم طويل (مئات الإطارات)، يبدأ في الذعر.

إليك المشكلة التي تحلها هذه الورقة البحثية، مشروحة من خلال بعض القصص البسيطة:

1. المشكلة: "أمين المكتبة المنهك"

تعمل نماذج فيديو الذكاء الاصطناعي الحالية مثل أمين مكتبة يتعين عليه فحص كل كتاب على كل الرفوف للإجابة على سؤال واحد فقط.

  • التكلفة: إذا كان لديك 100 إطار من الفيديو، فعلى أمين المكتبة قراءة 100 كتاب. إذا كان لديك 1,000 إطار، فعليه قراءة 1,000 كتاب. ولكن إليك الخدعة: لكي يصنع "اتصالاً جيداً"، يتعين عليه مقارنة كل كتاب بكل كتاب آخر. العمل لا يتضاعف فحسب؛ بل ينفجر (بشكل تربيعي). وهذا يجعل إنتاج الفيديوهات الطويلة بطيئاً ومكلفاً للغاية.
  • خلل "التجمد": عندما يتعب أمين المكتبة كثيراً (لأن الفيديو طويل جداً)، يتوقف عن التفكير بشكل إبداعي. يبدأ ببساطة في تكرار نفس الصفحة مراراً وتكراراً. في عالم الفيديو، تتوقف الشخصيات عن الحركة، ويتوقف الخلفية عن التغير، ويصبح الفيديو عبارة عن فوضى "متجمدة" أو "متكررة".

2. الحل: LVSA (الـ "مرشد السياحي الذكي")

يقدم المؤلفون LVSA (الانتباه المتناثر للفيديو الطويل - Long Video Sparse Attention). فكر في هذا كاستبدال لأمين المكتبة المنهك بـ مرشد سياحي ذكي.

بدلاً من قراءة كل كتاب في المكتبة، يستخدم المرشد استراتيجية ذكية:

  • النافذة المحلية: بالنسبة للمشهد الحالي، ينظر المرشد فقط إلى المحيط المباشر (الـ "نافذة المحلية"). هذا يحافظ على دقة التفاصيل وسلاسة الحركة.
  • المرتكزات العالمية: لتذكر الصورة الكبيرة، يختار المرشد بعض "المعالم" (المرتكزات العالمية) الموزعة في أرجاء الفيلم. يقوم بفحص هذه المعالم بشكل دوري للتأكد من أن القصة لم تخرج عن مسارها.
  • الإزاحة الدوارة: هنا تكمن الخدعة السحرية. في الطريقة القديمة، كان المرشد يفحص دائماً نفس المعالم. هذا تسبب في خلل "التجمد" لأن المرشد أصبح يشعر بالملل من تلك المواقع المحددة. تقوم تقنية LVSA بـ تدوير هذه المعالم. في لحظة ما، يفحص بداية الفيلم؛ وفي اللحظة التالية، يفحص نقطة لاحقة قليلاً. هذا يبقي المرشد متجدداً ويضمن أن الفيلم بأك its يبدو حياً، وليس مجرد حلقة ثابتة.

والأفضل من ذلك كله: لا يحتاج المرشد إلى إعادة تدريب. يمكنك ببساطة منح هذه الاستراتيجية الجديدة للذكاء الاصطناعي الموجود، وسيعمل فوراً.

3. النتائج: أسرع، أطول، وأفضل

اختبر الفريق هذا "المرشد السياحي الذكي" على ثلاثة نماذج مختلفة قوية من الذكاء الاصطناٍعي (Wan و HunyuanVideo) ووجدوا أن:

  • السرعة: جعلت عملية إنشاء فيديوهات طويلة أسرع بـ 3 مرات (وأحياناً أكثر) من الطريقة القديمة.
    • تشبيه: إذا كانت الطريقة القديمة تستغرق 50 دقيقة لصنع مقطع طويل، فإن الطريقة الجديدة تنجزه في حوالي 16 دقيقة.
  • القدرة على التنفيذ: بعض الفيديوهات كانت مستحيلة الصنع سابقاً لأنها تتطلب الكثير من ذاكرة الكمبيوتر (نفد "مكتب" أمين المكتبة). لقد قللت تقنية LVSA من الذاكرة المطلوبة لدرجة أن هذه الفيديوهات الطويلة يمكن الآن صنعها على شريحة كمبيوتر قياسية واحدة.
  • الجودة: الفيديوهات أكثر ديناميكية. تتحرك الشخصيات بشكل طبيعي بدلاً من التجمد.
    • اختبار "التجمد": أنشأ المؤلفون أداة تسجيل جديدة تسمى VQeval. أدوات التسجيل القديمة كانت تشبه المعلم الذي يعطي درجة "+A" لطالب يكتفي بالتحديق في الحائط لأنه "متسق". أما VQeval فهو معلم أكثر صرامة، يعطي درجة "F" للفيديو المتجمد ودرجة "A" للفيديو الذي يحتوي على حركة حقيقية. وقد حصلت تقنية LVSA على درجة "A".

4. الاختبار الواقعي

لم يختبر الفريق هذه التقنية على نوع واحد من أجهزة الكمبيوتر فحسب، بل أظهروا أنها تعمل على:

  • وحدات معالجة الرسومات (GPUs): وهي الشرائح القوية القياسية المستخدمة في الذكاء الاصطناعي.
  • وحدات المعالجة العصبية (NPUs): وهي شرائح متخصصة موجودة في بعض الأجهزة الحديثة، مما يثبت أن هذه الطريقة مرنة بما يكفي للعمل على أجهزة مختلفة.

الملخص

LVSA هو ترقية مجانية وسهلة التركيب (Plug-and-play) لذكاء الفيديو الاصطناعي. إنها تمنع الذكاء الاصطناعي من الشعور بـ "التعب" والتجمد أثناء الفيديوهات الطويلة. تفعل ذلك من خلال جعل الذكاء الاصطناعي يركز على الحركة المباشرة مع فحص "معالم" دوارة بين الحين والآخر للحفاظ على حركة القصة. النتيجة هي فيديوهات أسرع في الإنشاء، وتناسب أجهزة كمبيوتر أصغر، وتبدو بالفعل كصور متحركة بدلاً من شرائح ثابتة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →