← أحدث الأبحاث
🤖 machine learning

MonarchRT: Efficient Attention for Real-Time Video Generation

يقدم Monarch-RT بارامتريّة انتباه مهيكلة باستخدام مصفوفات Monarch للتغلب على التكلفة التربيعية والقيود التمثيلية لطرق الانتباه المتفرقة الحالية في توليد الفيديو في الوقت الفعلي، محققاً تشتتاً يصل إلى 95% دون فقدان الجودة وتمكيناً لتوليد 16 إطاراً في الثانية على بطاقة RTX 5090 واحدة من خلال التفوق على نوى FlashAttention المتطورة.

المؤلفون الأصليون: Krish Agarwal, Zhuoming Chen, Cheng Luo, Yongqi Chen, Haizhong Zheng, Xun Huang, Atri Rudra, Beidi Chen

نُشر 2026-02-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Krish Agarwal, Zhuoming Chen, Cheng Luo, Yongqi Chen, Haizhong Zheng, Xun Huang, Atri Rudra, Beidi Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول رسم مشهد سينمائي، إطارًا تلو الآخر، في الوقت الفعلي. لديك فنان سحري (الذكاء الاصطناعي) ينظر إلى الإطار الحالي والإطارات السابقة ليقرر ما الذي سيرسمه بعد ذلك.

المشكلة هي أن هذا الفنان دقيق للغاية ولكنه بطيء للغاية. لكي يرسم الإطار التالي، فإنه ينظر إلى كل بكسل في المشهد الحالي ويقارنه بـ كل بكسل في الماضي. إذا كان لديك 1,000 بكسل، فسيقوم بمليون مقارنة. هذا ما يسمى بـ "التكلفة التربيعية" (Quadratic cost)، وهو أمر يشبه محاولة تعريف كل شخص في الملعب بكل شخص آخر قبل بدء المباراة. هذا يستغرق وقتاً طويلاً جداً بالنسبة للفيديو في الوقت الفعلي.

لحل هذه المشكلة، حاول باحثون سابقون إخبار الفنان: "مهلاً، لست بحاجة للنظر إلى الجميع! فقط انظر إلى الأشخاص الجالسين بجانبك (الجيران المحليين) أو الأشخاص الذين تعرفهم جيداً (المطابقات الدلالية)." أطلقوا على ذلك اسم الاهتمام المتناثر (Sparse Attention).

لكن هنا تكمن العقبة: في توليد الفيديو في الوقت الفعلي، تفشل هذه الطريقة "الكسولة". لماذا؟ لأن الفيديو ليس مجرد جيران أو أصدقاء قدامى. الفيديو يتعلق بـ الإيقاع (نبض الموسيقى، تدفق الحركة) و المفاجآت المفاجئة (سيارة تنعطف عند زاوية).

  • إذا نظرت فقط إلى الجيران، فستفقد الإيقاع.
  • إذا نظرت فقط إلى "الأشخاص المعروفين"، فستفقد المفاجأة.
  • النتيجة؟ يبدو الفيديو متقطعاً، ضبابياً، أو تتحول الشخصيات فيه إلى أشكال غريبة.

ظهور MonarchRT (المايسترو الذكي)

أدرك مؤلفو هذه الورقة البحثية أن الفنان لا يحتاج إلى النظر إلى كل شخص بشكل فردي، ولا يحتاج إلى تجاهل معظم الناس. إنه بحاجة إلى طريقة منظمة للنظر إلى الحشد بأكွယ် في وقت واحد.

لقد قدموا MonarchRT، الذي يستخدم خدعة رياضية تسمى مصفوفات Monarch. إليك كيف يعمل ذلك، باستخدام تشبيهات بسيطة:

1. "الشبكة" مقابل "الكومة الفوضوية" (المحاذاة)

تخيل أن إطارات الفيديو عبارة عن شبكة ضخمة من قطع الليغو (Lego).

  • الطرق القديمة حاولت التقاط قطع عشوائية أو فقط القطع الموجودة في كومة صغيرة. هذا أدى إلى كسر هيكل قلعة الليغو.
  • MonarchRT يدرك أن قطع الليغو مرتبة في طبقات محددة (الزمن، الارتفاع، العرض). هو يقول: "دعونا نجمع القطع حسب طبقاتها الطبيعية".
  • التشبيه: بدلاً من التقاط حفنة عشوائية من الرمل، يقوم MonarchRT بالتقاط طبقة رمل مثالية ومنظمة مسبقاً. هذا يضمن الحفاظ على "إيقاع" الفيديو (الهيكل الدوري) بشكل مثالي، حتى لو تخطينا النظر إلى 95% من الحبيبات الفردية.

2. استراتيجية "البلاط" (Monarch المبلط)

أحياناً، حتى الطبقة المثالية قد تحتوي على بعض القطع الغريبة والفريدة التي لا تتناسب مع النمط (مثل انفجار مفاجئ في الفيلم).

  • الطرق القديمة كانت إما ستتجاهل هذه القطع الغريبة (مما يجعل الفيديو يبدو مزيفاً) أو تحاول النظر إلى كل قطعة (مما يجعل العملية بطيئة).
  • MonarchRT يستخدم نهجاً مبلطاً (Tiled). تخيل أن الفيديو عبارة عن أرضية ضخمة مغطاة بالبلاط.
    • معظم البلاطات متطابقة (السماء، العشب). يتعامل MonarchRT مع هذه الأجزاء بقاعدة بسيطة وسريعة.
    • ولكن إذا كان هناك بلاطة تحتوي على جسم غريب (سيارة)، فإن MonarchRT يقوم بعمل "زوم" أو تقريب على تلك البلاطة المحددة فقط للتعامل مع التفاصيل.
  • الفائدة: إنه يحقق أفضل ما في العالمين. فهو سريع لأنه يعامل 95% من الفيديو بقواعد بسيطة، لكنه ذكي بما يكفي للتركيز على الأجزات المهمة والغريبة.

3. "البروفة" (الضبط الدقيق)

عادةً، لضبط هذه الرياضيات بشكل صحيح، يجب على الكمبيوتر القيام بالكثير من "البروفات" (التكرارات) في كل مرة يرسم فيها إطاراً. وهذا يستغرق وقتاً طويلاً جداً.

  • خدعة MonarchRT: لقد علموا الفنان كيف يقوم بهذه الرياضيات أثناء مرحلة التدريب. الآن، عندما يحين وقت توليد الفيديو، لا يحتاج الفنان إلى إجراء بروفات. هو فقط يقوم بذلك في خطوة واحدة فقط.
  • النتيجة: إنه مثل موسيقي كان يحتاج إلى ضبط آلاته لمدة 10 دقائق قبل العزف. الآن، هو فقط يلتقط الآلة ويعزف ببراعة فوراً.

الختام الكبير: سحر الوقت الفعلي

بفضل هذه الحيل الثلاث (التجميع الذكي، التبليط، والتنفيذ في خطوة واحدة)، حقق MonarchRT شيئاً كان يُعتقد سابقاً أنه مستحيل:

  • السرعة: يعمل بسرعة تتراوح بين 1.4 إلى 11.8 ضعفاً أسرع من أسرع الطرق الحالية (FlashAttention).
  • الجودة: يحافظ على 95% من التناثر (Sparsity) (أي تجاهل 95% من البيانات) دون فقدان أي جودة للفيديو.
  • الوقت الفعلي: على بطاقة رسوميات قوية للمستهلكين (RTX 5090)، يمكنه توليد الفيديو بمعدل 16 إطاراً في الثانية. هذا يعني أنه يمكنك كتابة نص، وسيقوم الذكاء الاصطناعي بتوليد مشهد سينمائي بسرعة كتابتك، دون أي تأخير.

باختاً: MonarchRT يشبه الترقية من أمين مكتبة يضطر للمشي في كل الممرات للعثور على كتاب، إلى أمين مكتبة يعرف بالضبط في أي رف يوجد الكتاب، ويمكنه التقاط قسم كامل من الكتب دفعة واحدة، وقد حفظ تخطيط المكتبة بحيث لا يضطر أبداً للتوقف والتفكير. إنه يجعل توليد الفيديو بالذكاء الاصطناعي في الوقت الفعلي سريعاً، وسلساً، وعالي الجودة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →