ملخص تقني: انتباه نصف قطر الرمز (Token Radius Attention) لتوليد الفيديو بكفاءة
1. بيان المشكلة
أصبحت نماذج محولات الانتشار للفيديو (VDiTs) هي البنية المهيمنة لتوليد الفيديو عالي الدقة، حيث تعتمد على آلية الانتباه ثلاثي الأبعاد الكثيف (dense 3D self-attention) لالتقاط التبعيات المكانية والزمانية المعقدة. ومع ذلك، تترتب على الانتباه الكثيف تكلفة حسابية تربيعية (O(N2)) بالنسبة لعدد رموز الفيديو N، مما يخلق عنق زجاجة كبيرًا في الاستدلال (inference) يعيق التوسع والنشر.
تستخدم النهج الحالية للتخفيف من هذه التكلفة آليات انتباه متفرقة (sparse attention)، تُصنف أساسًا إلى طرق على مستوى الرأس (head-level) وطرق على مستوى الكتلة (block-level).
- طرق مستوى الرأس: تخصص أنماطًا مكانية أو زمانية مهيكلة لرؤوس انتباه فردية.
- طرق مستوى الكتلة: تختار أزواج (استعلام-مفتاح) مهمة من الكتل.
القصور الجوهري: تشترك كلتا الطريقتين عادةً في ميزانية حسابية واحدة (مثل كثافة استبقاء ثابتة أو نصف قطر ثابت) عبر جميع رموز الاستعلام (query tokens) داخل الرأس أو الكتلة. هذا الافتراض بـ "التخصيص المشترك" يتعارض مع الطبيعة الجوهرية للانتباه الذاتي، حيث يتم إجراء تطبيع "Softmax" بشكل مستقل لكل استعلام. ونتيجة لذلك، فإن الاستعلامات ذات توزيعات الانتباه المركزة (الإنتروبيا المنخفضة) تهدر الحسابات إذا أُجبرت على الانتباه إلى العديد من المفاتيح، بينما قد تفقد الاستعلامات ذات التوزيعات المنتشرة (الإنتروبيا العالية) التفاعلات الحرجة إذا كانت الميزانية المشتركة صغيرة جدًا. هذا عدم التطابق يؤدي إلى تدهور جودة التوليد أو الفشل في تحقيق الكفاءة المثلى.
2. المنهجية: انتباه نصف قطر الرمز (TRA)
يقترح المؤلفون انتباه نصف قطر الرمز (Token Radius Attention - TRA)، وهو إطار عمل خالٍ من التدريب يحقق تفرقًا (sparsity) هيكليًا خاصًا بكل رمز دون الحاجة إلى ترتيب (ranking) صريح للمفاتيح لكل استعلام. يعمل TRA بناءً على رؤيتين تجريبيتين مستمدتين من تحليل أنماط انتباه VDiT.
الرؤية الأولى: تفرق الانتباه الخاص بالرمز
لاحظ المؤلفون أن "الكثافة المستبقاة" (نسبة المفاتيح الأعلى ترتيبًا المطلوبة للحفاظ على كتلة انتباه مستهدفة) تتباين بمقدار عدة رتب مقدارية عبر الاستعلامات داخل نفس الطبقة والرأس. والأهم من ذلك، وجدوا علاقة لوغاريتمية خطية قوية بين هذه الكثافة المستبقاة وبين إنتروبيا الانتباه.
- الآلية: تشير الإنتروبيا العالية إلى توزيع انتباه منتشر يتطلب ميزانية رموز أكبر، بينما تشير الإنتروبيا المنخفضة إلى توزيع مركز يتطلب رموزًا أقل.
- التنفيذ: يستخدم TRA تقريبًا تحليليًا لربط إنتروبيا الاستعلام مباشرة بميزانية خاصة بالرمز (B^≈τexp(Hi)/N)، مما يلغي الحاجة إلى عمليات فرز أو ترتيب مكلفة لكل استعلام.
الرؤية الثانية: نمط انتباه نصف قطر الرمز
لاحظ المؤلفون أن التفاعلات المهيمنة للاستعلام تشكل جيرانًا دائرية ممركزة حول الاستعلام في النطاق المكاني. يتناقص احتمال الانتباه الموحد تقريبًا بشكل أسي مع المسافة المكانية ثنائية الأبعاد.
- الآلية: بدلاً من اختيار أعلى k من المفاتๆ بشكل عشوائي، يحول TRA ميزانية الرمز القياسية إلى نصف قطر مكاني.
- التلاشي الزماني: للتعامل مع تسلسلات الفيديو، يتم تعديل نصف القطر المكاني بواسطة قاعدة تلاشي المسافة الزمانية (ϕ(δ)=exp(−γδ))، مما يخلق بنية دعم مكانية-زمانية منتظمة.
مسار عمل TRA
- الإنتروبيا إلى الميزانية: خلال مرحلة "الإحماء" (warm-up) الأولية الكثيفة، يحسب TRA إنتروبيا الانتباه لكل استعلام. يتم بعد ذلك ربط هذه الإنتروبيا بميزانية رموز محددة.
- الميزانية إلى نصف القطر: يتم تحويل الميزانية إلى نصف قطر أساسي خاص بالاستعلام. ثم يتم تعديل هذا النصف قطر لكل إطار بناءً على المسافة الزمانية لتشكيل قناع قرص ثنائي الأبعاد.
- التنفيذ الفعال:
- تخطيط مهيمن على البلاطات (Tile-Major Layout): يتم إعادة ترتيب رموز الفيديو بترتيب مهيمن على البلاطات لضمان أن الرموز المتجاورة مكانيًا (التي تقع ضمن نصف القطر) تكون متصلة في التسلسل.
- نوى CUDA مدمجة (Fused CUDA Kernels): تقوم نواة مخصصة بدمج حساب المسافة، ومقارنة نصف القطر، وتقليم الكتل (block pruning)، والتصويت على الرموز لتحويل أقنعة نصف قطر الرموز غير المنتظمة إلى أقنعة كثيفة-متفرقة (block-sparse) منتظمة متوافقة مع FlashInfer.
- إعادة الاستخدام عبر الخطوات: يتم حساب الإنتروبيا فقط خلال مرحلة الإحماء وإعادة استخدامها للخطوات المتفرقة اللاحقة، بالاستفادة من استقرار أنماط الإنتروبيا الملحوظ عبر خطوات إزالة الضجيج (denoising steps).
3. المساهمات الرئيسية
- اكتشاف التفرق الخاص بالرمز: كشفت الورقة أن الكثافة المستبقاة تتباين بشكل كبير عبر الاستعلامات ولكنها تتبع علاقة لوغاريتمية خطية يمكن التنبؤ بها مع إنتروبيا الانتباه، وأن التفاعلات المهيمنة تتبع نمط نصف قطر ممركز حول الاستعلام.
- انتباه نصف قطر الرمز (TRA): إطار عمل خالٍ من التدريب يحول متطلبات الحساب الخاصة بالاستعلام إلى دعامات مكانية-زمانية منتظمة عبر مسار (الإنتروبيا ← الميزانية ← نصف القطر)، متجنبًا عملية الترتيب الصريح للمفاتيح.
- التصميم المشترك للنظام: صمم المؤلفون نواة قناع نصف القطر ونواة إنتروبيا مدمجة لتقليل العبء الإضافي، مما يتيح التنفيذ الفعال على الأنظمة الخلفية للكثافة-المتفرقة (block-sparse backends).
- التحقق الشامل: تم التحقق من صحة TRA عبر سبع إعدادات لـ Wan2.1 وWan2.2 وHunyuanVideo (تتراوح من 1.3 مليار إلى 14 مليار معلمة) لكل من مهام نص-إلى-فيديو (T2V) وصورة-إلى-فيديو (I2V).
4. النتائج التجريبية
تم تقييم TRA مقابل الانتباه الكثيف وثلاثة نماذج أساسية متفرقة خالية من التدريب (SVG، وSVG2، وRadial) باستخدام مجموعة اختبار VBench.
- الكفاءة: يحتفظ TRA بـ 9% إلى 19% فقط من تفاعلات الانتباه. ويحقق تسريعًا يتراوح بين 1.56× و2.05× مقارنة بالنماذج الكثيفة عبر جميع الإعدادات المختبرة. على سبيل المثال، في HunyuanVideo-13B، حقق تسريعًا قدره 2.05× لمهام T2V و2.02× لمهام I2V.
- الجودة: يحافظ TRA على جودة توليد تنافسية، وغالبًا ما يحقق أفضل درجات VBench الإجمالية بين الطرق المتفرقة. وفي نموذج Wan2.1-14B T2V، يكاد يطابق درجة الانتباه الكثيف مع توفير تسريع قدره 1.75×.
- الدقة (Fidelity): تظهر النتائج النوعية أن TRA يحافظ بشكل أفضل على هوية الموضوع، والسلامة الهيكلية، والاتساق الزماني مقارنة بالطرق المتفرقة الأخرى، مع ظهور عيوب أقل مثل الوميض (flickering) أو التشوه.
- دراسات الاستئصال (Ablation Studies): أدى إزالة ربط الميزانية الموجه بالإنتروبيا أو قناع نصف القطر (استبداله بمسافة أحادية البعد) إلى تدهور الأداء بشكل كبير، مما يؤكد ضرورة كل من التكيف الخاص بالرمز والدعم المكاني المهيكل.
5. الأهمية والادعاءات
تدعي الورقة أن "انتباه نصف قطر الرمز" يعالج عدم كفاءة جوهري في نماذج الانتباه المتفرقة الحالية: وهي عدم التطابق بين ميزانيات التخصيص المشتركة ومتطلبات الانتباه الخاصة بكل رمز. من خلال الاستفادة من العلاقة الجوهرية بين الإنتروبيا والتفرق في الانتباه، يحقق TRA مقايضة مواتية بين الجودة والكفاءة دون الحاجة إلى تدريب إضافي أو آليات ترتيب فورية معقدة.
يضع المؤلفون TRA كتقنية مكملة لطرق التسريع الأخرى (مثل التخزين المؤقت أو التكميم) التي تركز تحديدًا على تقليل التكلفة التربيعية لتفاعل الاستعلام-المفتاح داخل طبقات الانتباه المنفذة. يوضح العمل أن التكيف على مستوى الرمز يمكن تحقيقه بكفاءة من خلال قناع نصف قطر مهيكل، مما يوفر مسارًا قابلًا للتوسع لنشر نماذج توليد الفيديو عالية الدقة.