← أحدث الأبحاث
🤖 machine learning

SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning

تقترح الورقة البحثية SpargeAttention2، وهي طريقة انتباه متناثرة قابلة للتدريب لنماذج الانتشار تجمع بين قاعدة قناع هجينة (Top-k+Top-p) وهدف ضبط دقيق مستوحى من التقطير لتحقيق تشتت بنسبة 95% وتسريع بمقدار 16.2 ضعفًا مع الحفاظ على جودة التوليد.

المؤلفون الأصليون: Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مخرج في موقع تصوير فيلم ضخم. لديك آلاف الممثلين (الرموز/Tokens) على الشاشة، وكل واحد منهم يحاول التحدث مع كل الآخرين في نفس الوقت ليفهموا تفاصيل المشهد. هكذا تعمل مولدات الفيديو القياسية للذكاء الاصطناعي: باستخدام "الانتباه الكامل" (Full Attention).

بينما يضمن هذا عدم تفويت أي تفصيل، إلا أنه مرهق للغاية. الأمر يشبه مطالبة كل ممثل بأن يهمس بسر لكل ممثل آخر في وقت واحد. الضجيج يكون صاخباً، وتكلفة الطاقة هائلة، والعملية بطيئة بشكل مؤلم.

SpargeAttention2 هي طريقة أذكى لتشغيل موقع التصوير هذا. إنها طريقة تُعلم الذكاء الاصطناعي كيف يتجاهل "الثرثرة" ويركز فقط على "المحادثات المهمة"، مما يجعل توليد الفيديو أسرع بـ 16 مرة دون فقدان أي جودة.

إليك كيف يعمل ذلك، مقسماً إلى ثلاثة مفاهيم بسيطة:

1. المشكلة: كتاب القواعد "الذي يناسب الجميع" يفشل

حاولت الأساليب السابقة توفير الوقت باستخدام قاعدتين بسيطتين لتحديد من يتحدث مع من:

  • القاعدة أ (Top-k): "دع أفضل 10% من الممثلين يتحدثون."
  • القاعدة ب (Top-p): "دع الممثلين يتحدثون حتى نسمع 90% من إجمالي حجم الصوت."

اكتشفت الورقة البحثية أن هذه القواعد تنهار في سيناريوهين محددين:

  • مشكلة "الحشد المتساوي": تخيل مشهداً حيث يكون الجميع مهمين بالتساوي (مثل حفلة صاخبة). إذا استخدمت القاعدة أ (Top-k)، فقد تختار 10 أشخاص فقط، متجاهلاً حقيقة أن الجميع لديه شيء ليقوله بالفعل. أنت هنا تفقد السياق.
  • مشكلة "الشخص الصاخب": تخيل ممثلاً واحداً يصرخ بصوت عالٍ جداً لدرجة أنه يغطي على الجميع (بؤرة انتباه/Attention Sink). إذا استخدمت القاعدة ب (Top-p)، فقد تتوقف عن الاستماع بعد سماع هذا الشخص الصاخب فقط، ظناً منك أنك سمعت ما يكفي، فتفقد الحوارات الهادئة ولكن الحاسمة التي تحدث في الخلفية.

الحل: يستخدم SpargeAttention2 "كتاب قواعد هجين" (Hybrid Rulebook). فهو يجمع بين القاعدتين، ويقول: "احتفظ بأفضل 10% و احتفظ بما يكفي من الأشخاص لتغطية 90% من حجم الصوت". هذا يضمن أنه سواء كان المشهد حفلة صاخبة أو دراما مع شرير صاخب، فإن الذكاء الاصطناعي لن يفقد الأجزاء المهمة أبداً.

2. فخ التدريب: لماذا "التعلم من الصفر" يفسد الفيلم

عادةً، لتعليم الذكاء الاصطناعي كيف يكون أسرع، تعرض عليه مجموعات بيانات جديدة وأصغر وتقول له: "تعلم كيف تفعل هذا بشكل أسرع". لكن المؤلفين وجدوا فخاً:

  • الفخ: إذا علمت الذكتا الاصطناعي باستخدام الطرق القياسية على بيانات جديدة، سيبدأ في نسيان "شخصيته" الأصلية وأسلوبه عالي الجودة الذي تعلمه أثناء مرحلة التدريب المسبق الضخمة. الأمر يشبه أخذ طاهٍ عالمي وإجباره على الطبخ في مطبخ رخيص بمكونات سيئة؛ سيبدأ الطعام في المذاق بشكل أسوأ، حتى لو كان يطبخ بشكل أسرع.
  • الحل (التقطير/Distillation): بدلاً من تعليم الذكاء الاصطناعي التكيف مع مجموعة البيانات الجديدة والأصغر، استخدموا نهج "المعلم والتلميذ" (Teacher-Student):
    • المعلم: الذكاء الاصطناعي الأصلي، البطيء والمثالي (بكامل الانتباه).
    • التلميذ: الذكاء الاصطناعي الجديد، السريع (بالانتباه المتفرق/Sparse Attention).
    • الخدعة: التلميذ لا ينظر إلى البيانات ليتعلم؛ بل ينظر إلى المعلم. يحاول التلميذ محاكاة حركات وقرارات المعلم بدقة. بهذه الطريقة، يتعلم التلميذ كيف يكون سريعاً دون أن ينسى كيف يكون جيداً. إنه يشبه ممثلًا تلميذًا يراقب ممثلًا بارعًا، ويقلد كل حركة يقوم بها ليتعلم الدور، بدلاً من مجرد قراءة النص.

3. النتيجة: الخدعة السحرية

من خلال الجمع بين "كتاب القواعد الهجين" (القناع الذكي) و**"نهج المعلم والتلميذ"** (التقطير)، يحقق SpargeAttention2 شيئاً سحرياً:

  • 95% صمت: يتجاهل 95% من الثرثرة غير الضرورية بين الممثلين.
  • سرعة 16 ضعفاً: لأنه يستمع فقط إلى الـ 5% المهمة، يتم إنتاج الفيلم أسرع بـ 16 مرة.
  • لا فقدان في الجودة: نظرًا لأنه استخدم "المعلم" لتوجيهه، يبدو الفيديو النهائي واضحاً، متماسكاً، وجميلاً تماماً مثل النسخة البطيئة.

ملخص التشبيه

فكر في الطريقة القديمة كأنها اجتماع في قاعة مدينة مزدحمة حيث يصرخ الجميع في وقت واحد. إنه دقيق ولكنه يستغرق وقتاً طويلاً جداً.
أما أساليب "التشتت" السابقة فكانت تشبه مدير جلسة يقوم بإسكات أول 90% من الناس، مما يؤدي بالخطأ إلى إسكات العمدة أو أكثر الأشخاص إزعاجاً.
SpargeAttention2 يشبه مدير جلسة ذكي يعرف بالضبط من يحتاج للتحدث بناءً على الموقف (القاعدة الهجينة) وقد تم تدريبه من خلال مراقبة مدير الجلسة الأصلي والمثالي (التقطير). النتيجة؟ اجتماع ينتهي في دقائق ولكنه يغطي كل نقطة مهمة بشكل مثالي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →