← أحدث الأبحاث
🤖 machine learning

Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

يُعد "Faster Flash Decoding" (FFD) إطار عمل للتصميم المشترك بين الخوارزمية والعتاد، وهو لا يتطلب تدريباً، ويحقق تسريعاً على مستوى النواة يصل إلى 11.6 ضعفاً ويتوسع ليصل إلى أطوال سياق تبلغ 256 ألفاً، وذلك من خلال دمج الاختيار والحوسبة في نواة واحدة واستخدام استراتيجية "top-delta" لضمان التشتت المتكيف مع التوزيع، كل ذلك مع الحفاظ على دقة النموذج.

المؤلفون الأصليون: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

نُشر 2026-09-02
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي، أصبحت البرامج الحاسوبية الحديثة المعروفة باسم النماذج اللغوية الكبيرة ماهرة بشكل ملحوظ في فهم وتوليد اللغة البشرية. تعمل هذه الأنظمة من خلال التنبؤ بالكلمة التالية في الجملة، رمزاً واحداً تلو الآخر (token by token)، لبناء استجابة متماسكة خطوة بخطوة. ومع ذلك، مع ازدياد قدرات هذه النماذج، فإنها تواجه عقبة مادية كبيرة عندما تُطلب منها معالجة مستندات طويلة جداً أو محادثات مطولة. فكلما زاد السياق الذي يحتاج النموذج لتذكره، زادت كمية البيانات التي يجب عليه نقلها باستمرار بين ذاكرته الداخلية السريعة ومساحة التخزين الرئيسية لديه. هذا التحرك المستمر للبيانات يخلق عنق زجاجة، يشبه محاولة ملء مسبح باستخدام خرطوم حديقة بينما الصرف مفتوح على مصراعيه. يقضي الحاسوب معظم وقته في انتظار وصول المعلومات بدلاً من التفكير الفعلي، مما يبطئ العملية برمتها ويحد من كمية النصوص التي يمكن للنموذج التعامل معها في وقت واحد.

ولحل هذه المشكلة، طور باحثون من جامعة فودان ومعهد شنغهاي للابتكار طريقة جديدة تسمى "فك التشفير الوميضي الأسرع" (Faster Flash Decoding). يعالج نهجهم المشكلة من خلال تغيير كيفية اتخاذ النموذج للقرار بشأن قطع المعلومات التي يجب الاحتفاظ بها وتلك التي يجب تجاهلها. فبدلاً من محاولة قراءة كل كلمة في مستند ضخم للعثور على الكلمات ذات الصلة، يستخدم النظام الجديد اختصاراً ذكياً؛ حيث يقوم أولاً بإنشاء "رسم تخطيطي" (sketch) صغير ومضغوط لتاريخ المحادثة بأكم، وهذا الرسم صغير جداً لدرجة أن الحاسوب يمكنه مسحه ضوئياً بشكل فوري تقرياً. ومن خلال النظر في هذا الرسم التخطيطي، يمكن للنظام تحديد الأجزاء التي من المرجح أن تكون مهمة في التاريخ والتي يمكن تجاهلها بأمان بسرعة. وفقط بعد هذا المسح السريع، يسترجع النموذج النسخة الكاملة والمفصلة من الأجزاء المختارة لإجراء الحساب النهائي. تسمح هذه العملية المكونة من خطوتين للنموذج بتجاوز كميات هائلة من البيانات غير ذات الصلة دون فقدان القدرة على فهم المعنى الجوهري للنص.

اختبر الباحثون هذه الطريقة على بطاقات رسوميات قوية، وهي النوع المستخدم في الألعاب عالية المستوى والحوسبة العلمية، ووجدوا أنها أسرع بشكل كبير من التقنيات القياسية الحالية. فعند معالجة سياق يبلغ 256,000 رمز، قلل النظام الجديد الوقت الذي يستغرقه توليد رمز واحد من أكثر من ميلي ثانية واحدة إلى مجرد جزء ضئيل من ذلك. ومن حيث السرعة الإجمالية، ولد النظام نصوصاً أسرع بمعدل يصل إلى 2.37 مرة من الطرق السابقة مع الحفاظ على نفس مستوى الدقة. وتحقق الفريق من هذا الأداء عبر مجموعة واسعة من المهام، بما في ذلك الاستنتاج المعقد واسترجاع حقائق محددة من مستندات طويلة، مؤكدين أن مكاسب السرعة لم تأتِ على حساب الذكاء. ويعمل النظام دون الحاجة إلى إعادة تدريب النموذج، مما يعني أنه يمكن توصيله بأنظمة الذكاء الاصطناعي الحالية فوراً لتحسين كفاءتها.

ويتمثل الابتكار الرئيسي في هذا العمل في الطريقة المحددة التي يفلتر بها النظام المعلومات. تعتمد الطرق التقليدية غالباً على قواعد ثابتة، مثل الاحتفاظ بأهم عشر كلمات فقط، أو حسابات معقدة تتطلب من النظام بأكمله التوقف والمزامنة قبل المتابعة. أما الطريقة الجديدة فتستخدم عتبة ديناميكية تتكيف مع التدفق الطبيعي للمحادثة؛ فهي تبحث عن الكلمات المهمة بشكل ملحوظ مقارنة بالكلمة الأكثر أهمية في السياق الحالي، مما يسمح لها بتعديل مقدار ما تحتفظ به بناءً على مدى تركيز الانتباه. هذا المرونة، جنباً إلى جنب مع استخدام بيانات منخفضة الدقة للغاية للمسح الأولي، تسمح للحاسوب بتجاوز عنق زجاجة الذاكرة الذي أعاق معالجة السياق الطويل لفترة طويلة. والنتيجة هي نظام يمكنه التعامل مع كميات هائلة من النصوص بسرعة كان يُعتقد سابقاً أنها مستحيلة دون التضحية بجودة الإجابات التي يقدمها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →