← أحدث الأبحاث
🤖 machine learning

Hardware-Aware FP4 FlashAttention-4

تقدم هذه الورقة البحثية تقنية FlashAttention-4 بنظام FP4 المدركة للأجهزة، وهي طريقة تتغلب على قيود نوى التنسور (tensor cores) من نوع FP4 في معمارية Blackwell عبر توظيف تقنية Direct-P للاستدلال غير السببي ومسار سببي مع تدرجات FP8، مما يحقق سرعة في إنتاجية التمرير الأمامي تصل إلى 2.13 ضعفاً وسرعة في تحديثات التدريب على وحدة معالجة رسومية واحدة تصل إلى 1.14 ضعفاً، مع تجنب مشكلات التباعد الملحوظة في تدريب MXFP4.

المؤلفون الأصليون: Robert Hu

نُشر 2026-09-04✓ Author reviewed
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Robert Hu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي، تعتمد أقوى النماذج على آلية تسمى "الانتباه" (attention) لفهم السياق. تخيل قارئاً يمسح وثيقة طويلة بعينيه؛ يسمح "الانتباه" للنموذج بالتركيز على الكلمات الأكثر صلة في الجملة مع تجاهل الباقي، وربط الأفكار عبر مسافات شاسعة. وللقيام بذلك، يقوم الحاسوب بسلسة هائلة من الحسابات، حيث يقارن كل كلمة بكل كلمة أخرى لتحديد علاقاتهما. لسنوات، أُجريت هذه الحسابات باستخدام أرقام عالية الدقة، تشبه استخدام مسطرة ذات علامات دقيقة وصغيرة جداً لقياس مبنى. يضمن ذلك تعلم النموذج بشكل صحيح، لكنه عملية بطيئة وتستهلك كميات هائلة من الطاقة. ومع ازدياد حجم النماذج، تصبح الحاجة إلى السرعة أمراً حاسماً. وقد طور الباحثون مؤخراً رقائق قادرة على استخدام أرقام أصغر وأقل دقة — وهي قيم نقطة عائمة مكونة من أربعة بتات — لإجراء هذه المقارنات بسرعة أكبر بكثير. ومع ذلك، فإن مجرد الانتقال إلى هذه الأرقام الأصغر ليس كافياً؛ إذ يجب أيضاً تغيير البرمجيات التي تدير تدفق البيانات، وإلا ستتلاشى مكاسب السرعة.

لقد عالج باحث في شركة "غراف كور" (Graphcore) هذه العقبة المحددة بطريقة جديدة أطلقوا عليها اسم "Direct-P". يركز عملهم على مرحلة التمرير "الأمامي" للانتباه، حيث يعالج النموذج المعلومات لإنشاء إجابة، والتمرير "الخلفي"، حيث يتعلم النموذج من أخطائه. اكتشف الباحث أنه بينما يمكن للرقائق الجديدة ضرب الأرقام بسرعة فائقة، فإن الخطوة التي تلي ذلك — وهي تحويل الدرجات الخام إلى احتمالات — كانت تبطئ كل شيء. كان الأمر يشبه وجود خط تجميع فائق السرعة يستمر في التوقف لأن عاملاً يتعين عليه قياس كل جزء بدقة قبل تمريره. وجد الباحث أن الطريقة القياسية للتعامل مع هذا التحويل، والتي تتضمن عمليات قياس وتقريب معقدة، خلقت ازدحاماً مروريًا أدى إلى إبطاء الفوائد المرجوة من الأجهزة الجديدة.

ولحل هذه المشكلة، أعاد الباحث تصميم عملية التحويل لتكون مباشرة ومبسطة. فبدلاً من حساب احتمال دقيق ثم تقريبه، تقوم طريقتهم برسم خرائط للدرجات الخام مباشرة إلى الرموز المحددة التي تستخدمها الأجهزة. وهذا يلغي خطوات الوسيط التي كانت تسبب التأخير. وعندما اختبروا هذا النهج على الجيل الأحدث من رقائق مراكز البيانات، كانت النتائج مذهلة. فبالنسبة لأشكال معينة من البيانات الشائعة، عالجت الطريقة الجديدة المعلومات بسرعة تزيد عن ضعفي المعيار السابق الذي اعتمد على أرقام أعلى دقة. وقد حققت ذلك مع الحفاظ على مخرجات دقيقة بما يكفي للمهام المعقدة مثل توليد الفيديو وفهم اللغة. وفي الاختبارات التي شملت نموذجاً لتوليد الفيديو، كانت الطريقة الجديدة أسرع بمرتين تقريباً من النهج القياسي، منتجةً نتائج، رغم كونها محدودة وقابلة للاستخدام، إلا أنها أظهرت انحرافاً ملموساً ودرجات تشابه أقل مقارنة بالنسخة الأبطأ والأكثر دقة.

ومع ذلك، فإن القصة لا تتعلق بالسرعة فحسب؛ بل تتعلق أيضاً بما يحدث عندما يحاول النموذج التعلم. استكشف الباحث ما إذا كان بإمكانه استخدام هذه الأرقام فائقة السرعة ومنخفضة الدقة لعملية التدريب بأكملها، بما في ذلك التمرير الخلفي حيث يقوم النموذج بتحديث معرفته. ووجد أنه بينما يمكن للتمرير الأمامي أن يعمل بالسرعة الكاملة، فإن التمرير الخلفي يتطلب تسوية دقيقة. فعندما حاول استخدام تنسيق الأربعة بتات الأسرع لقيم الاحتمالات أثناء التدريب، أصبحت عملية التعلم غير مستقرة وفشل النموذج في التحسن. أصبحت الأرقام خشنة للغاية، مما أدى إلى انهيار إشارة التعلم. وبناءً على ذلك، قرر الباحث أنه لضمان بقاء التدريب مستقراً، يجب عليهم استخدام تنسيق ثماني البتات أكثر دقة قليلاً لقيم الاحتمالات، حتى لو استخدمت بقية الحسابات التنسيق الأسرع المكون من أربعة بتات. سمح هذا النهج الهجين بتسريع دورة التدريب بأكملها بنسبة 14 بالمائة تقريباً على شريحة واحدة قوية، وهو مكسب كبير للنماذج واسعة النطاق.

كما نظر الباحث في الحدود الفيزيائية لرقائق الحاسوب نفسها. واكتشف أن سرعة الحساب لم تعد هي المشكلة الرئيسية؛ بل كانت المشكلة في كيفية تخزين البيانات ونقلها داخل الشريحة. تمتلك الشريحة مساحة ذاكرة صغيرة فائقة السرعة حيث تحتفظ بالأرقام أثناء العمل عليها. وجد الباحث أن مساحة الذاكرة هذه كانت ممتلئة تماماً، مما لم يترك مجالاً لتداخل مراحل الحساب المختلفة. كان الأمر يشبه مطبخاً مزدحماً جداً بالمكونات لدرجة أن الطاهي لا يستطيع البدء في تقطيع الخضروات التالية حتى ينتهي من الخضروات الحالية، حتى لو كان السكين حاداً للغاية. ولأن مساحة الذاكرة كانت مشغولة بالكامل، لم تتمكن الشريحة من العمل على عدة خطوات في وقت واحد، مما حد من مدى السرعة التي يمكن أن تصل إليها العملية برمتها.

يسلط هذا العمل الضوء على تحول جوهري في كيفية تفكيرنا في جعل الذكاء الاصطناعي أسرع. فلا يكفي مجرد بناء آلات حاسبة أسرع؛ بل يجب إعادة تصميم سير العمل بأكمله ليتناسب مع قدرات الأجهزة. لقد أظهر الباحث أنه من خلال تغيير كيفية حساب الاحتمالات ومن خلال الإدارة الدقيقة لتدفق البيانات، يمكنه فتح آفاق لتحسينات هائلة في السرعة. ومع ذلك، فقد أثبت أيضاً أن هناك حدوداً صلبة. فقيود الذاكرة في الشريحة تعني أنه حتى مع أسرع عمليات حسابية ممكنة، هناك سقف لما يمكن تحقيقه من تداخل. إن المسار المستقبلي، كما يقترح، لا يكمن فقط في الحسابات الأسرع، بل في طرق أكثر ذكاءً لتنظيم البيانات بحيث لا تُترك موارد الشريحة في حالة انتظار أبداً. هذا التوازن بين السرعة الخام والإدارة الدقيقة للبيانات هو ما سيسمح للجيل القادم من الذكاء الاصطناعي بالعمل بكفاءة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →