Accelerating Sparse Transformer Inference on GPU
تقدم هذه الورقة STOF، وهو إطار عمل لوحدات معالجة الرسومات يعمل على تسريع استنتاج نماذج Transformer المتفرقة من خلال استخدام النمذجة التحليلية لرسم خرائط الانتباه متعدد الرؤوس بكفاءة واستراتيجية بحث ثنائية المراحل لتحسين دمج العمليات ديناميكيًا، محققًا تسريعًا يصل إلى 1.6 ضعف في حسابات MHA و1.4 ضعف في الاستنتاج الشامل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول قراءة مكتبة ضخمة من الكتب (نموذج لغوي كبير - LLM) للإجابة على سؤال ما. المكتبة منظمة في غرف تسمى "ترانسفورمرز" (Transformers)، وداخل كل غرفة يوجد أمين مكتبة (آلية الانتباه متعدد الرؤوس - Multi-Head Attention) يتعين عليه مسح آلاف الصفحات للعثور على الجمل المحددة ذات الصلة بسؤالك.
المشكلة هي أنه بالنسبة للعديد من الأسئلة، تكون معظم الصفحات غير ذات صلة. يضيع أمين المكتبة وقته في تقليب صفحات فارغة أو صفحات لا تهم. وهنا يأتي دور "التناثر" (Sparsity): الأمر يشبه وضع ملصقات "لا تقرأ" على الصفحات غير ذات الصلة.
ومع ذلك، فإن أمناء المكتبة الحاليين (البرمجيات الموجودة) سيئون في استخدام هذه الملصقات. فهم لا يزالون يمرون بجانب الصفحات التي تحمل ملصق "لا تقرأ"، أو يشعرون بالارتباك عندما توضع الملصقات في أنماط غريبة وعشوائية. علاوة على ذلك، هناك مهام أخرى في المكتبة (مثل التلخيص أو التنسيق) يتم القيام بها عادةً بشكل منفصل، مما يضيف وقتًا إضافيًا للمشي بين المهام.
إليك STOF، وهو نظام جديد اقترحه الباحثون. فكر في STOF كمنظومة إدارة مكتبة ذكية وفائقة الكفاءة مصممة خصيصًا لهذه المكتبات "المتناثرة". إليك كيف يعمل، مقسمًا إلى أجزاء بسيطة:
1. أمين المكتبة الذكي (نواة MHA الموحدة)
أدرك الباحثون أن أنماط "لا تقرأ" المختلفة تتطلب استراتيجيات مختلفة.
- المشكلة: بعض الأنماط عبارة عن صفوف مرتبة من الملصقات (مثل النافذة المنزلقة)، بينما البعض الآخر مبعثر عشوائيًا (مثل تذكرة اليانصيب). حاولت الأنظمة القديمة استخدام طريقة واحدة "تناسب الجميع"، مما كان بطيئًا.
- حل STOF: يعمل STOF كأمين مكتبة ذكي يختار الأداة الأنسب للمهمة.
- إذا كانت الملصقات في تجمع صغير ومنظم، يستخدم أمين المكتبة نهج "على مستوى الصف" (Row-wise): حيث يأخذ صفًا كاملًا من الكتب دفعة واحدة ويمسحه بسرعة.
- إذا كانت الملصقات مبعثرة أو كانت المكتبة ضخمة، يستخدم نهج "على مستوى الكتلة" (Block-wise): حيث يقسم الكتب إلى قطع صغيرة يمكن إدارتها ويفتح فقط القطع المحددة التي تحتوي على ملصقات صالحة.
- النتيجة: من خلال تخطي صفحات "لا تقرأ" تمامًا بدلًا من مجرد تجاهلها، يعمل أمين المكتبة بشكل أسرع بكثير.
2. خط التجميع (دمج العمليات - Operator Fusion)
في مكتبة عادية، قد ينتهي أمين المكتبة من القراءة، ثم يمشي إلى مكتب آخر لتلخيص النص، ثم يمشي إلى مكتب آخر لتنسيق الإجابة. هذا المشي (نقل البيانات بين الذاكرة والمعالج) بطيء.
- المشكلة: غالبًا ما تدمج الأنظمة الحالية المهام البسيطة فقط. فهي تترك المهام الشاقة (مثل الرياضيات المعقدة) لخطوات منفصلة، مما يسبب ازدحامًا مروريًا.
- حل STOF: يبني STOF خط تجميع مخصص. فهو ينظر إلى العملية بأكملة ويسأل: "هل يمكننا دمج هذه الخطوات؟"
- هو لا يكتفي بلصق مهمتين بسيطتين معًا؛ بل يكتشف الطريقة المثالية لدمج مهام الرياضيات المعقدة مع مهام التنسيق.
- يستخدم "محرك بحث" لتجربة طرق مختلفة لدمج هذه المهام (مثل تجربة تخطيطات مختلفة لخط التجميع) للعثور على التخطيط الذي يتحرك بأقصى سرعة لحجم المكتبة التي تقرأها.
3. الطيار الآلي (البحث الهرمي)
لا يمكنك تصميم خط التجميع المثالي يدويًا لكل حجم كتاب ونوع سؤال؛ فهناك الكثير من التوليفات.
- حل STOF: يمتلك STOF "طيارًا آليًا" يتعلم أثناء العمل.
- المرحلة 1 (الخريطة): ينظر إلى هيكل المكتبة ويرسم خريطة تقريبية لأماكن وجود ملصقات "لا تقرأ".
- المرحلة 2 (التحسين): يقوم بإجراء بحث من خطوتين. أولاً، يوسع حدود خط التجميع ليرى إلى أي مدى يمكنه الوصول. ثانيًا، يقوم بضبط سرعة العمال (المعلمات/Parameters) بناءً على مدى نجاح المحاولات السابقة.
- يتذكر ما نجح (التخزين المؤقت/Caching) حتى لا يضيع الوقت في إعادة اختبار الأفكام البطيئة نفسها.
النتائج: ما مدى السرعة؟
اختبر الباحثون STOF على بطاقات رسومات قوية (GPUs) باستخدام نماذج ذكاء اصطناي مشهورة (مثل BERT و GPT و LLaMA).
- السرعة: مقارنة بأفضل الطرق الموجودة، جعل STOF مهمة القراءة الأساسية (MHA) أسرع بمقدار يصل إلى 1.6 مرة.
- السرعة الإجمالية: عند النظر إلى العملية بأكملها للإجابة على سؤال (من البداية إلى النهاية)، كان أسرع بمقدار يصل إلى 1.4 مرة.
- المكتبات الضخمة: كلما كانت المكتبة أكبر (تسلسلات نصية أطول)، تألق STOF أكثر، لأنه كان يتخطى الكثير من العمل غير المجدي.
الملخص
فكر في STOF كنظام يمنع الذكاء الاصطناعي من إضاعة الوقت في قراءة الصفحات التي لا يحتاج لقراءتها، ويمنعه من المشي ذهابًا وإيابًا بين المكاتب. إنه يستخدم استراتيجية ذكية وتكيفية لتخطي الحشو ودمج الخطوات المفيدة في حركة واحدة سلسة وسريعة. وهذا يجعل نماذج الذكاء الاصطناعي تعمل بشكل أسرع بكثير، خاصة عند التعامل مع النصوص الطويلة أو المعقدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.