TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration
تُعد TileMix نواةً مختلطة الدقة تعتمد على البلاطات (tiles) ولا تتطلب تدريباً، حيث تعمل على تسريع استنتاج النماذج اللغوية الكبيرة ذات السياق الطويل من خلال توجيه بلاطات درجات الانتباه المتوافقة مع الأجهزة ديناميكياً بين مساري FP16 وINT8 ضمن عملية انتباه كثيفة مدمجة، مما يؤدي إلى استعادة الدقة التي تفقدها طرق الدقة المنخفضة الموحدة مع تحسين معدل الإنتاجية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
أصبحت النماذج اللغوية الكبيرة هي المحركات التي تقف وراء جيل جديد من الذكاء الاصطناعي، وهي قادرة على تلخيص كتب كاملة، والإجابة على أسئلة معقدة من وثائق طويلة، وإجراء محادثات تمتد لآلاف الكلمات. وللقيام بذلك، تعتمد هذه النماذج على آلية تسمى "الانتباه" (attention)، والتي تسمح لها بتقدير أهمية كل كلمة في الجملة مقابل كل كلمة أخرى. وعندما يكون النص قصيراً، تكون هذه العملية سريعة، ولكن مع نمو السياق ليشمل فصولاً كاملة أو عقوداً قانونية، تتفجر التكلفة الحسابية. إذ يجب على النموذج حساب درجة لكل زوج ممكن من الكلمات، مما ينشئ شبكة ضخمة من البيانات تتطلب كميات هائلة من الذاكرة وقوة المعالجة. وقد جعل هذا الاختناق من الصعب تشغيل هذه الأدوات القوية بكفاءة على الأجهزة القياسية، خاصة عند التعامل مع التسلسلات الطويلة المطلوبة للمهام الواقعية مثل التحليل القانوني أو مراجعة السجلات الطبية.
حاول الباحثون حل هذه المشكلة عن طريق تبسيط العمليات الحسابية. أحد النهج الشائعة هو خفض دقة الأرقام التي يستخدمها الكمبيوتر، والتحول من الحسابات عالية الدقة إلى حسابات أسرع وأقل دقة. يشبه هذا الانتقال من قياس المكونات باستخدام ميزان مختبر إلى استخدام ملعقة مطبخ؛ فهو أسرع بكثير، ولكن إذا فعلت ذلك في كل خطوة من خطوات وصفة معقدة، فقد يكون الطبق النهائي بطعم خاطئ. نهج آخر يتمثل في تخطي الحسابات تماماً، عبر تجاهل الكلمات التي تبدو غير مهمة. وبينما يوفر هذا الوقت، فإنه يخاطر بقطع الروابط التي يحتاجها النموذج لفهم القصة. لقد كان التحدي يكمض في إيجاد طريقة لاستخدام سرعة الرياضيات منخفضة الدقة دون التضحية بدقة النوع عالي الدقة، مع الحفاظ في الوقت نفسه على قدرة النموذج على رؤية الصورة الكاملة.
قدم فريق من الباحثين طريقة جديدة تسمى "TileMix" تعالج هذه المشكلة من خلال التعامل مع عملية الانتباه ليس ككتلة واحدة متجانسة من العمل، بل كمجموعة من "البلاطات" (tiles) الصغيرة والقابلة للإدارة. تخيل شبكة درجات أزواج الكلمات الضخمة كفسيفساء كبيرة؛ وبدلاً من طلاء الفسيفساء بأكملها بنوع واحد من الطلاء، يقوم TileMix بتقسيمها إلى أقسام مربعة صغيرة متوافقة مع الأجهزة. ولكل قسم من هذه الأقسام، يتخذ النظام قراراً في أجزاء من الثانية: هل تحتاج هذه المجموعة المحددة من أزواج الكلمات إلى الحساب البطيء عالي الدقة، أم يمكنها الاكتفاء بالحساب السريع منخفض الدقة؟ يتم اتخاذ هذا القرار بناءً على خريطة مخططة مسبقاً تجمع هذه البلاطات معاً، مما يسمح للكمبيوتر بالتبديل بين الدقة العالية والمنخفضة ضمن نفس العملية دون التوقف لإعادة تنظيم البيانات.
إن جوهر هذا الابتكار هو نظام توجيه يعمل بمثابة "مراقب حركة مرور" لمعالج الكمبيوتر. فهو يقوم بتعبئة هذه القرارات في رمز مضغوط، وهو في الأساس سلسلة من البتات (bits) التي تخبر المعالج بالمسار الذي يجب اتخاذه لكل بلاطة. إذا تم تحديد بلاطة لتكون عالية الدقة، يستخدم المعالج وحدات الحساب الأكثر دقة لديه. وإذا تم تحديدها لتكون منخفضة الدقة، فإنه ينتقل إلى الوحدات الأسرع والأكثر كفاءة في استهلاك الطاقة. ومن الأهمية بمكان أن كلا المسارين يقومان بتحديث حالة ذاكرة مشتركة تتبع النتائج الإجمالية، مما يضمن بقاء المخرج النهائي متسقاً. وهذا يسمح للنظام بالحفاظ على الاتصال الكامل للنموذج — مما يعني أنه لا يتم تجاهل أي تفاعلات بين الكلمات — مع الاستفادة في الوقت نفسه من مزايا السرعة التي توفرها الرياضيات منخفضة الدقة للأجزاء من الحساب التي يمكنها تحمل ذلك.
في تجاربهم، اختبر الباحثون هذه الطريقة على عدة نماذج لغوية كبيرة شهيرة، بما في ذلك LLaMA وQwen وVicuna، باستخدام تسلسلات تتراوح من 16,000 إلى 64,000 كلمة. وقارنوا نهجهم بالمنهج القياسي عالي الدقة وبالنسخة التي تستخدم الرياضيات منخفضة الدقة في كل شيء. وأظهرت النتائج أن استخدام الرياضيات منخفضة الدقة لكامل العملية غالباً ما يؤدي إلى انخفاض كبير في الدقة، مما يتسبب في فقدان النموذج للتفاصيل أو فشله في مهام الاسترجاع. ومع ذلك، استطاع TileMix استعادة معظم تلك الجودة المفقودة. فمن خلال توجيه مجموعات محددة فقط من البلاطات إلى مسار الدقة العالية بعناية، حافظ النظام على مستويات دقة قريبة جداً من الخط المرجعي عالي الدقة بالكامل، مع تحقيق سرعات معالجة أسرع بكثير في الوقت ذات ذاته.
كما بحثت الدراسة في أنماط مختلفة لاتخاذ القرار بشأن أي البلاطات يجب أن تحصل على معاملة الدقة العالية. ووجدوا أن الترتيب كان مهماً؛ حيث إن بعض الأنماط، التي تحافظ على الحسابات عالية الدقة في مناطق مكانية محددة من شبكة الكلمات، كانت تعمل بشكل أفضل من غيرها اعتماداً على المهمة. فعلى سبيل المثال، كانت بعض التخطيطات التي تحافظ على الدقة العالية للتفاعلات المحلية للكلمات تؤدي بشكل أفضل في مهام الاستدعاء الواقعي، بينما كانت أخرى أكثر قوة في مهام الإجابة على الأسوألة العامة. وأثبت الباحثون أنه يمكن تطبيق هذه الطريقة دون الحاجة لإعادة تدريب النماذج، مما يعني إمكانية نشرها فوراً على الأنظمة الحالية. كما أظهروا أن هذا النهج يعمل جيداً مع الدفعات متغيرة الطول وهياكل النماذج المختلفة، مما يشير إلى أنه أداة مرنة لتحسين الكفاءة.
في نهاية المطاف، يقدم TileMix توازناً يمكن التحكم فيه بين السرعة والدقة. وهو يشير إلى أن مستقبل معالجة السياق الطويل الفعالة لا يتطلب الاختيار بين أن تكون سريعاً أو ذكياً، بل من خلال الجمع بينهما بذكاء، يمكن للأنظمة معالجة المستندات الطويلة بسرعة تقترب من الحدود النظرية للأجهزة، دون العقوبات الشديدة على الدقة التي تأتي من استخدام الرياضيات منخفضة الدقة في كل مكان. يوفر هذا النهج مساراً عملياً للمضي قدماً في نشر النماذج اللغوية الكبيرة في السيناريوهات التي تكون فيها السرعة والدقة أمرين بالغ الأهمية، مثل التحليل الفوري لمجموعات البيانات الضخمة، أو الأدوات التفاعلية التي تحتاج إلى فهم سياقات طويلة ومعقدة بشكل فوري.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.