PATCH: Learnable Tile-level Hybrid Sparsity for LLMs
يُعدُّ PATCH إطار عمل هجين للتخلخل (sparsity) يقوم بتقسيم مصفوفات أوزان النماذج اللغوية الكبيرة (LLM) إلى بلاطات (tiles) ذات خرائط كثيفة قابلة للتعلم أو خرائط تخلخل بنسبة 2:4 لتمكين نسب تخلخل مستمرة بين 0% و50%، مما يحقق دقة فائقة وتسريعًا عمليًا على وحدات معالجة الرسومات مقارنة بطرق التقصيف (pruning) الحالية غير المنظمة أو شبه المنظمة الجامدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل نموذج لغة ضخم (LLM) كأنه مكتبة هائلة ومنظمة للغاية تحتوي على مليارات الكتب (المعلمات/Parameters). لتشغيل هذه المكتبة بسرعة على جهاز كمبيوتر عادي، يجب عليك إزالة بعض الكتب. ومع ذلك، تواجه معضلة صعبة:
النهج "الفوضوي" (التخلخل غير المنظم - Unstructured Sparsity): تقوم برمي الكتب عشوائياً من كل مكان على الرفوف. هذا يحافظ على معرفة المكتبة بدقة عالية لأنك تستطيع أن تكون انتقائياً للغاية، لكنه يخلق فوضى عارمة. فالمكتب (وحدة معالجة الرسومات/GPU) الذي يحاول العثور على الكتب سيضطر للقفز في كل مكان، مما يجعل العملية بطيئة وغير فعالة.
النهج "الصارم" (تخلخل 2:4 - 2:4 Sparsity): تقرر اتباع قاعدة صارمة: "في كل مجموعة من أربعة كتب، يجب عليك إزالة كتابين بالضبط". هذا يجعل عمل المكتب بسيطاً وسريعاً لأن النمط يمكن التنبؤ به. ومع ذلك، فإن هذه القاعدة صارمة للغاية؛ فأحياناً يكون الكتابان اللذان "يجب" عليك إزالتهما هما في الواقع أهم الكتب، مما يتسبب في فقدان المكتبة لذكائها ودقتها.
هنا يأتي دور PATCH: أمين المكتبة "الذكي"
يقدم هذا العمل طريقة جديدة تسمى PATCH (التقليم باستخدام تكوين قابل للتعلم على مستوى البلاطات للتخلخل الهجين). بدلاً من الاختيار بين النهجين "الفوضوي" و"الصارم"، يعمل PATCH كأمين مكتبة ذكي يقسم المكتبة إلى بلاطات (أقسام رفوف صغيرة يمكن إدارتها).
إليك كيف يعمل الأمر، باستخدام تشبيه بسيط:
- نظام البلاطات: تخيل أن المكتبة مقسمة إلى بلاطات مربعة، مثل الفسيفساء.
- القرار: يتعلم نظام PATCH اتخاذ قرار لكل بلاطة:
- الخيار (أ) (كثيف - Dense): أبقِ هذه البلاطة ممتلئة بالكتب تماماً. هذا مخصص للمناطق "الحرجة" في المكتبة حيث تكون الدقة هي الأهم.
- الخيار (ب) (تخلخل 2:4): طبق القاعدة الصارمة "أزل اثنين من أربعة" على هذه البلاطة. هذا مخصص للمناطق التي تمتلك فيها المكتبة كتباً زائدة أو مكررة يمكن إزالتها بأمان لتوف توفير المساحة وزيادة السرعة.
- عملية التعلم: النظام لا يخمن. إنه "يدرب" نفسه ليعرف بالضبط أي البلاطات يجب أن تكون ممتلئة وأيها يجب أن تكون متخلخلة. إنه يتعلم الحفاظ على الأجزاء المهمة كثيفة والأجزاء المكررة متخلخلة، بينما يتبع في الوقت نفسه قواعد صديقة للأجهزة (Hardware-friendly).
لماذا يعد هذا أمراً هاماً؟
- أفضل ما في العالمين: يجسّر PATCH الفجوة. فهو يحافظ على دقة المكتبة (مثل النهج الفوضوي) ولكنه ينظمها بحيث يمكن للحواسيب قراءتها بسرعة (مثل النهج الصارم).
- سرعة مرنة: يمكنك أن تقول لـ PATCH: "أريد تصغير المكتبة بنسبة 25%" أو "50%". سيقوم بتعديل عدد "البلاطات الممتلئة" مقابل "البلاطات المتخلخلة" لتحقيق هذا الهدف بدقة، بدلاً من أن يظل عالقاً عند نسبة تقليل ثابتة قدرها 50%.
- نتائج واقعية: اختبر المؤلفون هذا على نماذج تتراوح من الصغيرة إلى الكبيرة جداً (تصل إلى 13 مليار معلمة).
- السرعة: على بطاقة رسومات قياسية للمستهلكين (A6000 GPU)، جعل PATCH النماذج تعمل بشكل أسرع بـ 1.18 إلى 1.38 مرة من النماذج الأصلية غير المقلمة.
- الذكاء: على عكس الطرق الأخرى التي تجعل النماذج "أقل ذكاءً" عندما تزيد سرعتها، جعل PATCH النماذج في الواقع أكثر دقة (بنسبة 0.37% إلى 2.96%) مقارنة بالطريقة الصارمة الرائدة حالياً (MaskLLM).
الملخص
فكر في PATCH كوسيلة لتنظيف مستودع ضخم. بدلاً من رمي الأشياء عشوائياً (مما يبطئ حركة الرافعات الشوكية) أو اتباع قاعدة غبية ترمي الأشياء المهمة، يقوم PATCH بتعيين مناطق معينة لتكون ممتلئة وأخرى ليتم إخلاؤها وفق نمط تحبه الرافعات الشوكية. النتيجة هي مستودع أسرع في التنقل، ومع ذلك لا يزال يحتوي على المعرفة الأساسية بالكامل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.