TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling
تُعد TileQ طريقةً للكمّ (quantization) في مرحلة ما بعد التدريب لا تتطلب ضبطاً دقيقاً، وهي تستخدم عوامل منخفضة الرتبة ذات هيكلية بلاط ثنائية الأبعاد (2D-tiling) مشتركة عبر أبعاد المدخلات والمخرجات، مدمجة مع تقنية استدلال بمسار واحد مدمج، لتقليل استخدام الذاكرة وزمن الاستجابة بشكل كبير في نماذج خليط الخبراء (Mixture-of-Experts) مع الحفاظ على الدقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة من الخبراء (المتخصصين) يعملون لصالح شركة ذكاء اصطناي عملاقة. تستخدم هذه الشركة نظام "خليط من الخبراء" (Mixture-of-Experts - MoE). وإليك كيف يعمل: عندما تطرح سؤالاً، لا يقوم الذكاء الاصطناعي بإيقاظ جميع الخبراء، بل يختار فقط عدداً قليلاً منهم (ربما 2 أو 4 من أصل 100) ممن هم الأنسب لهذا السؤال تحديداً. هذا يجعل الذكاء الاصطناعي ذكياً جداً ولكنه أيضاً فعال للغاية.
المشكلة:
على الرغم من أن الذكاء الاصطناي يستخدم فقط عدداً قليماً من الخبراء في كل مرة، إلا أنه يجب أن يكون جميع الخبراء جالسين في ذاكرة الكمبيوتر (RAM) بانتظار استدعائهم. الأمر يشبه وجود مكتبة حيث يجب وضع كل كتاب على المكتب، حتى لو كنت تقرأ صفحة واحدة فقط من كتاب واحد في كل مرة. هذا يستهلك مساحة هائلة ويجعل الكمبيوتر بطيئاً لأنه يضطر للبحث والتحرك وسط كومة ضخمة من الكتب فقط ليجد الكتب القليلة التي يحتاجها.
الحل القديم (ولماذا فشل):
حاول العلماء ضغط هذه الكتب عن طريق تلخيصها (الكمية - quantization) أو تقسيمها إلى أجزاء أصغر (الرتبة المنخفضة - low-rank).
- المشكلة: إذا قمت بتلخيص كل خبير على حدة، فستظل تملك الكثير من الملخصات. وإذا حاولت مشاركة الملخصات بين الخبراء، فإن الطرق القديمة كانت تشبه محاولة تكديم الكتب في خط واحد طويل (1D). وفرت هذه الطرق بعض المساحة، لكن الكمبيوتر كان لا يزال يضطر للقفز ذهاباً وإياباً للعثور على الصفحات الصحيحة، مما جعل العملية بطيئة. كما أن "ملاحظات التلخيص" نفسها كانت تشغل مساحة إضافية كبيرة لدرجة أن التوفير الذي حققته تم إلغاؤه.
الحل الجديد: TILEQ
يقترح مؤلفو هذه الورقة البحثية نظام TILEQ. تخيل أنك تعيد تنظيم المكتبة إلى شبكة ثنائية الأبعاد من الأرفف (مثل رقعة الشطرنج) بدلاً من خط واحد طويل.
إليك تفصيل بسيط لكيفية عمل TILEQ:
1. خدعة "التبليط ثنائي الأبعاد" (الأرفف الذكية)
تخيل أن لديك 64 خبيراً. بدلاً من التعامل معهم كـ 64 شخصاً منفصلاً، ينظر TILEQ إليهم ويدرك: "مهلاً، الخبير رقم 1 والخبير رقم 5 يفكران بشكل متشابه جداً، والخبير رقم 2 ورقم 6 هما أيضاً توأمان".
- الطريقة القديمة: تلخص الخبير رقم 1، ثم الخبير رقم 2، ثم الخبير رقم 3... وهكذا، لتنتج 64 ملخصاً منفصلاً.
- طريقة TILEQ: تقوم بترتيب هؤلاء الخب {الـ 64} في شبكة 8×8 (مثل لوحة "إكس أو" ولكن أكبر).
- الخبراء في نفس الصف يتشاركون "ملاحظة اليد اليسرى" (ملخص مشترك لمدخلاتهم).
- الخبراء في نفس العمود يتشاركون "ملاحظة اليد اليمنى" (ملخص مشترك لمخرجاتهم).
- النتيجة: بدلاً من الحاجة إلى 64 ملخصاً فريداً، ستحتاج فقط إلى 8 ملاحظات للصفوف و8 ملاحظات للأعمدة. هذا يقلل بشكل كبير من المساحة المطلوبة لتخزين هذه "الملاحظات".
2. "الاستنتاج بمرور واحد" (المصعد السريع)
عندما يحتاج الذكاء الاصطناعي للإجابة على سؤال، فإنه عادة ما يحتاج لتشغيل عملية حسابية منفصلة لكل خبير يختاره. هذا يشبه استدعاء مصعد لكل شخص على حدة، واحداً تلو الآخر. إنه أمر بطيء وغير فعال.
- حل TILEQ: بما أن الخبراء الآن مرتبون في شبكة ثنائية الأبعاد ويتشاركون الملاحظات، يمكن للكمبيوتر معالجة الخبراء "النشطين" جميعاً دفعة واحدة في حركة واحدة سلسة. الأمر يشبه تشغيل حزام ناقل ينقل جميع الكتب المختارة إلى القارئ في جولة واحدة، بدلاً من جلبها واحداً تلو الآخر.
- الفائدة: هذا يجعل الذكاء الاصطناعي يعمل بشكل أسرع بكثير (زمن استجابة أقل) لأن أجهزة الكمبيوتر (GPU) يمكنها العمل على كتلة كبيرة وصلبة من البيانات بدلاً من قطع صغيرة ومشتتة.
3. لا حاجة لـ "إعادة التدريب"
عادةً، عندما تضغط نموذج ذكاء اصطناعي، يتعين عليك تعليمه من جديد (ضبط دقيق - fine-tuning) للتأكد من أنه لم ينسَ كيفية التحدث. TILEQ هو طريقة "كمية ما بعد التدريب" (Post-Training Quantization - PTQ).
- التشبيه: الأمر يشبه أخذ صورة عالية الدقة ومن ثم ضغطها لتصبح بحجم ملف أصغر دون الحاجة لالتقاط الصورة مرة أخرى. أنت فقط تعالج الصورة الموجودة بالفعل. وهذا يوفر وقتاً هائلاً وقوة حوسبة كبيرة.
النتائج
تزعم الورقة البحثية أنه باستخدام هذه الشبكة ثنائية الأبعاد وطريقة "المرور الواحد":
- الذاكرة: قللت المساحة الإضافية المطلوبة لهذه "الملاحظات" بمقدار يصل إلى 10 أضعاف مقارنة بالطرق القديمة.
- السرعة: قللت الوقت المستغرق للإجابة على سؤال (زمن الاستجابة) إلى حوالي 5% مما كان عليه سابقاً لهذه الأجزاء المحددة من النموذج.
- الدقة: رغم صغر حجمها وسرعتها، إلا أن الذكاء الاصطناعي لا يزال يجيب على الأسئلة بنفس جودة النسخة الكبيرة غير المضغوطة.
باختاً:
TILEQ هو طريقة ذكية لتنظيم "ملاحظات الذاكرة" لذكاء اصطناعي متطور. بدلاً من إعطاء كل خبير حقيبة ظهر ثقيلة خاصة به، فإنه يجمعهم في فرق تتشارك حقائب ظهر خفيفة الوزن. هذا يجعل النظام بأكمله يتناسب مع أجهزة كمبيوتر أصغر ويعمل بشكل أسرع، دون فقدان أي من ذكائه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.