← أحدث الأبحاث
🤖 machine learning

Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling

تقترح الورقة البحثية Dense2MoE، وهو إطار عمل مبتكر يوحد بين تقليم الطبقات وإعادة التدوء (upcycling) لتحويل النماذج اللغوية الكبيرة الكثيفة بكفاءة إلى نماذج خليط من الخبراء (Mixture of Experts) جاهزة للعمل على الأجهزة، مما يحسن بشكل كبير جبهة باريتو للدقة مقابل زمن الاستجابة مع تجنب التكاليف الباهظة للتدريب من الصفر.

المؤلفون الأصليون: Fengfa Li, Hongjin Ji, Yifeng Ding, Lei Ren, Chen Wei

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Fengfa Li, Hongjin Ji, Yifeng Ding, Lei Ren, Chen Wei

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة وذكية للغاية (نموذج لغوي كبير) وتريد حملها في جيبك. المشكلة هي أن هذه المكتبة ثقيلة جداً وتتطلب الكثير من الكهرباء لتشغيلها، مما يؤدي إلى استنزاف بطارية هاتفك فوراً وتتحرك ببطء شديد يجعلها غير مفيدة للمهام التي تتطلب وقتاً فعلياً مثل قيادة سيارة أو التحكم في روبوت.

تقدم هذه الورقة البحثية طريقة جديدة تسمى Dense2MoE لحل هذه المشكلة. فكر في الأمر كعملية "تجديد ذكي" لهذه المكتبات العملاقة لجعلها خفيفة بما يكفي لحملها مع الحفاظ على ذكائها.

إليك كيف يعمل ذلك، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: "الازدحام المروري" مقابل "الغرفة الفارغة"

نماذج الذكاء الاصطنا_الحالية تشبه مبنى مكاتب مزدحم حيث يتعين على كل موظف (طبقة) معالجة كل قطعة بريد (بيانات) تصل.

  • عنق الزجاجة: التأخير الأكبر ليس في إجراء العمليات الحسابية فعلياً؛ بل في الوقت المستغرق لجلب الملفات من غرفة التخزين (الذاكرة). وهذا ما يسمى بـ "جدار الذاكرة".
  • الحلول القديمة:
    • التقليم (طرد الموظفين): تحاول بعض الطرق طرد طبقات كاملة (موظفين) لتوفير المساحة. لكن هذا يشبه طرد قسم المحاسبة بأكمله؛ يصبح المبنى أخف وزناً، لكنه لا يستطيع القيام بالعمليات الحسابية بعد الآن؛ أي أن الذكاء الاصطناعي يصبح أغبى.
    • الترقية (توظيف المزيد من الناس): تحاول طرق أخرى تحويل المكتب إلى "خليط من الخبراء" (MoE)، حيث يكون لديك العديد من المتخصصين، ولكن يعمل عدد قليل منهم فقط على أي مهمة. ومع ذلك، إذا قمت بنسخ ولصق نفس الموظف لإنشاء هؤلاء المتخصصين، فسيفكرون جميعاً بنفس الطواعية. ستحتاج لإعادة تدريبهم لشهور لتعليمهم كيف يكونون مختلفين، وهذا أمر مكلف.

2. الحل: "الدمج الذكي" (Dense2MoE)

إن Dense2MoE هو خطة تجديد ذكية تجمع بين أفضل ما في العالمين. وهي تستخدم تقنية تسمى Layer-Fusion Upcycling (LF-UC).

الخطوة 1: ابحث عن النسخ المتكررة
يقوم النظام بمسح المكتبة ويجد الطبقات التي تقوم تقريباً بنفس الشيء تماماً. إنه يشبه العثور على خزانتي ملفات متطابقتين في الرواق تحتويان على نفس المستندات بالضبط.

الخطوة 2: استراتيجية "الهدم وإعادة الاستخدام"
بدلاً من مجرد رمي هذه الخزانات المتكررة (مما قد يؤدي لفقدان المعلومات)، قام الفريق بشيء ذكي:

  • هدم الأبواب الثقيلة: قاموا بإزالة أجزاء "الانتباه" (Attention) من هذه الطبقات المتكررة. هذه الأجزاء تشبه الأبواب الثقيلة والبطيئة التي تتطلب الكثير من الطاقة لفتحها وإغلاقها (وهي ما يسبب ازدحام ذاكرة البيانات). إزالتها تسرع العملية بشكل كبير.
  • الحفاظ على الأرفف: إنهم يحتفظون بأجزاء "MLP" (الأرفف التي تحمل المعرفة). وبدلاً من رميها، يأخذون هذه الأرفف ويحولونها إلى خبراء متخصصين.

الخطوة 3: "المفتاح الذكي"
الآن، بدلاً من مرور كل قطعة بريد عبر كل رف، يقرر مفتاح ذكي (موجه/Router) أي رف يجب استخدامه.

  • إذا كان البريد يتعلق بالرياضيات، يرسل المفتاح البريد إلى رف "خبير الرياضيات".
  • إذا كان عن البرمجة، يرسله إلى رف "خبير البرمجة".
  • الأرفف الأخرى تظل مغلقة ولا تستهلك أي طاقة.

3. لماذا يعد هذا أمراً مهماً؟

تدعي الورقة البحثية أن هذه الطريقة تخلق "جبهة باريتو" (Pareto Frontier)، وهي طريقة منمقة للقول بأنها تصل إلى "النقطة المثالية" حيث تحصل على أقصى سرعة دون فقدان الذكاء.

  • إنها سريعة: من خلال إزالة "الأبواب" الثقيلة (نماذج الانتباه) من الطبقات المتكررة، لا يعلق الذكاء الاصطناعي في ازدحام ذاكرة البيانات. إنه يعمل بشكل أسرع بكثير على أجهزة مثل حواسيب السيارات أو الهواتف.
  • إنها ذكية: لأنهم حافظوا على "الأرفف" (المعرفة) من الطبقات التي تمت إزالتها وحولوها إلى خبراء، فإن الذكاء الاصطناعي لا يفقد قدراته الذهنية. في الواقع، ولأن هؤلاء الخبراء بدأوا كطبقات مختلفة، فهم متنوعون بطبيعتهم ولا يحتاجون لشهور من إعادة التدريب ليتعلموا كيف يكونوا مختلفين.
  • إنها رخيصة: تتطلب فقط قدراً ضئيلاً جداً من التدريب الإضافي (حوالي 1% من تكلفة بناء نموذج جديد من الصفر) لجعل كل شيء يعمل معاً.

النتيجة

اختبر المؤلفون هذه الطريقة على أحجام مختلفة من نماذج الذكاء الاصطناعي (من نماذج صغيرة بحجم 0.5 مليار معلمة إلى نماذج أكبر بحجم 7 مليارات معلمة). ووجدوا أن نماذجهم "المجددة" كانت:

  1. أسرع من النماذج الثقيلة الأصلية.
  2. أذكى من النماذج التي تم "تقليمها" فقط (طرد الموظفين).
  3. أكثر كفاءة من نماذج "MoE" الأخرى التي تتطلب إعادة تدريب هائلة.

باختصار، Dense2MoE يشبه أخذ شاحنة بطيئة وثقيلة، وإزالة الحمولة الثقيلة غير الضرورية منها، ثم إعادة ترتيب الحمولة المتبقية في أسطول من سيارات التوصيل المتخصة والسريعة التي يمكنها التعامل مع أي مهمة دون تباطؤ. وهذا يجعل من الممكن تشغيل ذكاء اصطناعي قوي على الأجهزة اليومية مثل السيارات والروبوتات دون الحاجة إلى حاسوب خارق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →