← أحدث الأبحاث
🤖 machine learning

Sparse Layers are Critical to Scaling Looped Language Models

تُظهر الورقة البحثية أن الجمع بين بنيات "خليط الخبراء" (MoE) وآليات تكرار الطبقات والخروج المبكر يُمكّن النماذج اللغوية من التفوق على نماذج "ترانسفورمر" القياسية في كفاءة التوسع مع تقليل تكاليف الذاكرة والاستدلال بشكل كبير.

المؤلفون الأصليون: Ryan Lee, Jacob Biloki, Edward J. Hu, Jonathan May

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ryan Lee, Jacob Biloki, Edward J. Hu, Jonathan May

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول بناء عقل لروبوت فائق الذكاء (نموذج لغوي كبير) يمكنه القراءة والكتابة مثل البشر. المشكلة هي أن هذه العقول ضخمة؛ فهي تستهلك الكثير من الذاكرة لتخزينها، وتكون بطيئة في العمل لأن عليها معالجة المعلومات عبر ممر طويل ومتعرج من الغرف (الطبقات) واحدة تلو الأخرى.

تستعرض هذه الورقة البحثية حيلة ذكية لجعل هذه العقول أصغر وأسرع دون جعلها "غبية". إليك قصة ما وجدوه، مشروحة ببساطة.

المشكلة: عقل "النسخ واللصق"

عادةً، يمتلك عقل الروبوت غرفة فريدة لكل خطوة من خطوات تفكيره. إذا كان لديه 16 خطوة، فإنه يحتاج إلى 16 غرفة مختلفة. هذا أمر مكلف في البناء والتخزين.

لتوفير المال، جرب الباحثون فكرة مختلفة: التكرار (Looping). بدلاً من بناء 16 غرفة فريدة، قاموا ببناء 8 غرف فقط وأخبروا الروبوت أن يمر عبرها مرتين.

  • الفكرة: امشِ عبر الغرف من 1 إلى 8، ثم امشِ عبر الغرف من 1 إلى 8 مرة أخرى.
  • النتيجة: هذا يوفر مساحة التخزين لأنك بنيت 8 غرف فقط.
  • العقبة: عندما يمر الروبوت عبر نفس الغرفة في المرة الثانية، فإنه يفعل نفس الشيء تماماً كما فعل في المرة الأولى. الأمر يشبه قراءة نفس الصفحة من الكتاب مرتين على أمل فهمها بشكل أفضل. يصاب الروبوت بالارتباك ويؤدي بشكل أسوأ مقارنة بالعقل الذي يمتلك 16 غرفة فريدة.

الحل: "فريق المتخصصين" (MoE)

أدرك المؤلفون أن المشكلة كانت في أن الغرف كانت عامة جداً. كانت تشبه مقاولاً عاماً يحاول إصلاح أنبوب مسرب، وطلاء جدار، وتوصيل أسلاك مصباح في آن واحد.

استبدلوا هذه الغرف العامة بغرف "خليط من الخبراء" (Mixture-of-Experts - MoE).

  • التشبيه: تخيل غرفة بها موظف استقبال ذكي (الموجه/Router). عندما يدخل زائر (قطعة من البيانات)، لا يسمح الموظف للجميع برؤية نفس الشخص، بل يرسل الزائر إلى خبير محدد بناءً على ما يحتاجه.
    • إذا كان الزائر يحتاج إلى الرياضيات، يذهب إلى خبير الرياضيات.
    • إذا كان يحتاج إلى الشعر، يذهب إلى خبير الشعر.
  • السحر: في نموذج Looped-MoE، يكون موظف الاستقبال ذكياً بما يكفي لتغيير رأيه في الدورة الثانية.
    • المسار الأول: يدخل الزائر الغرفة رقم 1 ويتم إرساله إلى خبير الرياضيات.
    • المسار الثاني: يدخل الزائر الغرفة رقم 1 مرة أخرى، ولكن هذه المرة يرسله موظف الاستقبال إلى خبير الشعر.

النتيجة: على الرغم من أن الغرفة المادية هي نفسها، إلا أن العمل الذي يحدث بداخلها مختلف في كل مرة. هذا يحل مشكلة "الملل" في نموذج التكرار. وجدت الورقة أن نماذج Looped-MoE في الواقع تصبح أذكى من النماذج الضخمة القياسية، رغم أنها تخزن "مخططات" (معاملات/Parameters) أقل.

الإضافة: "باب الخروج المبكر"

اكتشف الباحثون أيضاً قوة ثانية: الخروج المبكر (Early Exits).

في عقل الروبوت القياسي، يجب عليك المرور عبر جميع الغرف الـ 16 للوصول إلى الإجابة النهائية. إذا عرف الروبوت الإجابة بعد 8 غرف، فإنه لا يزال مضطراً للمرور عبر الغرف الثمانية الأخرى، مما يهدر الوقت والطاقة.

في النموذج المكرر (Looped)، توضع "أبواب الخروج" عند نهاية كل دورة.

  • التشبيه: تخيل خط تجميع في مصنع. في الخط القياسي، يجب عليك الانتظار حتى نهاية الخط تماماً للتحقق مما إذا كان المنتج جيداً. في الخط المكرر، تتحقق من المنتج بعد المرور الأول، ثم المرور الثاني.
  • لماذا يعمل بشكل أفضل: لأن الغرف الموجودة في نهاية الحلقة هي نفس الغرف المستخدمة لصنع الإجابة النهائية، يتعلم الروبوت تقديم إجابة "جيدة بما يكفي" في وقت مبكر جداً.
  • النتيجة: وجدت الورقة أن النماذج المكررة يمكنها التوقف مبكراً (توفير الطاقة) في كثير من الأحيان أكثر من النماذج القياسية دون فقدان الجودة. الأمر يشبه القدرة على مغادرة اجتماع مبكراً لأنك اتفقت بالفعل على النقاط الرئيسية، بينما في الاجتماع القياسي، يتعين عليك حضور الاجتماع كاملاً.

الخلاصة الكبرى

تختتم الورقة بـ "وصفة بسيطة" لبناء ذكاء اصطناعي أفضل وأرخص:

  1. لا تكرر الغرف القياسية فحسب. (هذا يجعل الذكاء الاصطناعي أسوأ).
  2. قم بتكرار "غرف المتخصصين" (MoE). (هذا يجعل الذكاء الاصطناعي أذكى وأصغر).
  3. استخدم حدود التكرار كأبواب للخروج. (هذا يوفر قدرة الحوسبة).

من خلال الجمع بين هذه العناصر، تحصل على نموذج أسهل في التخزين، وأسرع في التشغيل، وبذكاء يضاهي (أو يتفوق على) النماذج الضخمة الموجودة لدينا اليوم. تطلق الورقة على هذا الهيكل اسم Looped-MoE.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →