← أحدث الأبحاث
🤖 machine learning

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

تقدم هذه الورقة "إنتروبيا المهارة" (Skill Entropy) كمقياس مبتكر لتحديد صعوبة التبديل بين مهارات الاستدلال، وتقترح معيار "Skill²-Bench" لتقييم المهام طويلة الأمد متعددة المهارات، وتثبت أن إطار تدريب "التعلم المعزز بإنتروبيا المهارة" (Skill-Entropy RL) يحسن بشكل كبير أداء النموذج في هذه المشكلات المعقدة متعددة الخطوات.

المؤلفون الأصليون: Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

نُشر 2026-08-06
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

ملخص تقني: نحو نماذج لغوية كبيرة أصلية المهارة: إنتروبيا المهارة لتقييم وتدريب الاستدلال طويل الأمد

1. بيان المشكلة

أظهرت النماذج اللغوية الكبيرة (LLMs) الحديثة قدرات قوية في الاستدلال طويل الأمد، مما دفع عجلة التقدم في الأبحاث العميقة، والبرمجة الوكيلية (agentic coding)، والتخطيط متعدد الخطوات. ومع ذلك، غالبًا ما تتطلب المهام الواقعية طويلة الأمد استدلالًا عابرًا للمهارات: حيث يجب أن ينتقل تسلسل التفكير الواحد بسلاسة بين مهارات استدلال متميزة (مثل الانتقال من الاشتقاق الرياضي إلى تخطيط الجداول الزمنية، ثم إلى استخراج المعلومات).

تقوم المعايير المرجعية الحالية عادةً بتقييم المهارات الفردية بشكل منعزل أو ربط الخطوات ضمن نطاق واحد. وهي تفتقر إلى آلية مبدئية لقياس أو معالجة صعوبة التبديل بين المهارات المختلفة داخل سلسلة الاستدلال. وتشير الملاحظات التجريبية إلى أنه بينما تؤدي النماذج الرائدة بشكل جيد في معايير المهارة الواحدة، فإنها تظهر هشاشة في المهام التركيبية العابرة للمهارات. هذه "فجوة تبديل المهارات" تستمر حتى عندما يتعامل النموذج بشكل جيد مع كل مهارة مكونة على حدة، مما يشير إلى أن القدرة على تبديل المهارات هي قدرة متعامدة مع الكفاءة الخاصة بكل نطاق.

2. المنهجية

2.1 إنتروبيا المهارة (SkE)

قدم المؤلفون إنتروبيا المهارة، وهي مقياس زوجي موجه يحدد كمية صعوبة الانتقال من مهارة sas_a إلى أخرى sbs_b.

  • التعريف: تُعرف إنتروبيا المهارة بأنها نسبة ممهدة بين متوسط دقة المهارة الواحدة والدقة العابرة للمهارات تحت نموذج مرجعي ثابت.
    SkE(sa,sb)=12(Accuracy(sa)+Accuracy(sb))+αAccuracy(sa,sb)+α \text{SkE}(s_a, s_b) = \frac{\frac{1}{2}(\text{Accuracy}(s_a) + \text{Accuracy}(s_b)) + \alpha}{\text{Accuracy}(s_a, s_b) + \alpha}
    حيث α\alpha هو ثابت تنعيم لابلات (Laplace smoothing constant).
  • التفسية: القيمة >1>1 تشير إلى أن ربط المهارتين يضيف صعوبة كبيرة مقارلة بالتعامل مع كل منهما على حدة (صعب التبديل). أما القيمة 1\le 1 فتشير إلى أن التبديل سهل.
  • المقياس على مستوى المهمة: بالنسبة لمهمة عابرة للمهارات τ\tau ذات تسلسل مهارات (s1,,sL)(s_1, \dots, s_L)، فإن إنتروبيا المهارة على مستوى المهمة هي متوسط الإنتروبيا الزوجية على طول التسلسل:
    SkE(τ)=1L1i=1L1SkE(si,si+1) \text{SkE}(\tau) = \frac{1}{L-1} \sum_{i=1}^{L-1} \text{SkE}(s_i, s_{i+1})

2.2 Skill2-Bench

بناءً على إطار عمل إنتروبيا المهارة، أنشأ المؤلفون Skill2-Bench، وهو معيار للقدرة على الاستدلال طويل الأمد العابر للمهارات.

  • النطاق: يغطي 558 مهارة عبر 9 مجالات: الرياضيات، العلوم، البرمجة، المنطق، استخراج المعلومات، التخطيط، الكتابة الإبداعية، استرجاع السياق، واتباع التعليمات.
  • البناء: يتم تركيب المهام عن طريق أخذ عينات من تسلسلات المهارات عند مستويات إنتروبيا محددة (منخفضة، متوسطة، عالية) وإعادة كتابة الأسئلة الأصلية في سيناريو متماسك حيث تعتمد كل خطوة على مخرجات الخطوة السابقة.
  • بروتوكول التقييم: يتم تقييم النماذج في وضعين:
    1. وضع المهارة الواحدة: يتم الإجابة على الخطوات بشكل منعزل.
    2. الوضع العابر للمهارات: يتم تقديم المهمة الكاملة طويلة الأمد، مما يتطلب تبديلًا تسلسليًا.

2.3 التعلم التعزيزي لإنتروبيا المهارة (Skill-Entropy RL)

لمعالجة الفجوة المحددة، اقترح المؤلفون إطار عمل للتعلم التعزيزي يسمى Skill-Entropy RL، والذي يستخدم إنتروبيا المهارة كإشارة تدريب.

  • تنسيق المخرجات: يتم تدريب النموذج على إصدار استجابة مهيكلة لكل خطوة، بحيث يتنبأ صراحةً بكل من المهارة المستخدمة والإجابة:
    <skill> Domain_Skill </skill><answer> Step Answer </answer>
  • دالة المكافأة: تجمع المكافأة الإجمالية rr بين صحة الخطوة (ransr_{ans}) ومكافأة إنتروبيا المهارة (rentr_{ent}):
    r=λansrans+λentrent r = \lambda_{ans} r_{ans} + \lambda_{ent} r_{ent}
    • ransr_{ans}: متوسط الدقة لكل خطوة بناءً على مقيمات خاصة بكل مجال.
    • rentr_{ent}: يقيس مدى التوافق بين تسلسل المهارات المتوقع وتسلسل المهارات الذهبي من خلال مقارنة رتب إنتروبيا المهارة على مستوى المهمة. وهذا يشجع النموذج على التنبؤ بسلسلة مهارات تطابق ملف الصعوبة الخاص بالحقيقة الأرضية (ground truth).
  • خط أنابيب التدريب: تستخدم الطريقة عملية من مرحلتين: الضبط الدقيق الخاضع للإشراف (SFT) على مسارات موسومة بالمهارات، يليه تحسين السياسة النسبي الجماعي (GRPO) باستخدام المكافأة المركبة.

3. النتائج الرئيسية

3.1 نتائج التقييم (Skill2-Bench)

  • فجوة تبديل المهارات: يكشف تقييم 8 نماذج رائدة و4 نماذج مفتوحة المصدر عن انخفاض مستمر في الأداء مع زيادة إنتروبيا المهارة على مستوى المهمة. تنخفض الدقة بشكل شبه رتيب من المهام ذات الإنتروبيا المنخفضة إلى العالية.
  • عقوبة المهارات العابرة: عندما يتم ممارسة نفس المهارات ضمن مهمة عابرة للمهارات بدلاً من القيام بها بشكل منعزل، تنخفض الدقة بنسبة 4% إلى 13% عبر النماذج. وتستمر هذه العقوبة حتى بالنسبة للمهارات التي يتمتع فيها النموذج بكفاءة عالية في العزل (مثل المنطق).
  • تحليل نمط الفشل: نمط الفشل المهيمن هو قصور المهارة (skill inertia). في الخطوات اللاحقة من المهمة، تميل النماذج إلى إعادة استخدام المهارة ونمط الإجابة من الخطوة السابقة بدلاً من التبديل إلى المهارة المطللة. على سبيل المثال، قد يستمر النموذج في استخدام مهارة "الرياضيات" مع تنسيق إجابة رقمي عندما تتطلب الخطوة التالية "كتابة إبداعية" مع نص أدبي.

3.2 أداء التدريب (Skill-Entropy RL)

  • تحسينات ملحوظة: على نموذج Qwen3-4B-Instruct، حسّن Skill-Entropy RL درجة Skill2-Bench من 34.4% إلى 68.4%. وعلى نموذج Qwen3-1.7B، تحسنت الدرجة من 14.6% إلى 40.1%.
  • المقارنة: تتفوق الطريقة على النماذج المنافسة، بما في ذلك GRPO القياسي (بدون مكافأة الإنتروبيا)، وSFT، وطرق ما بعد التدريب الأخرى الواعية بالمهارة (Skill-Distill, SkillRL, STAT).
  • التعميم:
    • المجالات المفتوحة: على الرغم من التدريب فقط على المجالات القابلة للتحقق، أظهر النموذج مكاسب في المجالات المفتوحة (الكتابة الإبداعية، استرجاع السياق)، مما يشير إلى أن إشارة إنتروبيا المهارة تنتقل إلى المجالات غير المرئية.
    • البيانات الجاهزة: تم تطبيق خط الأنابيب بنجاح على OpenR1-Math، وهو مجموعة بيانات لم تكن مهيكلة أصلاً بتسلسلات مهارات صريحة. ومن خلال وسم المسارات الموجودة بالمهارات، استمرت مكافأة إنتروبيا المهارة في تحسين الأداء، مما يثبت قابليتها لإعادة الاستخدام.

4. الأهمية والادعاءات

يدعي البحث معالجة فجوة حرجة في تقييم وتدريب النماذج اللغوية الكبيرة للاستدلال المعقد:

  1. مقياس جديد: قدم إنتروبيا المهارة كمقياس زوجي موجه ومبدئي لقياس صعوبة تبديل المهارات، متجاوزًا التقييم أحادي المجال.
  2. المعيار المرجعي: يوفر Skill2-Bench أول معيار واسع النطاق (558 مهارة، 9 مجالات) تمت معايرته بواسطة هذا المقياس، مما يكشف عن "فجوة تبديل المهارات" الهيكلية التي تغفلها التقييمات أحادية المجال.
  3. إشارة التدريب: يثبت أن إنتروبيا المهارة ليست مجرد أداة تشخيصية بل هي إشارة تدريب قابلة لإعادة الاستخدام. من خلال دمجها في دالة مكافأة التعلم التعزيزي، تتعلم النماذج إدارة انتقالات المهارات صراحةً، مما يحسن قدرات الاستدلال طويل الأمد بشكل كبير.
  4. تحديد نمط الفشل: يحدد العمل بشكل ملموس "قصور المهارة" (إعادة استخدام مهارة/نمط الخطوة السابقة) كسبب رئيسي للفشل في المهام العابرة للمهارات ويوفر آلية للتخفيف من ذلك.

يخلص المؤلفون إلى أن التعامل مع تبديلات المهارات هو قدرة متعامدة مع كفاءة المجال، وأن النماذج اللغوية الكبيرة "الأصلية المهارة" (Skill-Native)—وهي النماذج المدربة على التنبؤ بإدارة تسلسلات مهاراتها الخاصة صراحةً—هي مسار قابل للتطبيق نحو استدلال قوي طويل الأمد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →