← أحدث الأبحاث
💬 NLP

Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models

تقدم هذه الورقة Lightning OPD 2.0، وهي طريقة تقطير جديدة قائمة على السياسة (on-policy) تخفف من انحياز الأسلوب في إعدادات المعلم المتعدد عبر توظيف عملية "تخلف الأسلوب المتقاطع" (cross-fitted style residualization) لفصل الاختلافات الأسلوبية عن إشارات الاستدلال الحقيقية، مما يتيح نقلاً فعالاً للمعرفة حتى عندما يكون مولد بيانات الضبط الدقيق للتعليمات (SFT) ومعلم التقطير نموذجين مختلفين.

المؤلفون الأصليون: Yecheng Wu, Song Han, Han Cai

نُشر 2026-07-31
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yecheng Wu, Song Han, Han Cai

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طالب عبقري غريب الأطوار كيفية حل الألغاز المعقدة. لديك "معلم" وهو عبقري في الرياضيات والبرمجة، و"طالب" متلهف للتعلم. في عالم الذكاء الاصطناعي، يُسمى هذا التقطير (Distillation): حيث يحاول الطالب نسخ طريقة تفكير المعلم ليصبح أكثر ذكاءً. عادةً، أفضل طريقة للقيام بذلك هي أن يتدرب الطالب على مسائل قام المعلم بحلها بالفعل، ثم يقوم المعلم بتقييم محاولات الطالب الجديدة سطراً بسطر. يُسمى هذا التقطير على السياسة المتبعة (On-Policy Distillation). الأمر يشبه وجود مدرب يراقب كل حركة تقوم بها ويقدم لك ملاحظات فورية، بدلاً من الانتظار حتى نهاية المباراة ليقول لك "أحسنت" أو "حاول مجدداً".

ومع ذلك، هناك عقبة. لكي يعمل هذا التدريب بشكل مثالي، يجب أن يكون المعلم هو نفسه الشخص الذي كتب المسائل التدريبية الأصلية التي درسها الطالب. إذا تعلم الطالب من كتاب كتبه "المعلم أ"، ولكن "المعلم ب" هو من يقيمه الآن، فقد تصبح الأمور فوضوية. حتى لو كان المعلم ب عبقرياً، فقد يكتب بأسلوب مختلف، أو يستخدم كلمات مختلفة، أو يفكر بإيقاع مختلف. قد يرتبك الطالب، معتقداً أن المعلم يصحح مسألته الرياضية بينما هو في الواقع منزعج من خط يده. تتناول هذه الورقة البحثية مشكلة ما يحدث عندما يكون "المعلم" الذي يقيم العمل مختلفاً عن الشخص الذي كتب الأمثلة الأصلية، وكيفية إصلاح هذا الارتباك لكي يتمكن الطالب من التعلم بفعالية.


المشكلة: عندما لا يتوافق المدرب مع الكتاب المدرسي

لاحظ الباحثون في الورقة البحثية خللاً محبطاً. كانوا يستخدمون تقنية تسمى Lightning OPD (التقطير على السياسة المتبوعة) لتدريب نماذج الذكاء الاصطناعي لتصبح أفضل في الرياضيات والبرمجة. كان الإعداد بسيطاً: خذ نموذجاً تعلم بالفعل من بعض الأمثلة (مرجع SFT)، واتركه يولد إجابات جديدة، ثم اجعل "معلماً" فائق الذكاء يقيم تلك الإجابات ليعلم الطالب المزيد.

بدأت المشكلة عندما لم يكن "المعلم" هو نفس النموذج الذي كتب الأمثلة الأصلية. وجد الباحثون أنه عندما استبدلوا المعلم بنموذج آخر، حتى لو كان أقوى، فإن أداء الطالب لم يتحسن؛ بل أحياناً ساء!

لماذا؟ أدرك الباحثون أن المعلم لم يكن يصحح المنطق فحسب (الرياضيات أو الكود)؛ بل كان يصحح أيضاً الأسلوب. تخيل طالباً يكتب برهاناً رياضياً؛ قد يكتب: "بناءً على ذلك، الإجابة هي 42". معلم آخر قد يفضل: "وبالتالي، نستنتج أن الحل هو 42". إذا كان المعلم صارماً بشأن الأسلوب، فقد يعطي درجة منخفضة لكلمة "بناءً على ذلك" رغم أن الرياضيات صحيحة تماماً. يبدأ الطالب، وهو مرتبك، في تغيير منطقه فقط لإرضاء عادات الكتابة الخاصة بالمعلم. أطلق الباحثون على هذا اسم "تحيز الأسلوب" (Style Bias). كان اختلاف المعلم مع الطالب مزيجاً من التصحيحات المفيدة (إصلاح خطوة خاطئة) والضجيج غير المفيد (إصلاح اختيار كلمة)، ولم يستطع الطالب التمييز بينهما.

الحل: Lightning OPD 2.0

لإصلاح ذلك، ابتكر الفريق Lightning OPD 2.0. كانت فكرتهم هي العمل كالمحقق، عبر فصل شكاوى "الأسلوب" عن شكاوى "المنطق" قبل أن يتعلم منها الطالب.

إليكم كيف فعلوا ذلك، باستخدام تشبيه مرح:

تخيل أن المعلم والطالب يجريان محادثة. يقول المعلم: "لا يعجبني الكلمة التي استخدمتها"، و"لا تعجبني الخطوة الرياضية التي اتخذتها".

  1. عمل المحقق: أدرك الباحثون أن شكاوى "الأسلوب" يمكن التنبؤ بها. إذا كان المعلم يكره كلمة "بناءً على ذلك" في مسألة رياضية، فمن المرجح أنه سيكرهها في كل مسألة رياضية، بغض النظر عن الأرقام المحددة. إنه نمط متكرر.
  2. خدعة الملاءمة المتقاطعة (Cross-Fitting): لإيجاد هذه الأنماط، قاموا بتقسيم جميع المسائل التدريبية إلى مجموعات. نظروا إلى المجموعة (أ) لمعرفة ما اشتكى منه المعلم في المجموعة (ب)، والمجموعة (ب) لمعرفة ما اشتكى منه المعلم في المجموعة (أ). تسمى هذه العملية الملاءمة المتقاطعة (cross-fitting). إنها تشبه سؤال مجموعة من الأصدقاء: "ما هي الكلمات التي يكرهها المعلم دائماً؟" دون السمالو الشخص الذي يتم تقييمه بالتأثير على الإجابة.
  3. طرح الضجيج: بمجرد تحديد "تحيز الأسلوب" (الشكاوى المتكررة حول الكلمات، والتنسيق، والإيقاع)، قاموا بطرحه من إجمالي درجة المعلم.
  4. النتيجة: ما تبقى كان "الباقي" (Residual)—وهو التغذية الراجعة النقية والمفيدة المتعلقة بالمنطق الفعلي. أصبح الطالب الآن يتعلم فقط من أجزاء ملاحظات المعلم التي تهم فعلياً لحل المسألة، متجاهلاً التذمر الأسلوبي.

ما وجدوه

اختبر الباحثون هذه الطال الجديدة على نموذجين مختلفين تماماً من طلاب الذكاء الاصطناي: نموذج بـ 4 مليارات معلمة (متعلم أصغر وأسرع) ونموذج بـ 8 مليارات معلمة (أكبر وأكثر تقدماً). استخدموا نموذجاً ضخماً وفائق الذكاء كـ "معلم" لكليهما.

كانت النتائج واضحة:

  • بدون الإصلاح (Lightning OPD الأصلي): عندما كان المعلم مختلفاً عن كاتب الأمثلة الأصلي، لم يتحسن الطالب إلا قليلاً. لقد طغى تحيز الأسلوب على النصائح الجيدة.
  • مع الإصلاح (Lightning OPD 2.0): تعلم الطالب بشكل أسرع وأصبح أكثر ذكاءً بشكل ملحوظ.

على وجه التحديد، عند البدء بنموذج بـ 8 مليارات معلمة، ساعدت الطريقة الجديدة الذكاء الاصطناعي على الوصول إلى دقة 82.4% في مسابقة AIME 2024 (وهي مسابقة رياضيات صعبة للمرحلة الثانوية) و 63.0% في LiveCodeBench v5 (تحدي برمجي). كانت هذه قفزة كبيرة مقارنة بالطريقة الأصلية، التي عانت لتحسين درجة الطالب في سيناريوهات "المعلم غير المتطابق" هذه.

لماذا يهم هذا الأمر؟

تشير الورقة البحثية إلى أنك لست مضطراً لإجبار "المعلم" و"كاتب الأمثلة" على أن يكونا نفس الشخص بعد الآن. في الماضي، إذا كنت تريد استخدام معلم محدد فائق الذكاء لتقييم الذكاء الاصطناعي الخاص بك، كان عليك التأكد من أن هذا المعلم هو أيضاً من كتب جميع بيانات التدريب الخاصة بك. كان ذلك مكلفاً ومحدوداً.

تقترح Lightning OPD 2.0 أنه يمكنك اختيار أفضل معلم ممكن للتقييم وأفضل مصدر ممكن لبيانات التدريب الخاصة بك، حتى لو كانا نموذجين مختلفين. من خلال إزالة "شكاوى الأسلوب" رياضياً، يمكن للذكاء الاصطناعي تعلم المنطق دون أن يرتبك بـ شخصية المعلم. إنها طريقة عملية لجعل تدريب الذكاء الاصطناعي أكثر مرونة وكفاءة، مما يسمح للباحثين بخلط ومطابقة أفضل الأدوات المتاحة دون القلق من تعارضها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →