← أحدث الأبحاث
🤖 machine learning

Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

تقترح هذه الورقة البحثية "معايرة المعامل الأمثل" (OCC)، وهي مخطط تكيفي مستمد من تحليل استمثالي لتفاعلات التدرج، لتمكين التدريب المشترك الفعال بين "التنبؤ متعدد الرموز" و"التعلم التعزيزي من المكافآت القابلة للتحقق"، وذلك للتغلب على تدهور الأداء السابق وتحقيق نتائج متفوقة في معايير اختبار الاستدلال الرياضي.

المؤلفون الأصليون: Zili Wang, Jiajun Chai, Lin Chen, Xiaohan Wang, Shiming Xiang, Guojun Yin

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zili Wang, Jiajun Chai, Lin Chen, Xiaohan Wang, Shiming Xiang, Guojun Yin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات إبداعية.

الصورة الكبيرة: مدربان، ورياضي واحد

تخيل أنك تقوم بتدريب روبوت ضخم فائق الذكاء (نموذج لغوي كبير - LLM) لحل مسائل رياضية صعبة.

  1. المدرب الرئيسي (RL): هذا المدرب يعلم الروبوت كيف يفوز. ينظر إلى إجابات الروبوت، ويعطيه "إبهاماً للأعلى" للحلول الصحيحة و"إبهاماً للأسفل" للحلول الخاطئة. يتعلم الروبوت تكرار ما ينجح والتوقف عما لا ينجح. هذا ما يسمى التعلم التعزيزي (Reinforcement Learning).
  2. المدرب المساعد (MTP): هذا المدرب عبارة عن وحدة خاصة تحاول التنبؤ بـ الكلمات القليلة التالية التي سيقولها الروبوت، وليس الكلمة التالية فقط. هذا يسمى التنبؤ متعدد الرموز (Multi-Token Prediction). إنه يشبه مدرباً يساعد الروبوت على التخطيط لجمله مسبقاً.

المشكلة:
في السابق، حاول الباحثون جعل كلا المدربين يدربان الروبوت في نفس الوقت. لكن شيئاً ما سار بشكل خاطئ؛ بدأ الروبوت يؤدي بشكل أسوأ مما لو كان لديه المدرب الرئيسي فقط.

بسبب ذلك، قررت معظم الفرق "طرد" المدرب المساعد خلال مرحلة تدريب "الفوز". تركوا المدرب المساعد يراقب، لكنهم لم يسمحوا لنصيحة المدرب المساعد بتغيير دماغ الروبوت. لقد قاموا بـ "فصل" (detach) المدرب المساعد.

السؤال:
تساءل مؤلفو هذه الورقة: لماذا يتسبب وجود كلا المدربين في إضعاف الروبوت؟ هل يمكننا إصلاح الأمر بحيث يمكن للمدربين العمل معاً دون إفساد التدريب؟


التشخيص: مشكلة "الدفع والسحب"

نظر المؤلفون في الرياضيات الكامنة وراء التدريب ووجدوا الإجابة. أدركوا أنه عندما يحاول المدرب المساعد تقديم النصيحة، فإنه يخلق قوتين متضادتين على دماغ الروبوت:

  1. الدفع المفيد (الارتباط): أحياناً، تشير نصيحة المدرب المساعد في نفس اتجاه المدرب الرئيسي. هذا جيد! يشبه الأمر شخصين يدفعان سيارة في نفس الاتجاه.
  2. التذبذب المزعج (العقوبة): أحيناً، تكون نصيحة المدرب المساعد مجرد "ضجيج". فهي تدفع دماغ الروبوت في اتجاهات عشوائية لا تساعد على الفوز. هذا يشبه شخصاً يهز السيارة بينما تحاول أنت قيادتها.

لماذا فشلت الطرق القديمة:

  • الطريقة (أ) (الفصل - Detach): قاموا بإيقاف "دفع" المدرب المساعد. كانت طريقة آمنة، لكنهم فوتوا فرصة الحصول على "الدفع المفيد".
  • الطريقة (ب) (الاعتلاج المتقاطع - Cross-Entropy): سمحوا للمدرب المساعد بالدفع، لكن المدرب المساعد كان يحاول تعليم الروبوت التنبؤ بـ كل كلمة بالتساوي، حتى الكلمات الخاطئة. هذا خلق الكثير من "التذبذب" وقليلاً جداً من "الدفع". أصيب الروبوت بالارتباك وأصبح أداؤه أسوأ.
  • الطريقة (ج) (خسارة السياسة - Policy Loss): أخبروا المدرب المساعد باستخدام نفس قواعد "الفوز" الخاصة بالمدرب الرئيسي. في البداية، نجح هذا بشكل رائع! كان "الدفع" قوياً. ولكن مع تحسن مستوى الروبوت، بدأ المدربان يختلفان قليلاً. ظل "التذبذب" كما هو، بينما ضعف "الدفع المفيد". في النهاية، سيطر التذبذب، وانهار أداء الروبوت.

التشبيه:
تخيل أنك تحاول السير على حبل مشدود (تدريب RL).

  • الفصل (Detach) هو السير بمفردك. آمن، لكنه بطيء.
  • التدريب المشترك القديم هو أن يمسك بك صديق من يدك، لكنه مخمور. هو يسحبك بعيداً عن الحبل.
  • مشكلة "الارتفاع والانخفاض" هي أن يكون لديك صديق صاحٍ يساعدك في البداية، ولكن مع شعورك بالتعب، يبدأ في سحبك في الاتجاه الخاطئ، مما يؤدي إلى سقوطك.

الحل: "المعدل الذكي" (OCC)

أدرك المؤلفون أن المشكلة لم تكن في أن المدرب المساعد سيء؛ بل كانت في أن مستوى صوت نصيحته عالق عند مستوى ثابت.

  • في بداية التدريب: يكون المدرب المساعد مفيداً جداً. يجب أن نرفع "صوت" نصيحته.
  • في نهاية التدريب: يبدأ المدرب المساعد في أن يصبح مصدر تشتيت. يجب أن نخفض "صوت" نصيحته.

لقد ابتكروا نظاماً جديداً يسمى معايرة معامل الأمثلية (Optimal Coefficient Calibration - OCC).

كيف يعمل (الاستعارة الإبداعية):
فكر في OCC كأنه منظم حرارة ذكي (Thermostat) لعملية التدريب.

  • بدلاً من ضبط درجة الحرارة (وزن التدريب) على رقم ثابت، يتحقق منظم الحرارة باستمرار من الغرفة.
  • يستخدم "وسيطاً" (مستشعراً سريعاً ورخيصاً) للتحقق مما إذا كان المدرب المساعد يساعد حالياً أم يضر.
  • إذا كان المدرب المساعد يدفع في الاتجاه الصحيح، يقوم منظم الحرارة برفع "الصوت".
  • إذا بدأ المدرب المساعد في الانحراف والتسبب في الضجيج، يقوم منظم الحرارة بخفض "الصوت".

يحدث هذا تلقائياً، خطوة بخطوة، دون الحاجة إلى التوقف وحساب رياضيات معقدة قد تبطئ كل شيء.


النتائج: نهاية سعيدة

اختبر المؤلفون هذا "المعدل الذكي" الجديد في ست مسابقات رياضية صعبة (مثل AIME وOlympiad).

  1. تفوق على الطرق القديمة: الروبوت الذي تدرب باستخدام "المعدل الذكي" (OCC) حل مسائل أكثر من الروبوت الذي تدرب باستخدام المدرب الرئيسي فقط (Detach).
  2. أصلح مشكلة الانهيار: على عكس طريقة "خسارة السياسة" (Policy Loss) التي بدأت قوية ثم فشلت، ظل منهج OCC قوياً من الخطوة الأولى وحتى الأخيرة.
  3. كان سريعاً: لم يؤدِ "المعدل الذكي" إلى إبطاء التدريب. لقد كان بنفس سرعة طريقة "الفصل" (Detach) القديمة لأنه استخدم اختصاراً ذكياً للتحقق من مستوى الصوت بدلاً من إجراء حسابات ثقيلة.

الملخص

تثبت الورقة أنه يمكنك تدريب روبوت مع وجود مدرب رئيسي ومدرب مساعد، ولكن لا يمكنك تركهم على إعداد ثابت. أنت بحاجة إلى نظام ديناميكي يستمع إلى عملية التدريب ويعدل تأثير المدرب المساعد في الوقت الفعلي. عندما تفعل ذلك، يتعلم الروبوت بشكل أفضل وأسرع من أي وقت مضى.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →