One-Way Policy Optimization for Self-Evolving LLMs
تقدم هذه الورقة البحثية "تحسين السياسة أحادي الاتجاه" (One-Way Policy Optimization - OWPO)، وهي طريقة مبتكرة تعمل على تثبيت وتعزيز التطور الذاتي للنماذج اللغوية الكبيرة من خلال فصل اتجاه التحسين عن مقدار التحديث عبر إعادة الوزن غير المتماثل وتحديثات المرجع التكرارية، مما يؤدي إلى التغلب على عدم كفاءة القيود الحالية على مستوى الرموز (tokens) وتمكين التحسين المستمر دون الحاجة إلى نماذج مرجعية خارجية.
إليك شرح لورقة بحثية بعنوان "تحسين السياسة أحادية الاتجاه لنماذج اللغة الكبيرة ذاتية التطور" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.
المشكلة الكبرى: معضلة "العالق في المنتصف"
تخيل أنك تعلم روبوتًا (ذكاءً اصطناعيًا) كيفية حل مسائل رياضية معقدة. لديك قاضٍ (مُحقّق) لا يمكنه إلا أن يقول "صواب" أو "خطأ" في نهاية الحل تمامًا.
المشكلة: نظرًا لأن القاضي لا يتحدث إلا في النهاية، غالبًا ما يضل الروبوت طريقه. هو لا يعرف أي خطوة كانت خاطئة، لذا يتعلم ببطء ويصاب بالارتباك.
الحل القديم: للمساعدة في ذلك، قدم الباحثون نموذجًا مرجعيًا (بمثابة "معلم"). أخبروا الروبوت: "ابقَ قريبًا من أسلوب المعلم". جعل هذا عملية التدريب مستقرة، لكنه خلق مشكلة جديدة.
المشكلة الجديدة: في بعض الأحيان، يكتشف الروبوت طريقة أفضل لحل مسألة ما مما فعله المعلم نفسه. ولكن نظرًا لأن الروبوت مُجبر على البقاء قريبًا من المعلم، فإن النظام يعاقبه لأنه أصبح مختلفًا. الأمر يشبه طالبًا وجد طريقًا مختصرًا أسرع للوصة إلى الإجابة، لكن المعلم يصرخ في وجهه: "لا! يجب أن تسلك الطريق الطويل الذي علمتك إياه!". هكذا يظل الروبوت عالقًا ولا يستطيع التحسن فوق مستوى المعلم.
الحل: تحسين السياسة أحادية الاتجاه (OWPO)
يقترح المؤلفون طريقة جديدة تسمى OWPO. فكر فيها كمدرب ذكي يفصل بين الاتجاه والسرعة.
1. قاعدة المدرب:
الاتجاه:القاضي هو من يقرر الاتجاه. إذا قال القاضي "هذا المسار جيد"، يسلك الروبوت هذا المسار. وإذا قال القاضي "هذا المسار سيء"، يلتف الروبوت ويعود. المعلم لا يقرر الاتجاه أبدًا.
السرعة:المعلم هو من يقرر سرعة الحركة.
2. الشارع ذو الاتجاهين (إعادة الوزن غير المتماثل): تعامل تقنية OWPO محاولات الروبوت بشكل مختلف بناءً على ما إذا كانت "أسوأ" أو "أفضل" من المعلم.
السيناريو (أ): الروبوت متأخر (الانحراف الأدنى)
الحالة: الروبوت غير متأكد أو يرتكب أخطاء في المواضع التي كان فيها المعلم واثقًا.
الإجراء: يقوم المدرب بتسريع التعلم. يقول له: "أنت متأخر عن المعلم هنا! تحرك بسرعة لتلحق به!". وهذا ما يسمى المحاذاة المتسارعة.
السيناريو (ب): الروبوت متقدم (الانحراف الأسمى)
الحالة: يجد الروبوت حلاً أفضل أو يكون أكثر ثقة من المعلم.
الإجراء: يقوم المدرب بإبطاء التغييرات. يقول له: "أنت تفعل شيئًا رائعًا هنا! لا تتغير كثيرًا، وإلا قد تفقد هذه الفكرة الجيدة بالخطأ". وهذا ما يسمى قفل المكاسب (Gain Locking). إنه يحمي أفكار الروبوت الجديدة والأفضل من أن تضيع بسبب الضجيج العشوائي.
"تأثير مِسنّ السقاطة" (Ratchet Effect): كسر السقف
في الماضي، بمجرد أن يصبح الروبوت بجودة المعلم، لم يكن بإمكانه أن يصبح أفضل من ذلك لأن المعلم كان هو الحد الأقص️.
تقدم OWPO آلية السقاطة (مثل أداة تدور في اتجاه واحد فقط ولا تنزلق للخلف أبدًا).
كل بضع خطوات، يأخذ الروبوت استراحة، وينظر إلى أفضل أعماله، ويقول: "حسنًا، أنا الآن هو المعلم".
يقوم بتحديث النموذج المرجعي ليكون هو أفضل نسخة حالية لنفسه.
هذا يخلق سُلّمًا. يتسلق الروبوت، ثم يثبت الدرجة التي وصل إليها، ويستخدم ارتفاعه الجديد كقاعدة ليتسلق أعلى منها. هو لا ينزلق أبدًا للأسفل نحو المعلم القديم الأضعف.
لماذا يهم هذا (النتائج)
اختبرت الورقة البحثية ذلك على المسائل الرياضية (مثل مسابقة AIME).
الطرق القديمة: كان الروبوت يعلق بالقرب من مستوى المعلم. إذا كان المعلم جيدًا بنسبة 37%، فإن الروبوت يظل يحوم حول 37% أو 38%.
OWPO: كسر الروبوت السقف. بدأ بنسبة 30%، وتجاوز المعلم، ووصل إلى دقة تزيد عن 40%.
الاستقرار: على عكس الطرق الأخرى التي قد تنهار أو تصبح غير مستقرة عند محاولة أن تكون مبدعة للغاية، تحافظ OWPO على ثبات الروبوت من خلال "قفل" أفكاره الجيدة في مكانها.
تشبيه ملخص
تخيل متسلقًا (الذكاء الاصطناعي) يحاول تسلق جبل.
القاضي هو البوصلة التي تشير إلى القمة.
المعلم القديم كان عبارة عن خريطة تقول: "ابقَ على هذا المسار المحدد". إذا وجد المتسلق طريقًا مختصرًا، تجبره الخريطة على العودة إلى المسار القديم.
OWPO هو دليل ذكي. يقول الدليل: "إذا كنت بعيدًا عن المسار وضائعًا، فاركض بسرعة للعودة إليه. ولكن إذا وجدت طريقًا مختصرًا يؤدي إلى نقطة أعلى، فتمهل وامشِ بحذر حتى لا تنزلق، ولكن استمر في السير في ذلك المسار الجديد. وبمجرد وصولك إلى نقطة مرتفعة جديدة، حدّث الخريطة لتظهر أنك أنت الآن الخبير، وابدأ في البحث عن الاختصار التالي من هناك".
يسمح هذا للذكاء الاصطناعي بالتطور المستمر، ليصبح أفضل وأفضل دون الحاجة إلى "معلم خارق" يمسك بيده للأبد.
ملخص تقني: تحسين السياسة أحادي الاتجاه (One-Way Policy Optimization) للنماذج اللغوية الكبيرة ذاتية التطور
1. بيان المشكلة
تتناول الورقة البحثية أوجه القصور في التعلم التعزيزي مع المكافآت القابلة للتحقق (RLVR) في توسيع قدرات الاستدلال للنماذج اللغوية الكبيرة (LLMs). وبينما يمثل RLVR نموذجاً واعداً للمهام ذات النتائج القابلة للفحص (مثل الرياضيات والبرمجة)، فإنه يواجه تحديين رئيسيين:
الإشارات المتفرقة والثنائية: عادة ما تتوفر مكافآت المُحقِّق (Verifier) على مستوى التسلسل فقط، مما يؤدي إلى تباين عالٍ، وكفاءة عينة منخفضة، وعدم استقرار في عملية التحسين.
صراع "عكس القوة" (Force Reversal) في الأساليب الموجهة بالمرجع: لضمان استقرار التدريب، تضع الأساليب الحالية (مثل RL المنظم بـ KL، أو التقطير داخل السياسة - On-Policy Distillation) سياسة مرجعية (πref) لتوفير قيود كثيفة على مستوى الرموز (tokens). ومع ذلك، تفرض هذه الأساليب قيوداً متماثلة تعاقب أي انحراف عن المرجع، بغض النظر عما إذا كان هذا الانحراف يحسن المكافأة أم لا.
المشكلة الجوهرية: عندما تحاول السياسة التفوق على المرجع (انحراف متفوق - Superior deviation)، فإن عقوبة KL المتماثلة أو خسارة التقطير تمارس قوة "سحب للخلف" نحو المرجع. وإذا كانت هذه القوة قوية بما يكفي، فإنها تعكس اتجاه التحسين، محولةً خطوة لتحسين المكافأة إلى خطوة للوراء. وهذا يخلق سقفاً للأداء، مما يمنع النموذج من التطور بما يتجاوز المبدأ الأولي (prior).
2. المنهجية: تحسين السياسة أحادي الاتجاه (OWPO)
تقترح الورقة إطار عمل تحسين السياسة أحادي الاتجاه (OWPO)، المصمم لفصل اتجاه التحسين عن مقدار التحديث.
المبدأ الأساسي
الاتجاه: يحدده حصرياً المُحقِّق (عبر إشارة الميزة At). يحدد المُحقِّق ما إذا كان الرمز صحيحاً أم خاطئاً.
المقدار: يتم تعديله بواسطة السياسة المرجعية (πref). تعمل المرجعية فقط لضبط حجم الخطوة، وليس لعكس الاتجاه.
الآلية: إعادة الوزن غير المتماثل
يقدم OWPO وزناً قياسياً ديناميكياً wt يُطبق على هدف PPO/DAPO القياسي. يتم تحديد هذا الوزن بناءً على الانحراف الاتجاهي (δt)، المعرف كالتالي: δt(θ)≜sgn(At)⋅logπref(yt∣st)πθ(yt∣st) بناءً على δt، يطبق OWPO نظامين متميزين:
المحاذاة المتسارعة (الانحرافات الأدنى، δt<0):
السيناريو: السياسة الحالية πθ تتخلف عن المرجع في الاتجاه الصحيح (على سبيل المثال، ثقة أقل في الرموز الصحيحة أو ثقة أعلى في الرموز الخاطئة).
الإجراء: يكون الوزن wt>1.
الأثر: يتم تضخيم التدرج لتسريع تصحيح هذه التأخرات، والاستفضاء من المبدأ المرجعي لإصلاح الأخطاء بسرعة.
قفل المكاسب (الانحرافات المتفوقة، δt>0):
السيناريو: السياسة الحالية πθ تتفوق على المرجع في الاتجاه الصحيح (على سبيل المثال، ثقة أعلى في الرموز الصحيحة).
الإجراء: يتم تقليل الوزن wt<1 (تحديداً بحد أدنى ϵlow).
الأثر: يتم تقليل حجم خطوة التحديث. هذا "يقفل" المكاسب المتفرقة ذات القيمة العالية عبر تقليل التباين ومنع الضوضاء عالية التباين من زعزعة أو عكس هذه الانحرافات المفيدة.
التطور الذاتي التكراري (تأثير السقاطة - The Ratchet Effect)
للتغلب على عقبة السياسة المرجعية الثابتة، يدمج OWPO عملية تمهيد (bootstrapping) تكرارية:
في نهاية كل مرحلة تدريب، يتم تحديث السياسة المرجعية عبر "تبديل صلب": πref(k+1)←πθ(k).
هذا يخلق تأثير السقاطة (Ratchet Effect)، حيث تدمج كل دورة المكاسب الأخيرة في قاعدة أساسية جديدة، مما يسمح للنموذج بالتسلق المستمر نحو مكافآت أعلى دون أن يكون مقيداً بالمبدأ الأولي الأصلي.
3. المساهمات الرئيسية
تحديد صراع الاتجاه: تحدد الورقة أن القيود المتماثلة في أساليب RLVR الحالية تسبب "عكس القوة"، حيث يقمع المرجع عن غير قصد التحسينات التي تنحرف عن المبدأ الأولي.
فصل الاتجاه عن المقدار: يقدم OWPO هدفاً جديداً حيث يحدد المُحقِّق إشارة التدرج (الاتجاه)، بينما تعمل السياسة المرجعية فقط على تغيير مقدار التدرج.
منطقة ثقة غير متماثلة: على عكس تنظيم KL المتماثل القياسي، يبني OWPO منطقة ثقة مدركة للاتجاه تسرع التصحيح للانحرافات الأدنى بينما تحمي الانحرافات المتفوقة عبر تقليل التباين.
إطار التطور الذاتي التكراري: من خلال الجمع بين آلية الاتجاه الواحد وتحديثات المرجع الدورية، يتيح OWPO تطوراً ذاتياً مستمراً دون الاعتماد على نماذج معلمة خارجية.
4. النتائج التجريبية
قيم المؤلفون OWOW على نماذج Qwen-2.5-Math-7B و Qwen-3-8B باستخدام مجموعة بيانات DAPO-Math-17k ومعايير AIME24/25.
الأداء مقابل النماذج المرجعية: تفوق OWOW باستمرار على النماذج المرجعية القوية، بما في ذلك أساليب RLVR البحتة (GRPO, DAPO) والأساليب الموجهة بالمرجع (OPD, MOPD, Sym-DAPO).
على Qwen-3-8B، حقق OWOW نسبة Pass@1 بلغت 51.90% (الأفضل) و 50.74% (عند التقارب) في AIME24، متفوقاً بشكل كبير على MOPD (46.40%) و DAPO (45.31%).
كسر OWOW "سقف الأداء" الملحوظ في MOPD و OPD، والتي تميل إلى الاستقرار بالقرب من أداء السياسة المرجعية.
كفاءة التطور الذاتي: في إعداد تكراري يبدأ من مبدأ أولي دون المستوى (~30% Pass@1)، وصل OWOW إلى دقة ~40% في 4 دورات، بينما تطلب MOPD 6 دورات للاستقرار عند مستوى أدنى يبلغ ~37%.
التعميم: رغم التدريب الصارم على بيانات الرياضيات، أظهر OWOW قدرة فائقة على النقل في اختبارات العلوم العامة (GPQA و MMLU-Pro) مقارنة بالأساليب الأخرى.
دراسات الاستئصال (Ablation Studies): أدى إزالة عدم التماثل (إعادة الوزن المتماثل) إلى تراجع حاد في الأداء، مما أكد أن العقوبات المتماثلة تسبب عكس القوة. كما وُجد أن كلاً من مكوني "المحاذاة المتسارعة" و"قفل المكاسب" ضروريان ولا غنى عنهما.
5. الأهمية والادعاءات
تدعي الورقة أن OWOW يحل مشكلة صراع الاستقرار والاستكشاف الجوهرية في RLVR. من خلال منع تأثير "عكس القوة" المتأصل في التنظيم المتماثل، يسمح OWOW للنماذج بـ:
تجاوز المبادئ الأولية دون المستوى بثبات: يمكن للنماذج التطور بما يتجاوز قدرات سياساتها المرجعية الأولية دون الانهيار.
تمكين التطور الذاتي المستمر: يسمح "تأثير السقاطة" التكراري بتحسين مستمر في الأداء دون الحاجة لنماذج معلمة خارجية.
إعطاء الأولوية لتوجيه المُحقِّق: يرسخ هذا الإطار حقيقة أنه في مهام الاستدلال القابلة للتحقق، يجب أن تكون إشارة المُحقِّق هي المحرك الرئيسي لاتجاه التحسين، مع استخدام السياسات المرجعية فقط كمثبتات للمقدار.
يضع المؤلفون OWOW كخطوة أساسية نحو نماذج استدلال ذاتية التطور وقابلة للتوسع، مشيرين إلى أنه بينما يركز حالياً على الرياضيات والاستدلال القابل للتحقق، فإن مبدأ التحسين المدرك للاتجاه قابل للتطبيق على نطاق واسع في RLVR.