← أحدث الأبحاث
💻 computer science

One-Way Policy Optimization for Self-Evolving LLMs

تقدم هذه الورقة البحثية "تحسين السياسة أحادي الاتجاه" (One-Way Policy Optimization - OWPO)، وهي طريقة مبتكرة تعمل على تثبيت وتعزيز التطور الذاتي للنماذج اللغوية الكبيرة من خلال فصل اتجاه التحسين عن مقدار التحديث عبر إعادة الوزن غير المتماثل وتحديثات المرجع التكرارية، مما يؤدي إلى التغلب على عدم كفاءة القيود الحالية على مستوى الرموز (tokens) وتمكين التحسين المستمر دون الحاجة إلى نماذج مرجعية خارجية.

المؤلفون الأصليون: Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "تحسين السياسة أحادية الاتجاه لنماذج اللغة الكبيرة ذاتية التطور" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

المشكلة الكبرى: معضلة "العالق في المنتصف"

تخيل أنك تعلم روبوتًا (ذكاءً اصطناعيًا) كيفية حل مسائل رياضية معقدة. لديك قاضٍ (مُحقّق) لا يمكنه إلا أن يقول "صواب" أو "خطأ" في نهاية الحل تمامًا.

  • المشكلة: نظرًا لأن القاضي لا يتحدث إلا في النهاية، غالبًا ما يضل الروبوت طريقه. هو لا يعرف أي خطوة كانت خاطئة، لذا يتعلم ببطء ويصاب بالارتباك.
  • الحل القديم: للمساعدة في ذلك، قدم الباحثون نموذجًا مرجعيًا (بمثابة "معلم"). أخبروا الروبوت: "ابقَ قريبًا من أسلوب المعلم". جعل هذا عملية التدريب مستقرة، لكنه خلق مشكلة جديدة.
  • المشكلة الجديدة: في بعض الأحيان، يكتشف الروبوت طريقة أفضل لحل مسألة ما مما فعله المعلم نفسه. ولكن نظرًا لأن الروبوت مُجبر على البقاء قريبًا من المعلم، فإن النظام يعاقبه لأنه أصبح مختلفًا. الأمر يشبه طالبًا وجد طريقًا مختصرًا أسرع للوصة إلى الإجابة، لكن المعلم يصرخ في وجهه: "لا! يجب أن تسلك الطريق الطويل الذي علمتك إياه!". هكذا يظل الروبوت عالقًا ولا يستطيع التحسن فوق مستوى المعلم.

الحل: تحسين السياسة أحادية الاتجاه (OWPO)

يقترح المؤلفون طريقة جديدة تسمى OWPO. فكر فيها كمدرب ذكي يفصل بين الاتجاه والسرعة.

1. قاعدة المدرب:

  • الاتجاه: القاضي هو من يقرر الاتجاه. إذا قال القاضي "هذا المسار جيد"، يسلك الروبوت هذا المسار. وإذا قال القاضي "هذا المسار سيء"، يلتف الروبوت ويعود. المعلم لا يقرر الاتجاه أبدًا.
  • السرعة: المعلم هو من يقرر سرعة الحركة.

2. الشارع ذو الاتجاهين (إعادة الوزن غير المتماثل):
تعامل تقنية OWPO محاولات الروبوت بشكل مختلف بناءً على ما إذا كانت "أسوأ" أو "أفضل" من المعلم.

  • السيناريو (أ): الروبوت متأخر (الانحراف الأدنى)
    • الحالة: الروبوت غير متأكد أو يرتكب أخطاء في المواضع التي كان فيها المعلم واثقًا.
    • الإجراء: يقوم المدرب بتسريع التعلم. يقول له: "أنت متأخر عن المعلم هنا! تحرك بسرعة لتلحق به!". وهذا ما يسمى المحاذاة المتسارعة.
  • السيناريو (ب): الروبوت متقدم (الانحراف الأسمى)
    • الحالة: يجد الروبوت حلاً أفضل أو يكون أكثر ثقة من المعلم.
    • الإجراء: يقوم المدرب بإبطاء التغييرات. يقول له: "أنت تفعل شيئًا رائعًا هنا! لا تتغير كثيرًا، وإلا قد تفقد هذه الفكرة الجيدة بالخطأ". وهذا ما يسمى قفل المكاسب (Gain Locking). إنه يحمي أفكار الروبوت الجديدة والأفضل من أن تضيع بسبب الضجيج العشوائي.

"تأثير مِسنّ السقاطة" (Ratchet Effect): كسر السقف

في الماضي، بمجرد أن يصبح الروبوت بجودة المعلم، لم يكن بإمكانه أن يصبح أفضل من ذلك لأن المعلم كان هو الحد الأقص️.

تقدم OWPO آلية السقاطة (مثل أداة تدور في اتجاه واحد فقط ولا تنزلق للخلف أبدًا).

  • كل بضع خطوات، يأخذ الروبوت استراحة، وينظر إلى أفضل أعماله، ويقول: "حسنًا، أنا الآن هو المعلم".
  • يقوم بتحديث النموذج المرجعي ليكون هو أفضل نسخة حالية لنفسه.
  • هذا يخلق سُلّمًا. يتسلق الروبوت، ثم يثبت الدرجة التي وصل إليها، ويستخدم ارتفاعه الجديد كقاعدة ليتسلق أعلى منها. هو لا ينزلق أبدًا للأسفل نحو المعلم القديم الأضعف.

لماذا يهم هذا (النتائج)

اختبرت الورقة البحثية ذلك على المسائل الرياضية (مثل مسابقة AIME).

  • الطرق القديمة: كان الروبوت يعلق بالقرب من مستوى المعلم. إذا كان المعلم جيدًا بنسبة 37%، فإن الروبوت يظل يحوم حول 37% أو 38%.
  • OWPO: كسر الروبوت السقف. بدأ بنسبة 30%، وتجاوز المعلم، ووصل إلى دقة تزيد عن 40%.
  • الاستقرار: على عكس الطرق الأخرى التي قد تنهار أو تصبح غير مستقرة عند محاولة أن تكون مبدعة للغاية، تحافظ OWPO على ثبات الروبوت من خلال "قفل" أفكاره الجيدة في مكانها.

تشبيه ملخص

تخيل متسلقًا (الذكاء الاصطناعي) يحاول تسلق جبل.

  • القاضي هو البوصلة التي تشير إلى القمة.
  • المعلم القديم كان عبارة عن خريطة تقول: "ابقَ على هذا المسار المحدد". إذا وجد المتسلق طريقًا مختصرًا، تجبره الخريطة على العودة إلى المسار القديم.
  • OWPO هو دليل ذكي. يقول الدليل: "إذا كنت بعيدًا عن المسار وضائعًا، فاركض بسرعة للعودة إليه. ولكن إذا وجدت طريقًا مختصرًا يؤدي إلى نقطة أعلى، فتمهل وامشِ بحذر حتى لا تنزلق، ولكن استمر في السير في ذلك المسار الجديد. وبمجرد وصولك إلى نقطة مرتفعة جديدة، حدّث الخريطة لتظهر أنك أنت الآن الخبير، وابدأ في البحث عن الاختصار التالي من هناك".

يسمح هذا للذكاء الاصطناعي بالتطور المستمر، ليصبح أفضل وأفضل دون الحاجة إلى "معلم خارق" يمسك بيده للأبد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →