← أحدث الأبحاث
💬 NLP

Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients

تقدم هذه الورقة البحثية "تحسين السياسة الإيجابية فقط" (POPO)، وهو إطار عمل جديد للتعلم المعزز من خلال التغذية الراجعة من نماذج اللغة الكبيرة (RLVR) يلغي الحاجة إلى التدحرجات السلبية عبر الاستفادة من أخذ العينات بأهمية محدودة والتدرجات السلبية الضمنية لتحقيق أداء متفوق في الاستدلال الرياضي مقارنة بـ GRPO.

المؤلفون الأصليون: Mingwei Xu, Hao Fang

نُشر 2026-05-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mingwei Xu, Hao Fang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً حل مسائل رياضية صعبة. عادةً، عندما نعلم روبوتاً (أو ذكاءً اصطناعياً) باستخدام التعلم المعزز (Reinforcement Learning)، نستخدم نهج "الشرطي الجيد والشرطي السيئ".

  • الشرطي الجيد: عندما يحصل الروبوت على إجابة صحيحة، نعطيه مكافأة (جائزة).
  • الشرطي السيئ: عندما يحصل الروبوت على إجابة خاطئة، نقوم بتوبيخه (عقوبة).

الأسلوب الشائع حالياً (والذي يسمى GRPO) يعتمد بشكل كبير على "الشرطي السيئ". فهو يولد العديد من الإجابات، ويحتفظ بالإجابات الصحيحة، ويحاول بنشاط معاقبة الإجابات الخاطئة لتعليم الروبوت ما يجب ألا يفعله.

المشكلة:
لاحظ مؤلفو هذه الورقة البحثية خللاً في استراتيجية "الشرطي السيئ" هذه. في الرياضيات، هناك طرق لا حصر لها للخطأ. يمكنك ارتكاب خطأ حسابي بسيط، أو خطأ منطقي، أو تخمين عشوائي تماماً. ولأن هناك طرقاً كثيرة للفشل، فإن معاقبة بعض الإجابات الخاطئة العشوائية يشبه محاولة العثور على إبرة محددة في كومة قش عبر رمي السهام على كومة القش فقط. قد تخطئ الهدف ولا تدرك الأسباب الحقيقية لفشل الروبوت.

الحل: POPO (تحسين السياسة الإيجابية فقط)
يقترح المؤلفون طريقة جديدة تسمى POPO. بدلاً من استخدام "شرطي سيئ" لتوبيخ الروبوت، قرروا استخدام "الشرطي الجيد" فقط. إنهم يتجاهلون الإجابات الخاطئة تماماً ويركزون بنسبة 100% على تعزيز الإجابات الصحيحة.

إليك كيف تجعل هذا النهج "الإيجابي فقط" يعمل دون أن يصاب الروبوت بالارتباك أو العجز:

1. خدعة "المنافسة الذاتية" (التدرجات السلبية الضمنية)

قد تتساءل: "إذا لم تخبر الروبوت أبداً بما هو خطأ، فكيف سيتوقف عن ارتكاب الأخطاء؟"

يشرح المؤلفون أن الروبوت يتعلم ما لا يجب فعله ببساً عن طريق إجباره على اختيار أفضل إجابة صحيحة.

  • التمثيل: تخيل فصلاً دراسياً حيث يكتفي المعلم بمدح الطالب الذي يحصل على الإجابة الصحيحة. المعلم لا يصرخ في وجه الطلاب الذين أخطأوا. ومع ذلك، ولأن المعلم يعطي عدداً محدوداً فقط من "رموز الثناء" للإجابات الصحيحة، فإن احتمالية ظهور الإجابات "الخاطئة" تتضاءل طبيعياً.
  • كيف يعمل الأمر: في الرياضيات، يجب أن يكون مجموع احتمالات جميع الإجابات الممكنة هو 100%. إذا قمت برفع احتمالية الإجابات الصحيحة، فإن احتمالية الإجابات غير الصحيحة ستنخفض تلقائياً. وتثبت الورقة البحثية رياضياً أن "تعزيز الجيد" هذا يخلق "عقوبة" غير مرئية للسيئ، حتى دون معاقبتهم صراحة.

2. مرساة "الهدف المتحرك" (الشبكة التوأمية - Siamese Network)

عندما تعزز الإجابات الصحيحة فقط، قد يصبح الروبوت واثقاً جداً من نفسه ويبدأ في تكرار نفس الإجابات القليلة مراراً وتكراراً (وهي مشكلة تسمى "انهيار النمط" أو mode collapse). عندها يتوقف عن استكشاف طرق جديدة لحل المشكلات.

  • التمثيل: تخيل الروبوت كراقص. إذا كان يراقب نفسه فقط، فقد يعلق في حلقة مفرغة. ولإصلاح ذلك، أعطى المؤلفون الروبوت "شريكاً ظلياً" (شبكة توأمية).
  • كيف يعمل الأمر: هذا الشريك الظلي هو نسخة أقدم وأبطأ حركة من الروبوت. يحاول الروبوت البقاء قريباً من شريكه الظلي، لكن الشريك يتحرك ببطء شديد (باستخدام تقنية تسمى المتوسط المتحرك الأسي). هذا يمنع الروبوت من الابتعاد كثيراً عن المسار الصحيح مع السماي له بالتعلم والتحسن في نفس الوقت.

3. شبكة أمان "التشابه"

عادةً ما يستخدم تدريب الذكاء الاصطناğı قاعدة صارمة تسمى "تباعد KL" لإبقاء الروبوت من التغيير الكبير جداً. وجد المؤلفون أن هذه القاعدة صارمة للغاية.

  • التمثيل: بدلاً من إجبار الروبوت على اتباع خريطة صارمة، استخدموا فحص "التشابه". إنهم ينظرون إلى "الأفكار" (التمثيلات) داخل عقل الروبوت. طالما أن أفكار الروبوت الجديدة "مشابهة" لأفكار الشريك الظلي، فإنه مسموح له بالتغيير. هذه طريقة أكثر مرونة وليونة للحفاظ على استقرار الروبوت دون كبح إبداعه.

ماذا وجدوا؟

اختبر المؤلفون هذه الطريقة الجديدة (POPO) على عدة اختبارات رياضية شهيرة (مثل AIME و Olympiad) باستخدام نماذج ذكاء اصطناعي مختلفة (مثل Qwen).

  • النتيجة: حققت طريقة POPO أداءً يضاهي، أو حتى يتفوق على، أفضل الطرق الحالية (مثل GRPO) التي تستخدم الأمثلة الجيدة والسيئة معاً.
  • أبرز النقاط: في اختبار صعب جداً يسمى AIME 2025، حققت طريقة POPO درجة 36.67%، متفوقة على الطريقة القياسية التي حققت 30.00%.

باختصار

تجادل الورقة البحثية بأنه في عالم الاستدلال الرياضي، لست بحاجة باستمرار لتوبيخ الطالب على كل خطأ. إذا ركزت بكثافة على تعزيز الخطوات الصحيحة واستخدمت حِيلاً رياضية ذكية لضمان تلاشي الخطوات "الخاطئة" بشكل طبيعي، يمكن للطالب (أو الذكاء الاصطناعي) أن يتعلم بشكل أسرع وأكثر فعالية. وهم يسمون هذا "تحسين السياسة الإيجابية فقط".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →