← أحدث الأبحاث
💬 NLP

Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities

تقترح هذه الورقة ProGRPO، وهو نهج جديد للتعلم التعزيزي يستخدم آلية إعادة وزن الميزة (Advantage Re-weighting Mechanism) للتخفيف من حدة انهيار النمط (mode collapse) وتعزيز الاستكشاف في استدلال النماذج اللغوية الكبيرة عبر إعادة تشكيل إشارات المكافأة ديناميكيًا لموازنة الثقة عبر الحلول الصحيحة المتنوعة، مما يؤدي إلى تحسين كل من الدقة والتنوع التوليدي بشكل كبير في معايير الاختبار الرياضية والبرمجية.

المؤلفون الأصليون: Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets

نُشر 2026-02-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Pengyi Li, Elizaveta Goncharova, Andrey Kuznetsov, Ivan Oseledets

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: الطالب "الواثق أكثر من اللازم"

تخيل أنك تقوم بتدريب طالب عبقري (الذكاء الاصطناعي) لحل مسائل رياضية صعبة أو كتابة أكواد برمجية. أنت تستخدم نظامًا يسمى التعلم المعزز بالمكافآت القابلة للتحقق (RLVR). فكر في هذا كمعلم صارم لا يمنح النجمة الذهبية إلا عندما يقدم الطالب الإجابة الصحيحة بالضبط.

المشكلة:
الطريقة الحالية (المسماة GRPO) تعمل مثل معلم لا يكافئ إلا التخمين الأكثر ثقة لدى الطالب.

  • إذا قال الطالب: "الإجابة هي 42"، وكان متأكدًا بنسبة 99%، فإنه يحصل على نجمة ذهبية.
  • إذا قال الطالب: "الإجابة هي 42"، لكنه كان متأكدًا بنسبة 60% فقط، فإنه لا يحصل على شيء.

بمرور الوقت، يتعلم الطالب ألا يقول سوى "42" بأقصى درجات الثقة. يتوقف عن تجربة طرق أخرى لحل المشكلة. وإذا كانت "42" خاطئة، فلن يكون لدى الطالب خطة بديلة. في مصطلحات الذكاء الاصطناعي، يُسمى هذا انهيار الإنتروبيا (entropy collapse) أو انهيار النمط (mode collapse). يصبح الذكاء الاصطناعي روبوتًا مملًا يكرر نفس الإجابات القليلة فحسب، حتى لو كانت تلك الإجابات خاطئة أو إذا كانت هناك طرق أخرى صحيحة لحل المشكلة.

الحل: ProGRPO (المعلم "العادل")

يقترح المؤلفون طريقة جديدة تسمى ProGRPO. فبدلاً من مجرد مكافأة الصوت الأعلى ثقة، ينظر هذا المعلم الجديد إلى الصورة الكاملة لكيفية تفكير الطالب.

لقد قدموا آلية تسمى إعادة وزن الميزة (Advantage Re-weighting - ARM). وإليك كيف تعمل باستخدام تشبيه بسيط:

1. "فحص الثقة"

تخيل أن الطالب يحل لغزًا.

  • السيناريو (أ): يرى الطالب لغزًا سهلاً للغاية ويصرخ بالإجابة فورًا بثقة 100%.
  • السيناريو (ب): يرى الطالب لغزًا صعبًا، ويفكر لفترة طويلة، ويصل إلى الإجابة الصحيحة، لكنه يشعر ببعض القلق حيالها (ثقة منخفضة).

المعلم القديم (GRPO) كان سيكافئ السيناريو (أ) بشدة ويتجاهل السيناريو (ب).
أما المعلم الجديد (ProGRPO) فيقول: "انتظر، السيناريو (ب) في الواقع أكثر إثارة للإعجاب لأنه كان صعبًا! لنعطِ هذا الطالب درجة إضافية قليلة على مجهوده، حتى لو لم يكن متأكدًا بنسبة 100%."

هذا يمنع الطالب من الاكتفاء بالإجابات "السهلة والواثقة" ويشجعه على استكشاف طرق مختلفة وصحيحة لحل المشكلة.

2. تجاهل الأجزاء "المملة"

عندما يكتب الطالب شرحًا طويلاً ("سلسلة من الأفكار" - Chain of Thought)، فإن معظم الكلمات تكون بديهية.

  • مثال: "أولاً، أجمع 2 و 2. ثم، أضرب في 2..."
  • الكلمات "أولاً"، "ثم"، و"أضرب" هي كلمات مملة؛ فالطالب يعرفها تمامًا.

يجادل بحث ProGRPO بأن حساب هذه الكلمات المملة وعالية الثقة يقلل من قيمة المكافأة. الأمر يشبه تصحيح اختبار ولكن منح نقاط لأن الطالب كتب كلمة "الـ" بشكل صحيح.

يستخدم ProGRPO تطبيع طول الرموز منخفض الاحتمالية (Low-Probability Token Length Normalization). فهو يتجاهل الأجزاء السهلة والمملة من الإجابة، ويركز فقط على الأجزاء الصعبة حيث كان على الطالب أن يفكر ويتخذ قرارًا فعليًا. هذا يعطي إشارة أوضح بكثير حول مدى جودة عملية الاستنتاج.

النتائج: تنوع أكبر، دقة ثابتة

اختبر المؤلفون هذه الطريقة الجديدة على مهام الرياضيات والبرمجة باستخدام نماذج مثل Qwen وDeepSeek.

  • الطريقة القديمة (GRPO): حصل الذكاء الاصطناعي على الإجابة الصحيحة بنسبة 37.6% من المحاولة الأولى. ولكن إذا طلبت منه المحاولة 32 مرة، فإنه يكرر غالبًا نفس الإجابات الثلاث أو الأربع.
  • الطة الجديدة (ProGRPO):
    • الدقة: حصل على الإجابة الصحيحة من المحاولة الأولى بنسبة 43.3% (تحسن كبير).
    • التنوع: عندما طُلب منه المحاولة 32 مرة، وجد إجابات صحيحة بنسبة 68.5% من المرات. والأهم من ذلك، أن هذه الإجابات كانت مختلفة عن بعضها البعض.

التشبيه:
إذا كان الذكاء الاصطناعي القديم يشبه طباخًا يصنع نوعًا واحدًا فقط من المعكرونة لأنه الخيار الأكثر أمانًا، فإن الذكاء الاصطناعي الجديد هو طباخ يمكنه صنع المعكرونة، والريزوتو، والحساء، وكلها لذيذة. لم يكن الأمر مجرد حظ؛ بل تعلم كيف يستكشف المطبخ بفعالية أكبر.

ملخص الادعاءات

يزعم البحث أنه من خلال تعديل كيفية حساب الذكاء الاصطناعي لـ "ثقته" ومن خلال تجاهل الأجزاء المملة من أفكاره، فإن ProGRPO يقوم بـ:

  1. منع الذكاء الاصطناعي من العلوق في حلقة مفرغة من تكرار نفس الإجابات القليلة.
  2. تحسين الدقة في المسائل الرياضية والبرمجية الصعبة.
  3. توليد مجموعة أوسع من الحلول الصحيحة (وهو أمر بالغ الأهمية للمهام المعقدة حيث قد تكون هناك أكثر من طريقة واحدة صحيحة).

يخلص المؤلفون إلى أن هذا يوفر توازنًا أفضل بين الاستكشاف (تجربة أشياء جديدة) والاستغلال (استخدام ما تعرف أنه يعمل بالفعل)، مما يجعل استنتاج الذكاء الاصطناعي أكثر قوة وموثوقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →