← أحدث الأبحاث
💬 NLP

LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models

يقدم LambdaPO إطار عمل جديد للتعلم التعزيزي لنماذج اللغة القائمة على الاستدلال، يستبدل خط الأساس لمتوسط المجموعة المتجانس في GRPO بهيكل تفضيل ثنائي ومكافآت الكثافة الدلالية لالتقاط إشارات تحسين دقيقة وتحسين الأداء في المهام المعقدة.

المؤلفون الأصليون: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

نُشر 2026-05-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "LambdaPO: تحسين السياسة بأسلوب لامدا لنماذج لغة الاستدلال" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

الصورة الكبيرة: تعليم طالب كيف يفكر

تخيل أنك تحاول تعليم طالب عبقري ولكنه مرتبك (الذكاء الاصطناي) كيفية حل مسائل رياضية معقدة. يمكن لهذا الطالب إنتاج طرق مختلفة عديدة لحل مسألة واحدة، لكن بعض المسارات تؤدي إلى طريق مسدود، وبعضها فوضوي، وقليل منها فقط يكون مثاليًا.

الهدف من هذه الورقة البحثية هو معرفة أفضل طريقة لتقديم التغذية الراجعة للطالب حتى يتعلم بشكل أسرع ويرتكب أخطاء أقل.

المشكلة: فخ "المتوسط"

تبدأ الورقة بالنظر في طريقة شائعة تسمى GRPO (تحسين السياسة النسبي للمجموعات).

  • كيف تعمل GRPO: تخيل أن الطالب يكتب 8 حلول مختلفة لمسألة رياضية. ينظر المعلم (الخوارزمية) إلى الحلول الثمانية جميعها، ويحسب المتوسط، ثم يخبر كل طالب: "لقد كنت أفضل من المتوسط، لذا أحسنت!" أو "لقنت أسوأ من المتوسط، لذا حاول مجددًا".
  • الخلل: تجادل الورقة بأن استخدام "المتوسط" وحده هو أسلوب فج للغاية. الأمر يشبه معلمًا يقول لك: "أنت متوسط المستوى"، دون أن يخبرك لماذا.
    • إذا كان حل الطالب أفضل قليلاً من إجابة سيئة واحدة، ولكنه سيء مقارنة بأفضل إجابة، فإن "المتوسط" يخفي هذا التباين.
    • إنه يعامل المجموعة ككتلة واحدة من البيانات، مما يؤدي إلى فقدان التفاصيل المحددة لكيفية مقارنة حل واحد بآخر. وهذا يجعل من الصعب على الطالب تعلم الفروق الدقيقة بين المحاولة "الجيدة" والمحاولة "الممتازة".

الحل: LambdaPO (المدرب بنظام "المواجهة المباشرة")

يقدم المؤلفون LambdaPO، وهي طريقة جديدة لتدريب الطالب. بدلاً من مقارنة الجميع بالمتوسط، تقوم LambdaPO بمقارنة كل حل بشكل مباشر (رأسًا لرأس) ضد كل الحلول الأخرى في المجموعة.

التشبيه: جدول مباريات البطولة

  • GRPO تشبه مدربًا ينظر إلى لوحة النتائج ويقول: "متوسط درجات الفريق كان 50".
  • LambdaPO تشبه مدربًا يشاهد بطولة حيث يلعب كل لاعب ضد كل لاعب آخر.
    • إذا هزم الحل (أ) الحل (ب)، يحصل الحل (أ) على نقطة.
    • إذا خسر الحل (أ) أمام الحل (ج)، يخسر الحل (أ) نقطة.
    • النتيجة النهائية ليست مجرد كونك "فوق المتوسط"؛ بل تتعلق بمدى أدائك ضد خصوم محددين.

لمسة "الثقة" الذكية
تضيف LambdaPO لمسة ذكية: فهي تستمع إلى ثقة الطالب الخاصة.

  • إذا كان الطالب غير متأكد (يعتقد أن حلين متساويان في الجودة)، يستمع المدرب بدقة إلى نتائج الرياضيات الفعلية لتحديد الفائز.
  • إذا كان الطالب واثقًا جدًا من أن الحل (أ) أفضل من الحل (ب)، ولكن الرياضيات تقول إن الحل (ب) هو الأفضل فعليًا، فإن المدرب يعطي إشارة "تصحيح" ضخمة. هذا يساعد الطالب على إدراك أنه كان مخطئًا بشأن حدسه الخاص.

الإضافة النوعية: مكافأة "الكثافة الدلالية"

في المسائل الرياضية، الحصول على الإجابة النهائية الصحيحة أمر رائع، لكن الحصول على الخطوات الصحيحة أصعب في التقييم.

  • الطريقة القديمة: إذا أخطأ الطالب في الرقم النهائي، يحصل على "صفر"، حتى لو كان قد قام بـ 90% من المنطق بشكل صحيح. هذا يشبه الرسوب في اختبار بسبب خطأ مطبعي واحد، رغم أنك فهمت المفهوم بأكمله.
  • الطريقة الجديدة (LambdaPO): يضيف المؤلفون "مكافأة الكثافة الدلالية". هذا يشبه معلمًا يقرأ عمل الطالب ويعطي درجات جزئية لاستخدام الكلمات الصحيحة والخطوات المنطقية، حتى لو كان الرقم النهائي غير دقيق تمامًا. إنها تكافئ جودة الاستدلال، وليس فقط النتيجة النهائية.

ماذا حدث في التجارب؟

اختبر الباحثون هذه الطريقة الجديدة على أسئلة رياضيات وعلوم صعبة باستخدام نماذج ذكاء اصطناعي مختلفة.

  1. نتائج أفضل: حل الذكاء الاصطناعي المدرب باستخدام LambdaPO مسائل أكثر صحة من الذكاء الاصطناعي المدرب باستخدام طريقة "المتوسط" القديمة (GRPO).
  2. تعلم أكثر استقرارًا: الطريقة القديمة جعلت الذكاء الاصطناعي يتشتت أحيانًا ويبدأ في تقديم تخمينات عشوائية سيئة (انهيار) بعد فترة من الزمن. أما LambdaPO فقد أبقت الذكاء الاصطناعي ثابتًا ومركزًا، ومنعته من الخروج عن المسار الصحيح.
  3. الكفاءة: في بعض الحالات، حل الذكاء الاصطناعي المدرب بواسطة LambdaPO المسائل باستخدام عدد كلمات (tokens) أقل ولم يعلق في حلقات من التكرار، على عكس الطريقة القديمة.

الملخص

LambdaPO هي طريقة أذكى لتدريب الذكاء الاصطناعي على التفكير. فبدلاً من إخبار الذكاء الاصطناعي كيف كان أداؤه مقارنة بـ "متوسط المجموعة"، تخبره LambdaPO بالضبط كيف كان أداؤه مقارنة بمحاولاته المحددة. كما أنها تكافئ الذكاء الاصطناعي على كتابة خطوات استدلال جيدة، وليس فقط على الوصول إلى الإجابة الصحيحة. هذا يجعل الذكاء الاصطناعي أكثر ذكاءً، وأكثر استقرارًا، وأفضل في حل الألغاز المنطقية الصعبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →