← أحدث الأبحاث
🤖 machine learning

Sharpness-Guided Group Relative Policy Optimization via Probability Shaping

تقترح هذه الورقة البحثية خوارزمية "تحسين السياسة النسبية للمجموعات الموجهة بالحدة" (GRPO-SG)، وهي نسخة معدلة من تحسين السياسة النسبية للمجموعات تعتمد على أوزان الرموز، تهدف إلى تحسين التعميم في التعلم المعزز ذي المكافآت القابلة للتحقق من خلال تقليل وزن الرموز التي تسبب تدرجات كبيرة لتقليل الحدة وتثبيت التدريب.

المؤلفون الأصليون: Tue Le, Linh Ngo Van, Trung Le

نُشر 2026-05-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tue Le, Linh Ngo Van, Trung Le

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم طالب ذكي جداً (نموذج لغوي كبير) كيفية حل الألغاز الصعبة، مثل المسائل الرياضية أو الألغاز المنطقية. أنت لا تعطي له معلماً ليقيم كل خطوة يقوم بها؛ بل تعطيه بدلاً من ذلك "قائمة مراجعة" في النهاية. إذا كانت الإجابة النهائية صحيحة، يحصل على نجمة ذهبية (مكافأة). وإذا كانت خاطئة، لا يحصل على شيء. يُسمى هذا التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR).

حالياً، الطريقة الأكثر شيوعاً لتعليم هذا الطالب هي طريقة تسمى GRPO. فكر في GRPO كمدرب يقول: "حسناً، دعونا نجرب 5 طرق مختلفة لحل هذه المشكلة. الطرق التي حصلت على النجمة الذهبية جيدة؛ والطرق التي فشلت سيئة. دعونا نعدل دماغ الطالب ليكون أكثر شبهاً بالفائزين وأقل شبهاً بالخاسرين".

المشكلة: الطالب "المتحمس بزيادة"

تجادل الورقة البحثية بأنه بينما تعمل GRPO بشكل جيد، إلا أنها قد تكون أحياناً عدوانية للغاية. تخيل أن الطالب يحاول التعلم؛ عندما يرتكب خطأ في كلمة معينة أو خطوة معينة، قد يصرخ المدرب في وجهه بصوت عالٍ جداً لتصحيحه. في المصطلحات الرياضية، هذا يخلق "تحديثاً حاداً" (sharp update) — أي تغييراً ضخماً ومفاجئاً في دماغ الطالب.

بينما قد يعالج هذا الخطأ الفوري، إلا أنه قد يجعل الطالب غير مستقر. فقد ينسى كيفية حل مسائل مشابهة كان يعرف حلها سابقاً، أو قد يبالغ في رد الفعل تجاه تفاصيل صغيرة لا تهم. وفي لغة الورقة البحثية، يُسمى هذا "الحدة العالية" (high sharpness)، مما يؤدي إلى ضعف القدرة على التعميم (generalization) (أي القدرة على التعامل مع مشكلات جديدة لم يسبق رؤيتها).

الحل: "مقياس الثقة" (GRPO-SG)

يقترح المؤلفون طريقة جديدة تسمى GRPO-SG (GRPO الموجه بالحدة).

إليك التشبيه البسيط:
تخيل أن الطالب يكتب قصة.

  • الكلمات عالية الثقة: هي الكلمات التي يكون الطالب متأكداً منها بنسبة 100%، مثل "الـ" أو "و"، أو الرموز الرياضية الحيوية مثل "+" أو "=". الطالب يعرف أن هذه الكلمات ضرورية لكي يستقيم معنى الجملة.
  • الكلمات منخفضة الثقة: هي الكلمات التي يخمنها الطالب، مثل صفة منمقة أو رقم محدد ليس متأكداً منه.

في الطريقة القديمة (GRPO)، إذا خمن الطالب كلمة منخفضة الثقة وأخطأ فيها، سيصرخ المدرب: "لا! غير دماغك بالكامل!"، وهذا يسبب تحديثاً "حاداً" وضخماً قد يؤدي إلى إفساد أشياء أخرى.

GRPO-SG يعمل كمدرب حكيم ينظر إلى "مقياس ثقة" الطالب قبل أن يصرخ.

  • إذا كان الطالب غير متأكد (ثقة منخفضة) وارتكب خطأً، يهمس المدرب: "حسناً، لنحاول أن نكون أكثر حذراً في المرة القادمة"، لكنه لا يُحدث تغييراً ضخماً. هذا يمنع الطالب من الذعر والمبالغة في التصحيح.
  • إذا كان الطالب متأكداً (ثقة عالية) وأصاب في حله، فإن المدرب يعطيه دفعة إيجابية قوية لتعزيز تلك العادة الجيدة.

كيف يعمل الأمر (تشكيل الاحتمالات)

تستخدم الورقة البحثية خدعة رياضية تسمى تشكيل الاحتمالات (Probability Shaping).

  1. يتحقق النظام من مدى ثقة النموذج في الكلمة التي اختارها للتو (بناءً على "اللوجيت" أو logit، وهو مجرد درجة توضح مدى احتمالية تلك الكلمة).
  2. إذا كانت الدرجة منخفضة (النموذج يخمن)، يقوم النظام بتقليل وزن (downweight) الدرس. هو يقول: "لا تدع هذا الخطأ الواحد يهز أساساتك بالكامل".
  3. إذا كانت الدرجة عالية (النموذج واثق)، يقوم النظام بزيادة وزن (upweight) الدرس. هو يقول: "هذه خطوة سليمة؛ دعونا نتأكد من الاستمرار في فعلها".

النتائج: رحلة أكثر سلاسة

اختبرت الورقة البحثية هذه الطريقة الجديدة على ثلاثة أنواع من التحديات:

  1. الرياضيات: حل مسائل رياضية بمستوى الأولمبياد.
  2. المنطق: حل ألغاز "الفرسان والمحتالين" (حيث يكذب البعض دائماً ويصدق البعض الآخر دائماً).
  3. استخدام الأدوات: طلب من الذكاء الاصطنا Artificial Intelligence استخدام محرك بحث للعثور على إجابات.

ماذا حدث؟

  • درجات أفضل: الطريقة الجديدة (GRPO-SG) حققت باستمرار درجات أعلى من الطريقة القديمة (GRPO) في جميع هذه الاختبارات. على سبيل المثال، في الألغاز المنطقية، ارتفع معدل النجاح بشكل ملحوظ.
  • تعلم أكثر سلاسة: إذا راقبت "معيار التدرج" (gradient norm - وهو مقياس لمدى عنف التغيير في دماغ الطالب)، ستجد أن الطريقة الجديدة كانت أكثر سلاسة بكثير. لم تشهد تلك الطفرات الجامحة من المبالغة في التصحيح، بل كانت رحلة ثابتة وهادئة نحو القمة.

الملخص

تزعم الورقة البحثية أنه من خلال إخبار الذكاء الاصطناعي ببساطة أن يتجاهل "ذعر" التخمينات منخفضة الثقة وأن يركز على تعزيز التحركات عالية الثقة، يمكننا تدريب نماذج استدلال أكثر ذكاءً، واستقراراً، وقدرة على التعميم. الأمر يشبه تعليم الطالب أن يثق بحدسه فيما يعرفه، وألا يصاب بالذعر بسبب الأشياء التي لا يزال يخمنها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →