← أحدث الأبحاث
💬 NLP

All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training

تقدم هذه الورقة خوارزمية ABC-GRPO (التقليم المقيد بجميع الأرباع لـ GRPO)، وهي خوارزمية تعلم تعزيزي مبتكرة تعالج عدم المحدودية الهيكلية في ربع الميزة السالبة في خوارزمية GRPO القياسية عن طريق تطبيق تقليم غير مشروط لضمان تدريب مستقر وعالي الإنتروبيا وتعميم فائق في معايير الرياضيات والبرمجة.

المؤلفون الأصليون: Chi Liu, Xin Chen

نُشر 2026-08-07
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Chi Liu, Xin Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم روبوت عبقري ولكنه فوضوي قليلاً كيفية حل المسائل الرياضية. أنت لا تريد فقط إخباره بالإجابة الصحيحة؛ بل تريد منه أن يتعلم كيفية التفكير. هذا هو عالم "التعلم المعزز" (Reinforcement Learning)، حيث يتعلم الذكاء الاصطناعي من خلال التجربة، والحصول على درجة، وتعديل سلوكه للحصول على درجة أعلى في المرة القادمة. اللاعب النجم في هذا المجال حالياً هو طريقة تسمى "تحسين السياسة النسبي للمجموعات" (Group Relative Policy Optimization)، أو GRPO. فكر في GRPO كمدرب صارم ينظر إلى مقال الطالب بأكمِله (سلسلة من الكلمات) ويعطيه درجة واحدة للمقال كاملاً. إذا حصل المقال على درجة جيدة، يقول المدرب: "عمل رائع، استمر في فعل كل ما فعلته!" وإذا حصل على درجة سيئة، يقول: "عمل سيء، تراجع عن كل ما فعلته!"

المشكلة هي أن نهج "المقال بأكمله" هذا قد يكون غير عادل بعض الشيء. فأحياناً، يكتب الطالب جملة مثالية في منتصف مقال سيء للغاية. وتحت القواعد القديمة، يتم معاقبة هذه الجملة المثالية مع الأجزاء السيئة، أو على العكس، قد تحصل جملة بلا معنى في مقال جيد على تمرير مجاني. هذا يخلق نقطة عمياء تجعل الذكاء الاصطناعي يشعر بالارتباك، ويتوقف عن تجربة أفكار جديدة، ويستقر في النهاية في حالة من الركود، ناسياً كيف يكون مبدعاً. الورقة البحثية التي ستطالعها تعالج هذا الارتباك تحديداً، وتقترح مجموعة جديدة من القواعد للحفاظ على استقرار تعلم الذكاء الاصطناعي وإبقاء خياله حياً.


المدرب غير العادل والأركان الأربعة للأخطاء

لاحظ مؤلفا هذه الورقة، تشي ليوو وشين تشن من PayPal.AI، وجود خلل خفي في كيفية تدريب GRPO لنماذج الذكاء الاصطناعي هذه. لفهم إصلاحهما، تخيل عملية تعلم الذكاء الاصطناعي كلعبة تُلعب على خريطة ضخمة مقسمة إلى أربعة أركان، أو "أرباع". على هذه الخريطة، يتتبع أحد المحاور مدى تغيير الذكاء الاصطناعي لرأيه (هل جعل كلمة ما أكثر احتمالاً أو أقل احتمالاً؟)، ويتتبع المحور الآخر ما إذا كان المدرب قد اعتبر الحركة جيدة أم سيئة.

في ثلاثة من هذه الأركان، تعمل القواعد بشكل جيد. ولكن في ركن واحد محدد — لنسمه "منطقة الخطر" — تنهار القواعد القديمة تماماً. يحدث هذا عندما يجعل الذكاء الاصطناعي كلمة ما أكثر احتمالاً (يكون واثقاً)، لكن المدرب يعطيه درجة سيئة للمقال بأكمله. في النظام القديم، إذا كان الذكاء الاصطناعي واثقاً جداً من تلك الكلمة، فإن العقاب يمكن أن يكون لانهائياً. إنه يشبه معلماً يقول لطالبه: "كنت متأكداً بنسبة 99% أن هذه الإجابة صحيحة، ولكن بما أن المقال فشل، يجب عليك إلغاء تعلم هذه الكلمة تماماً، حتى لو كانت صحيحة بالفعل!"

هذا العقاب "غير المحدود" خطير. فهو يتسبب في ذعر الذكاء الاصطناعي. فبدلاً من استكشاف طرق مختلفة لحل المشكلة، ينهار الذكاء الاصطناعي إلى زاوية صغيرة وآمنة في دماغه، مكرراً نفس الأنماات القليلة مراراً وتكراراً. يطلق المؤلفون على هذا "انهيار الإنتروبيا" (entropy collapse)، وهو مصطلح تقني يعني أن الذكاء الاصطناعي يتوقف عن كونه مبدعاً ويصبح روبوتاً مملاً وجامداً. وقد وجدوا أن "منطقة الخطر" هذه كانت السبب الرئيسي وراء تدهور قدرة نماذج الذكاء الاصطناعي على حل المسائل الرياضية الصعبة بمرور الوقت، رغم تحسنها في المسائل البسيطة.

كتاب القواعد الجديد: ABC-GRPO

لإصلاح ذلك، ابتكر الفريق طريقة جديدة تسمى "تحسين السياسة النسبي للمجموعات المحدود في جميع الأرباع" (أو ABC-GRPO اختصاراً). فكر في هذا كإعطاء المدرب كتاب قواعد جديداً وأكثر عدلاً.

في النظام القديم، كان بإمكان المدرب معاقبة الذكاء الاصطناعي إلى حد معين في بعض المواقف، ولكن في "منطقة الخطر"، لم يكن هناك حد لشدة العقاب. تضع ABC-GRPO "حد سرعة" للعقاب في جميع الأرباع الأربعة للخريطة. قبل أن يطبق المدرب الدرجة على دماغ الذكاء الاصطناائي، يتحقق من: "هل هذا العقاب كبير جداً؟" إذا كان الذكاء الاصطناعي في منطقة الخطر وكان العقاب ضخماً، فإن القاعدة الجديدة تقول: "توقف! ضع حداً هنا".

الأمر الحاسم هو أن هذه القاعدة الجديدة تطبق "أرضية" و"سقفاً" للتغييرات. فهي تضمن أنه حتى لو ارتكب الذكاء الاصطناعي خطأ في مقال سيء، فإنه لا يتم محوه تماماً. إنها تحافظ على عدم تذبذب ثقة الذكاء الاصطناعي بشكل جامح. يصف المؤلفون هذا ليس كخدعة سحرية لجعل الذكاء الاصطناعي أذكى فوراً، بل كـ "آلية استقرار" — مثل عجلات التدريب التي تمنع الدراج من السقوط حتى يتمكن من مواصل التبديل للأمام.

ما وجدوه: إنقاذ القدرة على الاستنتاج

اختبر الفريق هذه الطريقة الجديدة على Qwen3، وهو نموذج ذكاء اصطناعي قوي لحل الرياضيات. وقارنوا ABC-GRPO مع GRPO التقليدي وعدة طرق شائعة أخرى. كانت النتائج مذهلة.

عند استخدام GRPO القديم، كانت قدرة الذكاء الاصطناعي على إيجاد حلول مختلفة (حد الاستنتاج الخاص به) تزداد سوءاً فعلياً مع استمرار التدريب. بدأ يتخلى عن المسارات الإبداعية. ولكن مع ABC-GRPO، لم يكتفِ الذكاء الاصطناعي بالتحسن في الحصول على الإجابة الصحيحة فحسب، بل حافظ أيضاً على قدرته على الاستكشاف.

في اختباراتهم على تحديات رياضية صعبة (مثل AIME 2024)، حققت ABC-GRPO أعلى الدرجات في كل من الدقة والتنوع. على سبيل المثال، في نموذج بـ 4 مليارات معلمة (parameter)، حلت ABC-GRPO حوالي 38.3% من المسائل بشكل صحيح في المتوسط، مقارنة بـ 34.5% لـ GRPO القياسي. والأهم من ذلك، عند النظر إلى القدرة على إيجاد أي حل صحيح من بين 64 محاولة (Pass@64)، حققت ABC-GRPO نسبة 70.3%، بينما انخفضت نسبة GRPO القياسي إلى 59.4%.

تحقق المؤلفون أيضاً مما إذا كانت هذه الحيلة تعمل على أشياء لم يسبق للذكما الاصطناعي رؤيتها، مثل ألغاز البرمجة (HumanEval) والمجموعات الرياضية الأكثر صعوبة (MATH-500). وقد صمدت النتائج: فالذكاء الاصطناعي الذي تم تدريبه باستخدام ABC-GRPO كان أفضل في هذه المهام الجديدة أيضاً، مما يثبت أن الإصلاح لم يكن مجرد تخمين محظوظ لاختبار محدد.

"منطقة الخطر" كانت المتهم الحقيقي

كان الجزء الأكثر إثارة للاهتمام في الدراسة هو "تشريح" المشكلة. تساءل الباحثون: "هل كتاب القواعد الجديد بالكامل هو ما يصلح الأمور، أم فقط الجزء الذي يمنع العقاب اللانهائي؟"

أجروا تجارب حيث قاموا بإصلاح "منطقة الخطر" (الربع الرابع) فقط وتركوا الأركان الأخرى كما هي. ووجدوا أن إصلاح هذا الربع وحده استعاد حوالي 72% من إجمالي التحسن. أكد هذا فرضيتهم: العقاب غير المحدود في هذا الربع المحدد كان السبب الرئيسي وراء انهيار الذكاء الاصطناعي. كانت الأركان الأخرى تحتاج إلى بعض المساعدة أيضاً، لكن "منطقة الخطر" كانت الثقب الكبير الذي كان يغرق السفينة.

لماذا يهم هذا

يشير المؤلفون بحذر إلى أنهم لم يحلوا مشكلة "الاستنتاج المثالي" للذكاء الاصطناعي. لم يجدوا كيفية إعطاء الذكاء الاصطناعي درجة مثالية لكل كلمة يكتبها. بدلاً من ذلك، لقد بنوا شبكة أمان. من خلال وضع حد أقصى للعقوبات، منعوا الذكاء الاصطناعي من الشعور بالخوف والتخلي عن إبداعه الخاص.

تظهر الورقة البحثية أنه بمجرد إضافة "حد سرعة" لكيفية معاقبة الذكاء الاصطناعي لكونه واثقاً في موقف سيء، يمكننا الحفاظ على عقل الذكاء الاصطناعي مفتوحاً، متنوعاً، ومستقراً. إنه تذكير بأنه في بعض الأحيان، أفضل طريقة لتعليم روبوت فائق الذكاء ليست بالضغط عليه بقوة أكبر، بل بالتأكد من أنه لن يصطدم عندما يحاول تجربة شيء جديد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →