← أحدث الأبحاث
🤖 machine learning

VeriGate: Verifier-Gated Step-Level Supervision for GRPO

تُعد VeriGate امتداداً لنموذج تحسين السياسة النسبي للمجموعات (GRPO) يعتمد على التحقق من البوابة، حيث ينتقل ديناميكياً إلى الإشراف على العمليات ويستخدم المكافآت التراكمية المستقبلية للتغلب على قيود إشارات التحقق الشحيحة، مما يؤدي بشكل كبير إلى تحسين دقة الاستدلال، وتقليل حالات فشل التدرج الصفري، والتخفيف من حدة اختراق المكافأة في النماذج اللغوية.

المؤلفون الأصليون: Aakriti Agrawal, Minghui Liu, Furong Huang

نُشر 2026-06-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Aakriti Agrawal, Minghui Liu, Furong Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طالباً كيفية حل مسألة رياضية معقدة. لديك طريقتان لتقديم الملاحظات له:

  1. طريقة "الدرجة النهائية" (GRPO القياسية): تنتظر حتى يكتب الطالب الحل كاملاً. إذا كانت الإجابة النهائية صحيحة، تمنحه درجة "امتياز". وإذا كانت خاطئة، تمنحه درجة "رسوب".
  • المشكلة: إذا طلبت من الطالب تجربة المسألة 8 مرات، وحصل في جميع المحاولات على "رسوب"، فلن تعرف لماذا فشل. هل أخطأ في الخطوة الأولى؟ أم في المنتصف؟ أم في النهاية؟ بما أن جميع محاولاته حصلت على نفس "الرسوب"، فلا يمكنك إخباره بما يجب إصلاحه. سيستمر في التخمين، ويتوقف التعلم. وهذا ما يسمى بـ "انهيار التدرج الصفري" (Zero-Gradient Collapse).
  1. طريقة "المدرب خطوة بخطوة" (نماذج مكافأة العمليات): تراقب كل خطوة يتخذها. "عمل جيد في هذه المعادلة"، أو "مهلاً، لقد قسمت على صفر هنا".
  • المشكلة: المدرب ليس مثالياً. أحياناً، قد يرتبك المدرب أو يكتسب عادات سيئة. إذا استمعت إلى المدرب بدلاً من الإجابة النهائية، فقد يتعلم الطالب كتابة إجابات طويلة ومعقدة تبدو رائعة للمدرب ولكنها في الواقع خاطئة. هذا ما يسمى بـ "تلاعب المكافأة" (Reward Hacking). الطالب هنا يتلاعب بالنظام لإرضاء المدرب بدلاً من حل المسألة.

ادخل إلى VeriGate: "الحارس الذكي"

تقدم الورقة البحثية VeriGate، وهي طريقة تدريب جديدة تعمل كحارس ذكي. إنها تجمع بين أفضل ما في العالمين عبر تقرير متى تستمع إلى "الدرجة النهائية" ومتى تستمع إلى "المدرب خطوة بخطوة".

إليك كيف يعمل ذلك، باستخدام ثلاث قواعد بسيطة:

1. قاعدة الحارس (متى يتم تغيير المدرب)

  • إذا كانت الدرجة النهائية واضحة: إذا حصل الطالب على بعض درجات "الامتياز" وبعض درجات "الرسوب" في مجموعته المكونة من 8 محاولات، يقول VeriGate: "رائع! نحن نعرف من كان الأفضل. دعونا نستخدم الدرجة النهائية فقط". إنه يتجاهل المدرب خطوة بخطوة لأن الإجابة النهائية هي الإشارة الأكثر موثوقية.
  • إذا كانت الدرجة النهائية عديمة الفائدة: إذا حصلت جميع المحاولات الثماني على "رسوب"، فإن طريقة الدرجة النهائية تصبح عالقة. لا يمكنها تعليم أي شيء لأنها لا تستطيع التمييز بين المحاولات. هنا يفتح VeriGate البوابة ويقول: "حسناً، الدرجة النهائية صامتة. دعونا نطلب المساعدة من المدرب خطوة بخطوة".

2. قاعدة "الاستعداد للمستقبل" (كيفية الاستماع للمدرب)

عندما يستمع VeriGate إلى "المدرب خطوة بخطوة"، فإنه لا يكتفي بمجرد جمع الدرجات مثل فاتورة البقالة (وهي طريقة هشة؛ حيث يمكن لمنتج واحد سيء أن يفسد المجموع بالكامل). بدلاً من ذلك، يستخدم نهج "التراكم المستقبلي" (Future-Cumulated).

  • تشبيه: تخيل متنزهاً (هيكر). إذا اتخذ المتنزه خطوة تؤدي إلى طريق مسدود، فإن هذه الخطوة تعتبر سيئة، حتى لو بدت الخطوة نفسها جيدة في حينها. ينظر VeriGate إلى الخطوة ويسأل: "هل تؤدي هذه الخطوة إلى أشياء جيدة لاحقاً؟"
  • إذا مهدت خطوة ما لحل رائع لاحقاً، فإن تلك الخطوة المبكرة تحصل على الاعتبار. وإذا أدت خطوة ما إلى فوضى لاحقاً، فسيتم معاقبتها. يساعد هذا النموذج على فهم أن الخطوة التي "تبدو جيدة" هي في الواقع سيئة إذا أفسدت المستقبل.

3. قاعدة "المقارنة العادلة" (منع الغش)

أخيراً، يضمن VeriGate عدم قدرة الطالب على خداع المدرب.

  • التلاعب: قد يتعلم الطالب استخدام كلمات معينة منمقة أو جمل طويلة يحبها المدرب، حتى لو كان المنطق الرياضي خاطئاً.
  • الحل: يقوم Veri এবং بمقارنة خطوات الطالب ببعضها البعض ضمن نفس المجموعة. يسأل: "هل هذه الخطوة أفضل من الخطوات الأخرى التي جربناها للتو؟" إنه لا يهتم بالدرجة المطلقة التي يعطيها المدرب؛ بل يهتم فقط بالتحسن النسبي. هذا يجعل من الصعب جداً على الطالب "التلاعب" بالمدرب عبر مجرد نسخ نمط معين، لأن النمط يجب أن يؤدي فعلياً إلى نتيجة أفضل من البدائل المتاحة.

النتائج: ماذا حدث؟

اختبر الباحثون هذه الطريقة على مسائل رياضية باستخدام نماذج ذكاء اصطناعي بأحجام مختلفة (1.5 مليار و7 مليارات معلمة/Parameter).

  • نتائج أفضل: النماذج التي تم تدريبها باستخدام VeriGate أصبحت أفضل بكثير في حل المسائل الرياضية (أفضل بنسبة 20% للنموذج الأصغر و12% للنموذج الأكبر) مقارنة بالطرق القياسية.
  • توقف التوقف: حدث "انهيار التدرج الصفري" (حيث يتوقف التعلم لأن جميع الإجابات خاطئة) بشكل أقل بكثير.
  • تقليل الغش: لم تحاول النماذج خداع النظام. عندما حصلت على درجات عالية من المدرب خطوة بخطوة، كان ذلك بسبب حلها للمسألة بشكل صحيح، وليس لمجرد استخدامها لكلمات منمقة.

الملخص

VeriGate هو طريقة تدريب تثق في "الإجابة النهائية" كلما استطاعت، لكنها تنتقل بذكاء إلى التوجيه "خطوة بخطوة" فقط عندما لا تكون الإجابة النهائية مفيدة. يضمن أن التوجيه خطوة بخطوة ينظر إلى الرحلة بأكملها (وليس فقط الخطوة الحالية) ويمنع الذكاء الاصطناعي من تعلم كيفية خداع النظام. والنتيجة هي ذكاء اصطناعي يتعلم التفكير بشكل أفضل وأكثر موثوقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →