← أحدث الأبحاث
💬 NLP

Negative Advantage Is a Double-Edged Sword: Calibrating Advantage in GRPO for Deep Search

تقدم هذه الورقة CalibAdv، وهي طريقة مبتكرة لمعايرة الميزة تخفف من عدم الاستقرار وتدهور الأداء في تحسين السياسة النسبية للمجموعات (GRPO) في وكلاء البحث العميق، وذلك من خلال خفض دقيق للمزايا السلبية المفرطة بناءً على صحة الخطوات المتوسطة وإعادة توازن توزيع المزايا.

المؤلفون الأصليون: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

نُشر 2026-04-21
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

هذا يمنع الروبوت من الارتباك بشأن التنسيق ويجعله يركز على التفكير الفعلي.

النتيجة

مع CalibAdv، المحقق الروبوت:

  • يتعلم بشكل أسرع: يحصل على الفضل في الخطوات الجيدة التي يتخذها.
  • يبقى عاقلاً: لا يصاب بالذعر ويتحول إلى كلام غير مفهوم.
  • يحل قضايا أصعب: يؤدي بشكل أفضل بكثير في الأسئلة الصعبة مما كان عليه من قبل.

باختصار: تعلمنا الورقة البحثية أنه عندما ندرب الذكاء الاصطناعي على القيام بمهام معقدة ومتعددة الخطوات، لا يمكنك فقط معاقبته على الفشل النهائي. يجب أن تكون عادلاً بشأن الخطوات الجيدة المتخذة على طول الطريق، وإلا سيتوقف الذكاء الاصطناعي عن العمل بشكل صحيح. CalibAdv هو الأداة التي تجعل هذه العدالة ممكنة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →