← أحدث الأبحاث
💬 NLP

RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents

تقترح الورقة البحثية إطار عمل RC-GRPO، وهو إطار عمل مبتكر يعزز استدعاء الأدوات متعدد الجولات في النماذج اللغوية الكبيرة عن طريق حقن رموز مكافأة منفصلة لتكييف توليد المسارات وتنويع عمليات التدحرج، مما يتغلب على مشكلة تلاشي التحديث الناتجة عن انخفاض تباين المكافأة داخل المجموعة ويحقق أداءً هو الأفضل حالياً في اختبار BFCLv4 المرجعي.

المؤلفون الأصليون: Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

نُشر 2026-02-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم مساعد آلي (روبوت) ذكي جداً ولكنه جامد كيفية استخدام مجموعة من الأدوات (مثل الآلة الحاسبة، أو التقويم، أو محرك البحث) لحل لغز معقد متعدد الخطوات.

المشكلة: فخ "الطالب المثالي"

عادةً، لتعليم هذا الروبوت، تقوم أولاً بعرض أمثلة على الحلول المثالية له (الضبط الدقيق تحت الإشراف - SFT). يتعلم الروبوت هذه الأمثلة بشكل مثالي ويصبح "طالباً متفوقاً".

بعد ذلك، تحاول تعليمه طريقة أفضل باستخدام أسلوب يسمى GRPO (تحسين السياسة النسبي للمجموعات). تخيل أن GRPO هو مدرب يجمع مجموعة من الطلاب، ويعطي كل منهم نفس اللغز، ثم يطلب منهم تجربة حلول مختلفة. يقوم المدرب بعد ذلك بمقارنة نتائجهم: "لقد أبليت بلاءً حسناً، لقد أبليت بلاءً سيئاً، أنت متوسط المستوى". الطلاب الذين قدموا أداءً أفضل يحصلون على دفعة للأمام، والذماء الذين قدموا أداءً أسوأ يتلقون إشارة لمحاولة شيء آخر.

العقدة: نظرًا لأن الروبوت تم تدريبه بشكل مثالي على الأمثلة "المثالية"، فإنه في كل مرة تطلب من المجموعة التجربة، يعود الجميع بنفس الحل بالضبط. جميعهم "مثاليون" بنفس الطريقة المملة.

  • ينظر المدرب إلى المجموعة ويقول: "حسناً، الجميع حصل على 10/10".
  • وبما أنه لا يوجد أي فرق بينهم، لا يستطيع المدرب إخبار أي شخص بالتحسن. تختفي إشارة التعلم، ويصبح الروبوت عالقاً، غير قادر على استكشاف طرق جديدة لحل اللغز لأنه خائف جداً من الانحراف عن المسار "المثالي" الذي يعرفه بالفعل.

الحل: RC-GRPO (استراتيجية "خاتم المزاج")

يقترح مؤلفو هذه الورقة طريقة جديدة تسمى RC-GRPO لإصلاح هذا الأمر. بدلاً من الأمل في أن يحاول الروبوت تجربة شيء مختلف عشوائياً، فإنهم يعطون الروبوت "خاتم مزاج" أو رمز تعليمات (token) خاصاً قبل أن يبدأ العمل.

الخطوة 1: تعليم الروبوت كيف يتصرف بشكل مختلف بناءً على أمر (RCTP)
أولاً، يدربون الروبوت على مزيج من القصص: بعضها حيث نجح (مكافأة عالية) وبعضها حيث فشل (مكافأة منخفضة). والأهم من ذلك، أنهم يلحقون بكل قصة وسماً خاصاً، مثل <|High Reward|> أو <|Low Reward|>.

  • يتعلم الروبوت: "عندما أرى الوسم <|High Reward|>، يجب أن أحاول أن أكون مثالياً. عندما أرى الوسم <|Low Reward|>، يجب أن أحاول مساراً مختلفاً، ربما يكون أكثر خطورة أو أبسط".
  • الآن، الروبوت ليس مجرد طالب جامد؛ إنه "حرباء" يمكنها التبديل بين "أنماط" سلوك مختلفة بناءً على الوسم الذي يراه.

الخطوة 2: لعبة المدرب الجديدة (GRPO المشروط بالمكافأة)
الآن، عندما يجمع المدرب (خوارزمية التعلم المعزز - RL) المجموعة لحل لغز ما، هم لا يكتفون بقول "انطلقوا!" فقط:

  • الطالب (أ) يحصل على <|High Reward|> ويحاول أن يكون مثالياً.
  • الطالب (ب) يحصل على <|Low Reward|> ويحاول اتباع نهج مختلف، ربما يكون فوضوياً أو بسيطاً.
  • الطالب (ج) يحصل على <|High Reward|> مرة أخرى، ولكن ربما يحاول مساراً مثالياً مختلفاً قليلاً.

لأن الطلاب الآن مقيدون بالتصرف بشكل مختلف بناءً على وسومهم، فإن المجموعة تمتلك تنوعاً.

  • يستطيع المدرب الآن أن يرى: "الطالب (أ) حصل على 10، الطالب (ب) حصل على 2، الطالب (ج) حصل على 9".
  • الآن أصبح هناك فرق واضح! يمكن للمدرب تقديم ملاحظات مفيدة: "يا طالب (ب)، حاول أن تكون مثل الطالب (أ)".
  • هذا يحافظ على استمرار محرك التعلم في العمل بسلاسة.

لماذا ينجح الأمر (التشبيه)

في الطريقة القديمة، كان الروبوت يشبه جوقة موسيقية حيث يغني الجميع نفس النوتة الموسيقية تماماً وبشكل مثالي. لم يكن قائد الجوقة يستطيع تمييز من يغني بشكل أفضل لأنهم جميعاً متطابقون.

في طريقة RC-GRPO الجديدة، يعطي قائد الجوقة لكل مغنٍ ورقة موسيقية مختلفة (وسوم المكافأة العالية مقابل المنخفضة). فجأة، تصبح الجوقة متنوعة الأصوات. يستطيع القائد سماع الاختلافات، واختيار أفضل النوتات، وتوجيه المغنين للتحسن.

النتائج

اختبرت الورقة هذه الطريقة على معيار يسمى BFCLv4، وهو بمثابة اختبار صعب لوكلاء الذكاء الاصطناعي الذين يستخدمون الأدوات.

  • الطريقة القديمة: علق الروبوت ولم يتحسن كثيراً.
  • الطريقة الجديدة (RC-GRPO): تعلم الروبوت بشكل أسرع وحل المزيد من الألغاز بشكل صحيح.
  • الفوز الكبير: في اختبار نموذج واحد محدد (Qwen-2.5-7B)، سمحت هذه الطريقة الجديدة للروبوت مفتوح المصدر بالتفوق على جميع الروبوتات الشهيرة والمكلفة "مغلقة المصدر" (مثل تلك التي تنتجها شركات التكنولوجيا الكبرى والتي تفوز عادة في هذه الاختبارات).

ملخص

تحل هذه الورقة مشكلة تتمثل في أن الذكاء الاصطناعي يصبح "جيداً جداً" في نسخ الأمثلة ويتوقف عن التعلم. من خلال تعليم الذكاء الاصطناعي كيف يتصرف بشكل مختلف عمداً بناءً على "وسم مكافأة" بسيط، فإنهم يجبرونه على استكشاف مسارات مختلفة، مما يسمح له بالتعلم بشكل أسرع ويجعله أكثر ذكاءً في استخدام الأدوات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →