← أحدث الأبحاث
💬 NLP

Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization

تقترح هذه الورقة إطار عمل SORL، الذي يقدم أخذ عينات الأهمية على مستوى الدور والتقييس المحفز بالقص لاستقرار التعلم المعزز خارج السياسة لوكلاء النماذج اللغوية الكبيرة ذوي الأفق الطويل، مما يمنع انهيار التدريب بفعالية ويحسن الأداء في المهام متعددة الأدوار من خلال خوارزميات SO-PPO وSO-GRPO الخاصة به.

المؤلفون الأصليون: Chenliang Li, Adel Elmahdy, Alex Boyd, Zhongruo Wang, Siliang Zeng, Alfredo Garcia, Parminder Bhatia, Taha Kass-Hout, Cao Xiao, Mingyi Hong

نُشر 2026-02-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chenliang Li, Adel Elmahdy, Alex Boyd, Zhongruo Wang, Siliang Zeng, Alfredo Garcia, Parminder Bhatia, Taha Kass-Hout, Cao Xiao, Mingyi Hong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم متدرباً ذكياً جداً ولكنه يفتقر للخبرة (وهو الذكاء الاصطناعي) كيف يصبح محققاً. وظيفة المحقق هي حل الألغاز المعقدة من خلال طرح الأسئلة، والبحث عن الأدلة، وربط الإجابات ببعضها البعض. هذه العملية تتكون من خطوات عديدة، أو "أدوار" (turns)، تشبه المحادثة.

الورقة البحثية التي شاركتَها تدور حول إصلاح مشكلة رئيسية تحدث عندما نحاول تعليم هذا المحقق باستخدام طريقة تسمى التعلم التعزيزي (Reinforcement Learning - RL).

إليك قصة المشكلة والحل، مشروحة ببساطة:

المشكلة: انهيار "التصحيح المفرط"

تخيل أنك تدرب المحقق. في كل مرة يتخذ فيها خطوة، تقدم له ملاحظات.

  • الطريقة القديمة (PPO/GRPO القياسية): تنظر إلى كل كلمة ينطق بها المحقق. إذا قال كلمة تبدو "جيدة"، تصفق له بحرارة. وإذا بدت "سيئة"، تعبس في وجهه.
  • المشكلة: لأن المحقق يتعلم من ملاحظات قديمة (بيانات تم جمعها بواسطة "نسخته الماضية")، تصبح هذه الملاحظات قديمة بسرعة. ومع استمرار التدريب، يبدأ المحقق في استخدام هذه الملاحظات القديمة لاتخاذ قرارات جديدة.
    • عدم التطابق: المدرب يحاول تقييم كل كلمة (token)، لكن المحقق يفكر في مقاطع كاملة من المحادثة (turns). الأمر يشبه تقييم لاعب كرة سلة بناءً على حركة كل إصبع بدلاً من تقييم الرمية كاملة. هذا يسبب الارتباك.
    • الانهيار: لأن الملاحظات قديمة، يصاب المدرب بالارتباك. أحياناً يعتقد المدرب أن حركة سيئة للغاية هي حركة مذهلة (لأن الملاحظات القديمة قالت ذلك) فيعطي تصفيقاً حاراً جداً. هذا يجعل المحقق يخرج عن السيطرة، ويرتكب أخطاء فادحة، وفي النهاية يتوقف عن حل القضايا تماماً. وهذا ما يسمى بـ "انهيار التدريب" (training collapse).

الحل: SORL (المدرب الذكي)

يقترح المؤلفون نظام تدريب جديد يسمى SORL (استقرار التعلم التعزيزي خارج السياسة - Stabilizing Off-Policy Reinforcement Learning). فكر في هذا كـ "مدرب ذكي" يستخدم خدعتين خاصتين لإبقاء المحقق هادئاً ومركزاً.

الخدعة الأولى: التقييم حسب "الأدوار"، وليس "الكلمات" (Importance Sampling على مستوى الدور)

بدلاً من الصراخ "عمل جيد!" أو "عمل سيء!" عند كل كلمة ينطق بها المحقق، ينتظر المدرب الذكي حتى ينهي المحقق فكرة كاملة أو إجراءً كاملاً (دوراً واحداً).

  • التشبيه: تخيل تقييم طالب في مقال. الطريقة القديمة كانت إعطاء درجة لكل حرف يكتبه. إذا كتب حرف 'z' بشكل خاطئ، يحصل على درجة سيئة. الطريقة الجديدة هي تقييم الفقرة بأكملها. إذا كانت الفقرة منطقية، يحصل على درجة جيدة للفقرة كاملة.
  • لماذا يساعد هذا: هذا يمنع المحقق من التشتت بسبب الأخطاء الصغيرة في الكلمات الفردية. إنه يجعل التوجيه متوافقاً مع طريقة تفكير المحقق: في خطوات كاملة، وليس في أجزاء صغيرة.

الخدعة الثانية: "زر الذعر" للمعايرة (Normalization عبر النقر - Clipping-Triggered Normalization)

أحياناً، يصبح المحقق متحمساً جداً (أو مرتبكاً) بسبب الملاحظات القديمة لدرجة أنه يبدأ في اتخاذ خطوات متطرفة للغاية. يرى المدرب ذلك ويدرك: "مهلاً، هذه البيانات غريبة جداً بحيث لا يمكن الوثوق بها الآن".

  • التشبيه: تخيل المحقق يركض على جهاز المشي (treadmill). فجأة، يبدأ الجهاز في الاهتزاز بعنف لأن الحزام ينزلق.
    • المدرب القديم: يستمر في دفع المحقق للركض بشكل أسرع، ظناً منه أن الاهتزاز هو مجرد جزء من التمرين. فيسقط المحقق.
    • المدرب الذكي (SORL): لديه مستشعر يكتشف الاهتزاز. عندما يصبح الاهتزاز جامحاً، يضغط المدرب على "زر الذعر". هذا الزر لا يوقف التدريب، بل يبطئ سرعة التحديثات. يقول: "حسناً، سنقوم بخطوة أصغر وأكثر أماناً لأن الأرض تهتز".
  • لماذا يساعد هذا: يمنع المحقق من القيام بقفزات كبيرة ومتهورة بناءً على بيانات سيئة. إنه يحافظ على استقرار وثبات عملية التعلم، حتى عندما تكون البيانات غير منظمة.

النتيجة: محقق مستقر

عندما اختبر المؤلفون هذا "المدرب الذكي" الجديد (SORL) في مهام صعبة مثل:

  1. البحث عن الإجابات (مثل محقق يبحث عن أدلة).
  2. حل الأسئلة الطبية (مثل طبيب يشخص حالة مريض).

وجدوا أن:

  • الطرق القديمة غالباً ما تبدأ قوية، ثم تنهار فجأة وتنسى كيفية حل المشكلات.
  • الطريقة الجديدة (SORL) تستمر في التحسن والتقدم دون انهيار. ولم تكن بحاجة إلى تدخل المدربين لإيقاف وإعادة تشغيل التدريب باستمرار (وهو حل شائع للطرق القديمة).

باخت-صار

تقول الورقة البحثية: "تعليم وكلاء الذكاء الاصطناعي التفكير في محادثات طويلة أمر صعب لأنهم يرتبكون بسبب البيانات القديمة والتفاصيل الصغيرة. لقد أصلحنا ذلك بتعليمهم التفكير في مقاطع (أدوار) وإضافة مكبح أمان يبطئ سرعتهم عندما تصبح البيانات جنونية. هذا يجعل الذكاء الاصطناعي يتعلم بشكل أسرع، وأكثر أماناً، وبشكل أكثر موثوقية".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →