SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs
تقدم الورقة البحثية SRPO (تحسين السياسة النسبية المجموعية)، وهو إطار عمل جديد للتعلم التعزيزي للنماذج اللغوية الكبيرة متعددة الوكلاء يوحد بين تقسيم العمل والتطور المشترك الجماعي من خلال معاملة الحد الأدنى من مجموعة المخرات المستهلكة في انتقال حالة واحدة كإجراء موحد، مما يتيح تدريباً مستقراً وفعالاً عبر مختلف سير العمل ونطاقات النماذج.
في عالم الذكاء الاصطناي المتطور بسرعة، تعلمت النماذج اللغوية الكبيرة كيف تعمل كوكلاء، قادرة على التفكير، والبحث عن المعلومات، واستخدام الأدوات لحل المشكلات المعقدة. وعندما تعمل هذه النماذج بمفردها، فإنها تتبع مساراً واحداً من التفكير. ومع ذلك، لمواجهة التحديات الأصعب، غالباً ما ينشر الباحثون عدة وكلاء يتعاونون، تماماً مثل فريق من المتخصصين. وفي بعض الأحيان، تقسم هذه الفرق المهمة بحيث يتولى كل عضو دوراً محدداً، بينما في أوقات أخرى، يولدون عدة أفكار مختلفة في وقت واحد لصقل الحل معاً. لقد كانت الصعوبة المركزية في تدريب مثل هذه الفرق تكمن في كيفية مكافأتهم. فغالباً ما تعامل الطرق التقليدية مخرجات كل وكيل كحدث منفصل، حتى عندما يعمل عدة وكلاء معاً لإنتاج نتيجة واحدة. وهذا يخلق عدم تطابق: حيث يتعلم النظام من قطع منفصلة من اللغز بدلاً من الصورة الكاملة التي تشكلها معاً، مما يجعل من الصعب تدريب الفرق التي تنتقل بين العمل بمفردها والعمل بشكل جماعي.
لقد عالج فريق من الباحثين عدم التطابق هذا باقتراح طريقة تدريب جديدة تسمى "تحسين السياسة النسبي للمجموعات" (Setwise Relative Policy Optimization أو SRPO). فبدلاً من النظر إلى الاستجابات الفردية، يعامل هذا النهج مجموعة المخرجات بأكملها التي تسبب تغييراً في البيئة كوحدة عمل واحدة. تخيل فريقاً من المستكشفين يصلون إلى مفترق طرق؛ سواء اختار شخص واحد مساراً، أو ناقش الفريق بأكولو المسار ثم اختاروا طريقاً معاً، فإن القرار الذي يدفعهم للأمام هو النتيجة الجماعية. وقد وجد الباحثون أنه من خلال تجميع هذه المخرجات فيما يسمونه "المجموعة النشطة"، استطاعوا تدريب النظام لفهم أن الجهد الجماعي للفريق هو الإجراء الحقيقي. وتسمح هذه الطريقة بتطبيق نفس قواعد التدريب سواء كان الفريق يعمل وفق تقسيم صارم للعمل، حيث يقوم شخص واحد بشيء واحد، أو في وضع التطور المشترك، حيث يساهم عدة أشخاص في فكرة مشتركة في آن واحد.
اختبر الباحثون هذه الفكرة على نوعين مختلفين تماماً من المهام: حل المسائل الرياضية الصعبة وإجراء عمليات بحث متعددة الخطوات للعث_ال معلومات محددة. في تجارب الرياضيات، كان على النظام توليد حلول مرشحة ثم التحقق منها، وهي عملية قد تتطلب أحياناً أن يقوم وكيل بالحل وآخر بالتدقيق، وتتطلب في أحيان أخرى أن يقترح عدة وكلاء اشتقاقات مختلفة في وقت واحد. وفي تجارب البحث، كان على النظام أن يقرر متى يطلب المزيد من المعلومات، مع إمكانية قيام عدة وكلاء بإصدار استعلامات بحث في وقت واحد قبل أن يقوم مجمع بدمج النتائج. وعبر أربعة أحجام مختلفة من النماذج اللغوية، تفوقت الطريقة الجديدة باستمرار على النهج القائمة. وفي الاختبارات الرياضية، حقق النظام دقة متوسطة حيث كانت حوالي 61 إلى 62 بالمائة من الحلول المولدة صحيحة، ووجد حلاً صحيحاً واحداً على الأقل لحوالي 78 بالمائة من المسائل. وفي مهام البحث، كان التحسن أكثر وضوحاً، حيث وجدت الطريقة الجديدة إجابات صحيحة لأكثر من 60 بالمائة من الاستعلامات في المتوسط، وهو ما يمثل قفزة كبيرة عن الطرق السابقة.
كان جزء رئيسي من الاكتشاف هو فهم كيفية موازنة مساهمات الوكلاء المتعددين. فإذا قام النظام ببساطة بجمع التغييرات التي أجراها كل وكيل، فسيظهر الفريق الأكبر كأنه يمتلك تأثيراً أكبر بك הרבה من الفريق الأصغر، لمجرد وجود أصوات أكثر. وقد حل الباحثون ذلك من خلال تطبيع مساهمة المجموعة، مما يضمن عدم وزن فريق مكون من خمسة وكلاء بشكل غير عادل مقابل وكيل واحد لمجرد حجمه. كما أظهروا أن النظام يمكنه تعلم الانتقال بين هذه الأوضاع ديناميكياً. ففي بعض الحالات، تعلم النظام أن اختيار وكيل متخصص واحد هو الخيار الأفضل، بينما في حالات أخرى، قام بتنشيط مجموعة صغيرة من الوكلاء للعمل معاً. هذا المرونة تعني أن عملية التدريب لا تحتاج إلى إعادة كتابة للنماذج المختلفة؛ إذ تعامل المنطق الأساسي نفسه كلا السيناريوهين بسلاسة.
كما بحثت الدراسة بدقة في تكلفة هذه التحسينات. فقد حرص الباحثون على ضمان أن النتائج الأفضل لم تكن ببساطة بسبب توليد النص الجديد لمزيد من النصوص أو استخدام المزيد من القدرة الحوسبية. فقد قاموا بقياس عدد الرموز (tokens) المولدة وعدد استدعاءات الأدوات، ووجدوا أن التحسينات جاءت من تنسيق أفضل وليس من القوة الغاشمة. في الواقع، أدت عملية التدريب غالباً إلى استجابات أقضاء وأكثر كفاءة بمرور الوقت. وأشار الباحثون إلى أنه بينما كانت النتائج قوية، إلا أنها استندت إلى معايير ومقارنات محددة مع طرق أخرى منشورة، وسيتعين على العمل المستقبلي استكشاف مدى صمود هذه المكاسب في عمليات النشر الواقعية طويلة الأمد. ومع ذلك، فإن النتيجة الجوهرية قائمة: من خلال تعريف المخرج الجماعي للفريق كالوحدة الأساسية للإجراء، يمكن تدريب الأنظمة متعددة الوكلاء لتكون أكثر استقراراً وكفاءة وفعالية في حل المشكلات المعقدة، بغض النظر عما إذا كانوا يعملون بمفردهم أو معاً.
ملخص تقني: تحسين السياسة النسبي المجموعاتي (SRPO) للنماذج اللغوية الكبيرة متعددة الوكلاء
بيان المشكلة تعمل الأنظمة متعددة الوكلاء (MAS) التي تستخدم النماذج اللغوية الكبيرة (LLMs) على حل المهام المعقدة من خلال التعاون، عادةً عبر تقسيم العمل (أدوار متخصصة) أو التطور المشترك الجماعي (توليد مقترحات متزامنة). وبينما يوفر التعلم المعزز (RL) مساراً للتحسين النهائي للنهاية (end-to-end) لهذه الأنظمة، تعاني الطرق الحالية من عدم توافق جوهري بين وحدة التحديث وإجراء النظام.
تُعرف مناهج التعلم المعزز الحالية للأنظمة متعددة الوكلاء (MAS-RL) وحدة التحسين بناءً على تدفقات عمل تعاونية محددة (على سبيل المثال: لكل وكيل، أو لكل دور، أو لكل مجموعة). وبناءً على ذلك، يعامل المُحسّن الإجراء كاستجابة واحدة أو مسار ثابت، حتى عندما تؤدي مخرجات متعددة بشكل مشترك إلى انتقال حالة واحدة في البيئة. يؤدي هذا إلى عدم اتساق: فقد تتلقى نفس القرارات البيئية تحديثات مختلفة اعتماداً على عدد الوكلاء المساهمين أو ترتيبهم. هناك نقص في صياغة موحدة ومستقلة عن تدفق العمل يمكنها التعامل مع تدفقات العمل متعددة الوكلاء الثابتة، والمختلطة، والموجهة ديناميكياً تحت قاعدة تحسين واحدة.
المنهجية: تحسين السياسة النسبي المجموعاتي (SRPO) يقترح المؤلفون إطار عمل SRPO، وهو إطار لتحسين السياسة يعيد تعريف إجراء الوكيل المتعدد باعتباره المجموعة النشطة (active set).
تعريف المجموعة النشطة: يتم تعريف المجموعة النشطة (Se) بأنها الحد الأدنى من المخرجات المستخرجة حديثاً التي تستهلكها البيئة لإنتاج انتقال حالة واحد.
إذا كان ∣Se∣=1، فإنها تمثل تقسيم العمل (إجراء فردي).
إذا كان ∣Se∣>1، فإنها تمثل التطور المشترك الجماعي (إجراء متعدد الأعضاء). هذا التعريف مستقل عن هوية الوكيل، أو ترتيب التنفيذ، أو هيكلية التنسيق.
صياغة الهدف المجموعاتي: يعدل SRPO تحسين السياسة النسبي القياسي (مثل PPO/GRPO) ليعمل على مستوى المجموعة بدلاً من مستوى الرمز (token) أو الاستجابة الفردية:
نسبة اللوغاريتم الموحدة حسب العدد: بدلاً من قص (clipping) النسب الفردية للأعضاء، يقوم SRPO بتجميع نسب اللوغاريتم لجميع أعضاء المجموعة النشطة. ويقوم بحساب نسبة لوغاريتمية مجموعاتية موحدة (Leset) عن طريق جمع نسب اللوغاريتم للأعضاء وتقليصها بمقدار 1/Ke (حيث Ke هو عدد أعضاء المجموعة). هذا يمنع حجم التحديث من النمو طردياً مع عدد الوكلاء.
تعيين ميزة أحادية: يتم تعيين ميزة نسبية واحدة (A^e) للحدث بأكم، وتتم مشاركتها بين جميع أعضاء المجموعة النشطة.
القص المجموعاتي: يطبق التحسين قيد قصاً واحداً (clipping constraint) على نسبة المجموعة بأكملها (ρeSRPO) بناءً على ميزة الحدث، بدلاً من قص كل عضو بشكل مستقل.
التنفيذ: يعامل إطار العمل المجموعة النشطة كوحدة تقريبية للتحسين. وتظل عمليات توليد العينات (rollout generation)، وتصميم المكافأة، وتقدير الميزة قابلة للاستبدال بالأنظمة الحالية. يتطلب النظام "تجميعاً ذرياً للأحداث" (event-atomic batching)، مما يضمن بقاء جميع الصفوف التي تنتمي لحدث قرار واحد في نفس الدفعة الصغيرة (mini-batch) للحفاظ على سلامة نسبة المجموعة.
المساهمات الرئيسية
إجراء MAS مستقل عن تدفق العمل: قدمت الورقة "المجموعة النشطة" كتمثيل موحد للإجراء، يجمع بين تقسيم العمل، والتطور المشترك الجماعي، ومزيجهما ضمن عملية قرار واحدة.
هدف مجموعاتي بسيط: يوفر SRPO تحديثاً نسبياً موحداً حسب العدد، يعامل المجموعة النشطة كإجراء للسياسة. وهو يستعيد تحسين الاستجابة العادي عندما يكون حجم المجموعة واحداً.
واجهة تدريب عامة: أظهر المؤلفون واجهة عملية تدعم تدفقات العمل الثابتة، والمختلطة، والموجهة ديناميكياً عبر أربعة مقاييس للنماذج. كما وفروا أدوات تشخيصية لمقياس التدرج، وطول الاستجابة، وعدد أعضاء المجموعة، واكتمال الحدث.
النتائج التجريبية قيم المؤلفون SRPO على الاستدلال الرياضي (باستخدام Qwen3-4B/8B) والبحث متعدد الدورات (باستخدام Qwen2.5-3B/7B).
الاستدلال الرياضي: حقق SRPO أفضل نتائج متوسطة (Avg@16 و Pass@16) عبر ستة اختبارات معيارية (بما في ذلك AIME و AMC و MATH500) مقارم بـ GRPO أحادي الوكيل والأساسات الحالية لـ MAS (مثل Dr. MAS). بالنسبة لنموذج Qwen3-4B، حقق SRable متوسط Avg@16 بنسبة 61.3% و Pass@16 بنسبة 77.9%، متفوقاً على أقوى نموذج أساسي بمقدار 0.2 نقطة.
البحث متعدد الدورات: أظهر SRPO تحسينات كبيرة، لا سيما في نموذج 3B حيث حسن متوسط Avg@16 بمقدار 3.2 نقطة و Pass@16 بمقدار 3.1 نقطة عن أفضل نموذج أساسي.
دراسات الاستبعاد (Ablation Studies):
العدد (Cardinality): تفوقت إجراءات البحث المشترك (حجم المجموعة 5) باستخدام SRPO على الإجراءات الفردية (حجم المجموعة 1) تحت التوحيد بالجذر التربيعي.
التوحيد (Normalization): تفوق مقياس 1/K المقترح (SRPO) على كل من الجمع غير الموحد والمتوسط البسيط (1/K)، مما يؤكد ضرورة التوحيد حسب العدد لاستقرار التحسين.
ديناميكيات التدريب: أظهرت التشخيصات أن SRO يحافظ على استقرار معايير التدرج ويتعامل بفعالية مع أحجام المجموعات النشطة المتغيرة، بما في ذلك سيناريوهات الموجه التكيفي (adaptive-router) حيث كان متوسط حجم المجموعة غير صحيح (1.638).
الأهمية والادعاءات تدعي الورقة أن SRPO يسد فجوة حرجة في التعلم المعزز متعدد الوكلاء من خلال توفير وحدة تحسين مشتركة لنماذج التعاون المتنوعة. من خلال تعريف الإجراء كمجموعة من المخرجات التي تُستهلك في انتقال حالة ما، يوحد SRPO بين تقسيم العمل والتطور المشترك، مما يسمح لواجهة تدريب واحدة بالتعامل مع تدفقات العمل الثابتة، والمختلطة، والديناميكية.
يؤكد المؤلفون أن المبدأ الجوهري هو أن "المخرجات التي تغير البيئة معاً يجب أن تُحسّن معاً". وبينما تظهر النتائج تحسناً في المتوسطات العامة والاستقرار، تظل الورقة متواضعة فيما يتعلق بكفاءة التكلفة، مشيرة إلى أن تحليل التكلفة الحالي يعتمد على مؤشرات المخرجات (أعداد الرموز/tokens) بدلاً من وقت وحدة معالجة الرسومات (GPU) أو زمن استجابة الأدوات من النهاية إلى النهاية. يضع هذا العمل إطاراً تأسيسياً لتوسيع أنظمة النماذج اللغوية الكبيرة متعددة الوكلاء دون الحاجة إلى قواعد تحسين متميزة لاستراتيجيات التنسيق المختلفة.