← أحدث الأبحاث
🤖 AI

SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs

تقدم الورقة البحثية SRPO (تحسين السياسة النسبية المجموعية)، وهو إطار عمل جديد للتعلم التعزيزي للنماذج اللغوية الكبيرة متعددة الوكلاء يوحد بين تقسيم العمل والتطور المشترك الجماعي من خلال معاملة الحد الأدنى من مجموعة المخرات المستهلكة في انتقال حالة واحدة كإجراء موحد، مما يتيح تدريباً مستقراً وفعالاً عبر مختلف سير العمل ونطاقات النماذج.

المؤلفون الأصليون: Shengtian Yang, Ziyu Xiong, Yu Li, Yewen Li, Qingpeng Cai, Lei Feng

نُشر 2026-09-09✓ Author reviewed
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shengtian Yang, Ziyu Xiong, Yu Li, Yewen Li, Qingpeng Cai, Lei Feng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناي المتطور بسرعة، تعلمت النماذج اللغوية الكبيرة كيف تعمل كوكلاء، قادرة على التفكير، والبحث عن المعلومات، واستخدام الأدوات لحل المشكلات المعقدة. وعندما تعمل هذه النماذج بمفردها، فإنها تتبع مساراً واحداً من التفكير. ومع ذلك، لمواجهة التحديات الأصعب، غالباً ما ينشر الباحثون عدة وكلاء يتعاونون، تماماً مثل فريق من المتخصصين. وفي بعض الأحيان، تقسم هذه الفرق المهمة بحيث يتولى كل عضو دوراً محدداً، بينما في أوقات أخرى، يولدون عدة أفكار مختلفة في وقت واحد لصقل الحل معاً. لقد كانت الصعوبة المركزية في تدريب مثل هذه الفرق تكمن في كيفية مكافأتهم. فغالباً ما تعامل الطرق التقليدية مخرجات كل وكيل كحدث منفصل، حتى عندما يعمل عدة وكلاء معاً لإنتاج نتيجة واحدة. وهذا يخلق عدم تطابق: حيث يتعلم النظام من قطع منفصلة من اللغز بدلاً من الصورة الكاملة التي تشكلها معاً، مما يجعل من الصعب تدريب الفرق التي تنتقل بين العمل بمفردها والعمل بشكل جماعي.

لقد عالج فريق من الباحثين عدم التطابق هذا باقتراح طريقة تدريب جديدة تسمى "تحسين السياسة النسبي للمجموعات" (Setwise Relative Policy Optimization أو SRPO). فبدلاً من النظر إلى الاستجابات الفردية، يعامل هذا النهج مجموعة المخرجات بأكملها التي تسبب تغييراً في البيئة كوحدة عمل واحدة. تخيل فريقاً من المستكشفين يصلون إلى مفترق طرق؛ سواء اختار شخص واحد مساراً، أو ناقش الفريق بأكولو المسار ثم اختاروا طريقاً معاً، فإن القرار الذي يدفعهم للأمام هو النتيجة الجماعية. وقد وجد الباحثون أنه من خلال تجميع هذه المخرجات فيما يسمونه "المجموعة النشطة"، استطاعوا تدريب النظام لفهم أن الجهد الجماعي للفريق هو الإجراء الحقيقي. وتسمح هذه الطريقة بتطبيق نفس قواعد التدريب سواء كان الفريق يعمل وفق تقسيم صارم للعمل، حيث يقوم شخص واحد بشيء واحد، أو في وضع التطور المشترك، حيث يساهم عدة أشخاص في فكرة مشتركة في آن واحد.

اختبر الباحثون هذه الفكرة على نوعين مختلفين تماماً من المهام: حل المسائل الرياضية الصعبة وإجراء عمليات بحث متعددة الخطوات للعث_ال معلومات محددة. في تجارب الرياضيات، كان على النظام توليد حلول مرشحة ثم التحقق منها، وهي عملية قد تتطلب أحياناً أن يقوم وكيل بالحل وآخر بالتدقيق، وتتطلب في أحيان أخرى أن يقترح عدة وكلاء اشتقاقات مختلفة في وقت واحد. وفي تجارب البحث، كان على النظام أن يقرر متى يطلب المزيد من المعلومات، مع إمكانية قيام عدة وكلاء بإصدار استعلامات بحث في وقت واحد قبل أن يقوم مجمع بدمج النتائج. وعبر أربعة أحجام مختلفة من النماذج اللغوية، تفوقت الطريقة الجديدة باستمرار على النهج القائمة. وفي الاختبارات الرياضية، حقق النظام دقة متوسطة حيث كانت حوالي 61 إلى 62 بالمائة من الحلول المولدة صحيحة، ووجد حلاً صحيحاً واحداً على الأقل لحوالي 78 بالمائة من المسائل. وفي مهام البحث، كان التحسن أكثر وضوحاً، حيث وجدت الطريقة الجديدة إجابات صحيحة لأكثر من 60 بالمائة من الاستعلامات في المتوسط، وهو ما يمثل قفزة كبيرة عن الطرق السابقة.

كان جزء رئيسي من الاكتشاف هو فهم كيفية موازنة مساهمات الوكلاء المتعددين. فإذا قام النظام ببساطة بجمع التغييرات التي أجراها كل وكيل، فسيظهر الفريق الأكبر كأنه يمتلك تأثيراً أكبر بك הרבה من الفريق الأصغر، لمجرد وجود أصوات أكثر. وقد حل الباحثون ذلك من خلال تطبيع مساهمة المجموعة، مما يضمن عدم وزن فريق مكون من خمسة وكلاء بشكل غير عادل مقابل وكيل واحد لمجرد حجمه. كما أظهروا أن النظام يمكنه تعلم الانتقال بين هذه الأوضاع ديناميكياً. ففي بعض الحالات، تعلم النظام أن اختيار وكيل متخصص واحد هو الخيار الأفضل، بينما في حالات أخرى، قام بتنشيط مجموعة صغيرة من الوكلاء للعمل معاً. هذا المرونة تعني أن عملية التدريب لا تحتاج إلى إعادة كتابة للنماذج المختلفة؛ إذ تعامل المنطق الأساسي نفسه كلا السيناريوهين بسلاسة.

كما بحثت الدراسة بدقة في تكلفة هذه التحسينات. فقد حرص الباحثون على ضمان أن النتائج الأفضل لم تكن ببساطة بسبب توليد النص الجديد لمزيد من النصوص أو استخدام المزيد من القدرة الحوسبية. فقد قاموا بقياس عدد الرموز (tokens) المولدة وعدد استدعاءات الأدوات، ووجدوا أن التحسينات جاءت من تنسيق أفضل وليس من القوة الغاشمة. في الواقع، أدت عملية التدريب غالباً إلى استجابات أقضاء وأكثر كفاءة بمرور الوقت. وأشار الباحثون إلى أنه بينما كانت النتائج قوية، إلا أنها استندت إلى معايير ومقارنات محددة مع طرق أخرى منشورة، وسيتعين على العمل المستقبلي استكشاف مدى صمود هذه المكاسب في عمليات النشر الواقعية طويلة الأمد. ومع ذلك، فإن النتيجة الجوهرية قائمة: من خلال تعريف المخرج الجماعي للفريق كالوحدة الأساسية للإجراء، يمكن تدريب الأنظمة متعددة الوكلاء لتكون أكثر استقراراً وكفاءة وفعالية في حل المشكلات المعقدة، بغض النظر عما إذا كانوا يعملون بمفردهم أو معاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →