CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs
تُعد CoFi-PGMA إطار عمل موحداً صُمم لتحسين أنظمة النماذج اللغوية الكبيرة متعددة الوكلاء باستخدام تدرجات السياسة المضادة للواقع لتصحيح "التغذية الراجعة المفلترة"، مثل التوجيه ذي البوابات الانتقائية أو المكافآت المشتركة المحجوبة في البيئات التعاونية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك جزء من مطبخ احترافي عالي المخاطر. لتقديم وجبة مثالية، لديك طريقتان مختلفتان للعمل، ولكن كلتاهما تعانيان من مشكلة رئيسية: التعليقات (التغذية الراجعة) التي تتلقاها من رئيس الطهاة مربكة أو غير مكتملة.
هذه الورقة البحثية، CoFi-PGMA، هي بمثابة "دليل تعليمات" رياضي جديد مصمم لمساعدة وكلاء الذكاء الاصطوي (AI agents) على تعلم كيفية العمل بشكل أفضل في هذين السيناريوهين الفوضويين في المطبخ.
السيناريو الأول: "الفائز يأخذ كل شيء" (التوجيه التنافسي)
تخَّيل ثلاثة طهاة (وكلاء ذكاء اصطناعي)، كل منهم يطهو طبقاً مختلفاً: أحدهم يصنع المعكرونة، والآخر يصنع شريحة اللحم (الستيك)، والثالث يصنع السلطة. يتذوق رئيس الطهاة (الموجه/Router) جميع الأطباق، لكنه يختار واحداً فقط ليقدمه للزبون.
- المشكلة: إذا اختار رئيس الطهاة شريحة اللحم، فسيحصل طاهي المعكرونة وطاهي السلطة على رد فعل "صفر". لن يعرفا ما إذا كان طبقهما لذيذاً أم سيئاً؛ كل ما يعرفانه هو أنه لم يتم اختيارهما. إذا تعلموا فقط من "الانتصارات"، فقد يبدأ الجميع في صنع شريحة اللحم فقط للبقاء في المنافسة، حتى لو كان الزبون يرغب في الواقع في السلطة. يُسمى هذا "التغذية الراجعة المقيدة بالاختيار" (Selection-Gated Feedback).
- حل CoFi-PGMA: بدلاً من مجرد قول "عمل جيد" للفائز، تستخدم هذه الطريقة نهجاً "تخيلياً مضاداً" (Counterfactual). فهي تسأل: "لو لم نكن قد اخترنا شريحة اللحم، كم كان الزبون سيحب المعكرونة؟" إنها تستخدم الرياضيات لتقدير جودة الأطباق التي لم تُختر. بهذه الطي، يتعلم طاهي المعكرونة كيفية التحسن حتى عندما لا يكون هو نجم العرض.
السيناريو الثاني: "فوضى المشروع الجماعي" (التوليد التعاوني)
الآن تخيل إعداداً مختلفاً: يعمل ثلاثة طهاة معاً على طبق "بيف ويلينغتون" (Beef Wellington) معقد واحد. أحدهم يجهز اللحم، والآخر يجهز العجين، والثالث يجهز الصلصة. في النهاية، يتذوق رئيس الطهاة الطبق النهائي ويعطي الفريق بأكمله درجة واحدة: "8 من 10".
- المشكلة: هذا هو كابوس "المشروع الجماعي". إذا كانت الدرجة 8، فهل كان ذلك لأن اللحم كان مثالياً، أم لأن العجين كان رائعاً لدرجة أنه أنقذ لحماً متوسط الجودة؟ لا يعرف الطهاة قيمتهم الفردية. قد يلجأ بعضهم إلى "الركوب المجاني" (القيام بشيء بسيط ونسب الفضل لأنفسهم) أو يشعرون بالإحباط لأن خطأ زميل لهم خفض درجتهم. يُسمى هذا "تحديد المسؤولية" (Credit Assignment).
- حل CoFi-PGMA: تستخدم هذه الطريقة استراتيجية "ترك واحد مستبعداً" (Leave-One-Out). فهي تحسب رياضياً: "ماذا كانت ستكون الدرجة لو أن طاهي العجين استخدم عجيناً جاهزاً من المتجر بدلاً من صنعه من الصفر؟" من خلال قياس هذا الفرق المحدد، يمكن للنظام تحديد مقدار مساهمة كل شخص بالضبط.
لماذا يهم هذا بالنسبة للذكاء الاصطناعي؟
معظم أنظمة الذكاء الاصطناعي اليوم يتم تدريبها كطالب واحد يدرس بمفرده. لكن مستقبل الذكاء الاصطناي هو "متعدد الوكلاء" (Multi-Agent) — مجموعات من أنظمة الذكاء الاصطناعي المتخصصة التي تتحدث مع بعضها البعض، أو تتنافس، أو تتعاون لحل مشكلات معقدة (مثل برمجة تطبيق أو حل مسألة رياضية).
إذا قمنا بتدريب هذه "الفرق" باستخدام الطرق القديمة، فستصبح منحازة، أو كسولة، أو مرتبكة. يوفر CoFi-PGMA "نظام الدرجات العادل" الذي يحتاجون إليه.
النتيجة: في الاختبارات التي أجراها الباحثون (باستخدام مسائل رياضية)، كانت وكلاء الذكاء الاصطناعي الذين تم تدريبهم باستخدام هذه الطريقة الجديدة أذكى وأكثر تخصصاً من أولئك الذين استخدموا أنظمة الدرجات القديمة "غير العادلة". لم يحصلوا فقط على الإجابة الصحيحة، بل تعلموا بالفعل كيفية أداء أدوارهم المحددة بشكل أفضل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.