Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments
تقدم هذه الورقة Social Gym، وهو معيار ألعاب متعدد الوكلاء قابل للتحقق لتقييم الاستدلال الاجتماعي للنماذج اللغوية الكبيرة بشكل موضوعي، وSPaRTan، وهو إطار عمل للتحسين الذاتي لا يتطلب تدريباً يستفيد من التأمل وكتيبات اللعب القابلة للنقل لتعزيز الأداء في أدوار ألعاب محددة دون الحاجة إلى تحديث أوزان النموذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: Social Gym و SPARTAN
بيان المشكلة
يتم نشر وكلاء النماذج اللغوية الكبيرة (LLM) بشكل متزايد في بيئات اجتماعية متعددة الوكلاء تتطلب التعاون، والتفاوض، والتكيف. ومع ذلك، يواجه قياس وتحسين هذه المهارات الاجتماعية يواجه ثلاثة قيود حرجة في التقييمات الحالية:
- المعايير المرجعية الثابتة: تعتمد العديد من التقييمات على استبيانات نظرية العقل الثابتة (مثل FANToM و ToMi) التي تنتج درجات قابلة للتكرار ولكنها تفشل في اختبار السلوك المستمر متعدد الجولات.
- الحكم الذاتي: تقيم التقييمات التفاعلية مفتوحة النهاية (مثل SOTOPIA) المهارات متعددة الجولات ولكنها تعتمد على تسجيل "النموذج اللغوي كحكم" (LLM-as-judge)، وهو أمر عرضة لانحيازات الموقع، والإسهاب، والتعزيز الذاتي، مما يجعل النتائج ضوضائية وذاتية.
- النطاق الضيق: تستهدف الأعمال الحديثة التي تستخدم مكافآت قابلة للتحقق ألعابًا أو مجالات منفردة في عزلة، مما يفشل في التقاط اتساع الذكاء الاجتماعي عبر هياكل التفاعل المختلفة.
هناك فجوة لإطار تقييم يكون في الوقت نفسه متعدد الجولات، واسع النطاق في تغطية المجالات، وقابل للتحقق (يتم تحديده من خلال قواعد التفاعل بدلاً من الحكم الذاتي). علاوة على ذلك، لا يزال من غير الواضح ما إذا كان بإمكان النماذج اللغوية الكبيرة تحسين قدراتها في الاستدلال الاجتماعي دون تحديث المعلمات (تغيير الأوزان).
المنهجية
Social Gym: معيار مرجعي قابل للتحقق
قدم المؤلفون Social Gym، وهو بيئة تضم 21 لعبة اجتماعية متعددة الوكلاء مصممة لاختبار الاستدلال الاجتماعي عبر خمس فئات:
- ألعاب الصيغة العادية (6): ألعاب مصفوفة متكررة ذات معلومات كاملة ولا تتطلب تواصلًا (مثل معضلة السجين، ولعبة الدجاج - Chicken).
- الألعاب الاقتصادية (3): تخصيص موارد متعدد الجولات يتطلب استدلالًا استراتيجيًا (مثل السلع العامة، ولعبة السنتيبيد - Centipede).
- ألعاب الخداع (4): ألعاب ذات حالة مخفية تتطلب التضليل أو الاستنتاج (مثل نرد الكاذب - Liar's Dice، ولعبة Coup).
- استنتاج الدور المخفي (6): ألعاب بتعيينات أدوار سرية تتطلب حوارًا لتحديد الحلفاء أو الأعداء (مثل Werewolves، وResistance، وSpyfall).
- الاستراتيجية الاجتماعية (2): ألعاب ذات معلومات كاملة تعتمد على تشكيل التحالفات والسمعة (مثل Survivor).
الميزات الهيكلية الرئيسية:
- النتائج القابلة للتحقق: لكل لعبة نتيجة يحددها خوارزميًا (فوز/خسارة/نقاط)، مما يلغي الحاجة إلى أحكام النماذج اللغوية الكبيرة.
- الإدراك الجزئي: يقوم طبقة الرؤية بفلترة الرسائل إلى نطاقات عامة، أو خاصة بالفريق، أو خاصة، مما يجبر الوكلاء على القيام باستدلال "نظرية العقل".
- بطولة Elo الموحدة: يقوم نموذج "برايدلي-تيري" (Bradley-Terry) لتعظيم الاحتمالية بإنشاء جداول معدل الفوز لكل لعبة ولوحة صدارة عابرة للألعاب، مما يسمح بتصنيف موضوعي للنماذج عبر هياكل اجتماعية متنوعة.
SPARTAN: التحسين الذاتي بدون تدريب
لمعالجة مسألة ما إذا كان بإمكان النماذج اللغوية الكبيرة التحسن دون تحديث الأوزان، اقترح المؤلفون SPARTAN (اللعب الذاتي ونقل التأمل)، وهي حلقة مكونة من ثلاث مراحل:
- اللعب (Play): يلعب النموذج من ألعاب اللعب الذاتي للعبة معينة ، مما يولد مسارات لعب.
- التأمل (Reflect): يحلل النموذج مساراته ونتائجه الخاصة لإنشاء "كتيب استراتيجي" (playbook) من منظور الشخص الأول وقابل للنقل (يغطي الخداع، والكشف، والإقناع، إلخ). ومن المهم أن يتم توجيه الكتيب ليكون غير مرتبط بلعبة محددة (بدون إشارات إلى أرقام ألعاب معينة).
- النقل (Transfer): يتم وضع الكتيب الناتج في مقدمة "المطالبة النظامية" (system prompt) للوكيل للألعاب اللاحقة.
يعمل هذا النهج كـ "ضبط دقيق داخل السياق" حيث تكون "بيانات التدريب" هي لعب النموذج الخاص و"الأوزان المتعلمة" هي قواعد باللغة الطبيعية.
النتائج الرئيسية
نتائج المعيار المرجعي (Social Gym)
- انقلابات لوحة الصدارة: بينما يتصدر GPT-5-mini لوحة الصدارة العامة (1110 Elo)، لا يتفوق أي نموذج بشكل موحد عبر جميع الألعاب أو الأدوار. تنقلب التصنيفات بشكل حاد؛ فعلى سبيل المثال، يحتل Qwen3-32B المركز الأول في لعبة "Chicken" المحددة (1328 Elo) ولكنه يحتل المركز الأخير في "Werewolves" (817 Elo) من بين سبعة نماذج تم تقييمها.
- عدم التماثل في الأدوار: في ألعاب الأدوار المخفية، غالبًا ما تؤدي النماذج بشكل مختلف في الأدوار الأقلية/المخادعة (Alt) مقابل الأدوار الأكثرية/المتعاونة (Main). بشكل عام، الدور الأقلية أسهل هيكليًا للفوز ضد مجموعة مختلطة من الخصوم، لكن هذا التفوق ينعكس في اللعب الذاتي المتكافئ القدرات للنماذج الأقوى.
- قصور النماذج: تظهر النماذج الأصغر (مثل Qwen2.5-3B) "تأثير الببغاء"، حيث تقوم كثيرًا بإعادة صياغة المتحدث السابق بدلاً من توليد حجج مستقلة، مما يساهم في انخفاض الأداء.
نتائج تقييم SPARTAN
قيم المؤلفون SPARTAN عبر أربعة محاور: التكرار داخل اللعبة، النقل عبر الألعاب، النقل متعدد الألعاب، والتقطير عبر النماذج.
التكرار داخل اللعبة (GPT-5-mini):
- حقق حقن كتيب () رفعًا كبيرًا لمعدل الفوز للجانب الأضعف هيكليًا (Alt) في الألعاب غير المتماثلة (مثل ارتفاع معدل فوز Alt في Werewolves من 23% إلى 36%).
- على العكس من ذلك، يشهد الجانب الأقوى هيكليًا (Main) غالبًا انخفاضًا في الأداء عند تسليحه بنفس الكتيب.
- المكاسب غير رتيبة؛ حيث يحدث معظم التحسن عند ، بينما تقوم الجولات اللاحقة (–) بإعادة توزيع المكاسب بدلاً من تراكمها.
النقل عبر الألعاب والتحويل متعدد الألعاب:
- تنتقل الكتيبات المولدة من لعبة واحدة (مثل Werewolves) بفعالية إلى الجانب الأضعف في ألعاب الأدوار المخفية الأخرى (مثل Spyfall، Resistance)، مما يحسن معدلات الفوز بنسبة تتراوح بين +7 إلى +27 نقطة مئوية.
- الكتيبات متعددة الألعاب (المدربة على مصادر متعددة) لا تتفوق باستمرار على الكتيبات أحادية اللعبة، مما يشير إلى أن لعبة تدريب واحدة ذات صلة توفر إشارة كافية للنقل.
التقطير عبر النماذج:
- نجحت الكتيبات المولدة بواسطة GPT-5-mini في التقطير لنماذج الطالب الأضعف (مثل Qwen3-4B، GPT-4o-mini)، مما رفع أداءها في الأدوار الأضعف هيكليًا (مثل الجواسيس في Resistance) بنسبة تتراوح بين +13 إلى +24 نقطة مئوية.
- التأثير يعتمد على الدور، وليس على الطالب: يساعد الكتيب النموذج الذي يلعب الدور غير المتكافئ، بغض النظر عن قدرة الطالب الأساسية.
الاعتماد على القدرة (Qwen3-32B):
- عند تطبيق SPARTAN على النموذج مفتوح الأوزان Qwen3-32B، يفشل غالبًا في تحسين الأداء في ألعاب الاستنتاج الاجتماعي المعقدة (Werewolves، Spyfall).
- الاستثناء الوحيد هو معضلة السجين (Prisoner's Dilemma)، حيث يفرض الكتيب إجراءً محددًا (الخيانة في الجولة الأخيرة) يمكن للنموذج تنفيذه.
- في الألعاب التي تعتمد على النقاش، يفشل Qwen3-32B في كسر سلوك "الببغاء"؛ إذ غالبًا ما تقوم عملية التأمل بترميز سلوك الببغاء داخل الكتيب بدلاً من القضاء عليه.
الأهمية والادعاءات
يدعي البحث مساهمتين رئيسيتين:
- يوفر Social Gym أساسًا قابلًا للتكرار والتحقق لقياس الاستدلال الاجتماعي للنماذج اللغوية الكبيرة دون الاعتماد على أحكام ذاتية. ويكشف أن القدرة الاجتماعية ليست قدرة عددية واحدة، بل تعتمد بشدة على هيكل التفاعل، والدور، وفئة اللعبة.
- يثبت SPARTAN أن النماذج اللغوية الكبيرة يمكنها تحسين الأداء الاجتماعي دون تحديث المعلمات من خلال استخراج استراتيجيات قابلة للنقل من اللعب الذاتي. ومع ذلك، فإن هذا التحسن يعتمد على القدرة والتركيب: فهو يرفع بفعالية الأدوار الأضعف هيكليًا في الألعاب المعقدة للنماذج عالية القدرة، ولكنه يفشل للنماذج التي تفتقر إلى قدرة الاستدلال لمعالجة مسارات اجتماعية طويلة الأمد أو كسر أنماط الببغاء.
خلص المؤلفون إلى أن Social Gym و SPARTAN يقدمان إطارًا لفصل الخصائص الهيكلية للمواقف الاجتماعية عن إخفاقات النماذج المحددة (مثل ضعف الخداع، أو سوء تتبع التحالفات). ويقترحون أن هذه البيئة هي ميدان اختبار طبيعي لأبحاث التعلم المعزز باستخدام المكافآت القابلة للتحقق (RLVR)، مما يسمح بتدريب مهارات الاستدلال الاجتماعي على نطاق واس-ع دون الحاجة لأحكام النماذج اللغوية الكبيرة.
القيود المعترف بها:
- الصلاحية الخارجية: جميع الألعاب لها قواعد ثابتة ومعايير فوز/خسارة، مما قد لا يعكس تمامًا التفاعلات الاجتماعية في العالم الحقيقي مثل بناء الثقة طويل الأمد.
- حجم العينة: تعتمد النتائج على حوالي 30 لعبة لكل حالة، مما ينتج فترات ثقة تبلغ حوالي ±18 نقطة مئوية.
- غياب التحكم بالدواء الوهمي (Placebo Control): تفتقر الدراسة إلى تحكم "الكتيب الوهمي" لتمييز تأثيرات المحتوى عن اضطرابات المطالبة العامة، رغم أن الأنماط الهيكلية تشير إلى أن التأثيرات مدفوعة بالمحتوى.
- قيود التأمل: يقتصر التأمل على النصوص باللغة الطبيعية داخل المطالبة النظامية، ويفتقر إلى أدوات الاسترجاع الخارجي أو الاستدلال المهيكل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.