Global Policy-Space Response Oracles for Two-Player Zero-Sum Games
تقدم هذه الورقة البحثية خوارزمية Global PSRO، وهي خوارزمية جديدة للألعاب الصفرية بين لاعبين تحسن أساليب (Policy-Space Response Oracles - PSRO) الحالية من خلال توظيف إطار عمل استكشاف-اختيار يتكون من مرحلتين لتقليل قابلية الاستغلال للمجتمع (Population Exploitability) بشكل مباشر، مما يحقق قابلية استغلال أقل وتقارباً أسرع نحو توازنات ناش بعدد أقل من تكرارات السياسة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
الصورة الكبيرة: العثات على الاستراتيجية المثالية في لعبة عملاقة
تخيل أنك تحاول العثور على الاستراتيجية المثالية للفوز بلعبة معقدة للغاية، مثل بطولة بوكر عالية المخاطر أو لعبة لوحية ضخمة. المشكلة هي أن عدد الحركات الممكنة هائل جدًا (مثل عدد حبات الرمل على الشاطئ)، بحيث لا يمكنك فحصها جميعًا.
لحل هذه المشكلة، يستخدم الباحثون طريقة تسمى PSRO (أوراكل استجابة فضاء السياسات). فكر في PSRO كأنه معسكر تدريبي لفريق من اللاعبين.
- تبدأ بمجموعة صغيرة من اللاعبين (مجموعة استراتيجيات مقيدة).
- تجعلهم يلعبون ضد بعضهم البعض للعثور على أفضل طريقة للعب ضمن هذه المجموعة الصغيرة.
- ثم، تأتي بـ "متحدٍ" جديد تم تدريبه خصيصًا لهزيمة أفضل فريق حالي.
- تضيف هذا المتحدي الجديد إلى الفريق وتكرر العملية.
الهدف هو بناء فريق صغير يكون جيدًا جدًا، لدرجة أنه يعمل تمامًا مثل "الفريق المثالي" الذي قد يوجد إذا كان بإمكانك التدريب ضد كل حركة ممكنة في عالم اللعبة بأكه.
المشكلة: فخ "البطل المحلي"
تجادل الورقة البحثية بأن الطريقة القديمة لإدارة هذا المعسكر التدريبي بها عيب.
الطريقة القديمة (القائمة على اللعبة المقيدة):
تخيل أن معسكرك التدريبي عبارة عن غرفة صغيرة مغلقة. يختار المدرب متحديًا جديدًا بناءً على من يهزم الفريق الحالي داخل تلك الغرفة.
- المشكلة: قد يكون المتحدي "بطلاً محليًا". إنه رائع في هزيمة الفريق الحالي في الغرفة الصغيرة، لكنه قد يكون سيئًا جدًا في اللعبة الفعلية الكبيرة في الخارج.
- النتيجة: أنت تستمر في إضافة "أبطال محليين". يصبح فريقك أفضل وأفضل في اللعب داخل الغرفة الصغيرة، لكنك تضيع الوقت والمال. قد تحتاج إلى إضافة كل لاعب ممكن تقريبًا إلى الفريق قبل أن تجد شخصًا جيدًا حقًا في اللعبة الحقيقية. هذا غير فعال.
الحل: "الكشاف العالمي" (Global PSRO)
يقترح المؤلفون طريقة جديدة تسمى Global PSRO. بدلاً من مجرد النظر في من يفوز في الغرفة الصغيرة، فإنهم يسألون: "إذا أضفنا هذا اللاعب الجديد إلى فريقنا، فبكم سيحسن فرصنا في الفوز باللعبة الكاملة؟"
إنهم يستخدمون مقياسًا يسمى Population Exploitability (PE) (قابلية الاستغلال للسكان). فكر في PE كأنه "درجة الضعف".
- PE مرتفع: فريقك لديه ثغرة كبيرة يمكن لخصم ذكي استغلالها.
- PE منخفض: فريقك صلب؛ ومن الصعب هزيمته.
كيف يعمل Global PSRO (العملية ذات المرحلتين):
المرحلة الأولى: اختبار الأداء (الاستكشاف)
بدلاً من طلب لاعب واحد جديد فقط، يطلب المدرب "دفعة" من المرشحين. يقومون بتدريب هؤلاء المرشحين ضد نسخ مختلفة من الفريق الحالي، وليس فقط ضد "الأفضل" منهم. هذا يخلق مجموعة متنوعة من اللاعبين المحتملين الجدد.المرحلة الثانية: تجربة الأداء (الاختيار)
هذا هو الجزء السحري. لا يكتفي المدرب باختيار المرشح الذي فاز بأكبر عدد من المباريات في تجربة الأداء. بد instead، يقوم بمحاكاة: "إذا أضفنا المرشح (أ) إلى الفريق، فما هي درجة الضعف الجديدة (PE) لفريقنا؟" ثم يفعل الشيء نفسه مع المرشح (ب)، والمرشح (ج)، إلخ.
- يختار المرشح الذي يؤدي إلى أدنى درجة ضعف (PE) للفريق بأكمله.
- كما يضيف لاعب "شبكة أمان" (أفضل استجابة للفريق الجديد) لضمان أنهم لم يغفلوا عن شيء ما.
التشبيه:
تخيل أنك تبني فريق كرة قدم.
- الطريقة القديدة: تستمر في التعاقد مع لاعبين بارعين في التسجيل ضد دفاعك الحالي، حتى لو لم يتمكنوا من التعامل مع سرعة الدوري الحقيقي. ينتهي بك الأمر بفريق مكون من 50 لاعبًا، جميعهم رائعون في التدريبات ولكنهم يخسرون في المباريات الحقيقية.
- Global PSRO: تقوم بتجربة 10 لاعبين جدد. لكل لاعب، تجري محاكاة: "إذا تعاقدنا مع اللاعب (س)، فكم عدد الأهداف التي سيسجلها أفضل فريق خصم في العالم ضدنا؟" أنت تتعاقد مع اللاعب الذي يجعل فريقك أصعب في الهزيمة في العالم الحقيقي، حتى لو لم يكن الأكثر إبهارًا في التسجيل أثناء التدريب.
لماذا يهم هذا الأمر؟
تثبت الورقة البحثية رياضيًا وتظهر من خلال التجار تجري (على ألعاب مثل البوكر وLiar's Dice) أن هذه الطريقة الجديدة أكثر كفاءة بك many.
- أسرع: تصل إلى مستوى "اللعب المثالي" بخطوات تدريب أقل بكثير.
- أذكى: تتجنب فخ إضافة لاعبين يبدون جيدين فقط من خلال رؤية ضيقة ومحدودة للعبة.
- قوي: تستخدم خدعة ذكية (مشاركة معايير عقل الكمبيوتر) لاختبار العديد من المرشحين في وقت واحد دون الحاجة إلى كمبيوتر خارق.
الملخص
تقدم الورقة البحثية Global PSRO، وهي طريقة أذكى لتدريب الذكاء الاصطناعي للألعاب المعقدة. بدلاً من مجرد اختيار اللاعب التالي بناءً على من يفوز في مباراة التدريب الحالية، فإنه يختار اللاعب الذي يجعل الفريق بأكمله الأقوى في مواجهة العالم الحقيقي. إنه الفرق بين توظيف عامل جيد في وصف الوظيفة، وتوظيف عامل يحل بالفعل أكبر مشاكل الشركة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.