DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat
تقدم الورقة البحثية DungeonBench، وهو معيار شامل لتقييم التفكير التكتيكي في قتال "Dungeons & Dragons" يتحدى النماذج اللغوية الرائدة للتنقل عبر القواعد المعقدة، والهندسة، وإدارة الموارد عبر كل من المواجهات الفردية وأيام المواجهات المتعددة، مما يكشف عن فجوات كبيرة في قدرتها على الموازنة بين المزايا التكتيكية الفورية والاستدامة الاستراتيجية طويلة الأمد.
المؤلفون الأصليون: Ismayil Ismayilov, Atakan Kara, Kaan Oktay
المؤلفون الأصليون: Ismayil Ismayilov, Atakan Kara, Kaan Oktay
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: DungeonBench
بيان المشكلة
غالبًا ما تفتقر اختبارات الذكاء الاصطناعي الحالية إلى اختبار الاستدلال التكتيكي الغني بالقواعد: أي القدرة على اتخاذ قرارات مثالية عندما تجتمع الهندسة، والتوقيت، وندرة الموارد، والأهداف، وتفاعلات القواعد المعقدة في آن واحد. وبينما حققت ألعاب مثل Go وStarCraft وNetHack تقدمًا في التحكم المستمر والتخطيط، إلا أنها غالبًا ما تغفل عن مساحات العمل غير المتجانسة وتبعيات القواعد المعقدة الموجودة في مجالات مثل ألعاب تقمص الأدوار الورقية (Tabletop RPGs). في المجالات التكتيكية، يمكن أن يكون الإجراء الأمثل محليًا (مثل إلحاق ضرر عالٍ) غير مثالي استراتيجيًا إذا استنزف موردًا نادرًا مطلوبًا لمواجهة مستقبلية أو فشل في مراعاة تضاريس معينة وآليات رد الفعل. لا يكمن التحدي في التخطيط طويل الأمد أو عوامل التفرع الكبيرة فحسب، بل في تقييم الخيارات المشروط بالحالة تحت مجموعة قواعد قابلة للتنفيذ وصارمة.
المنهجية
إطار عمل DungeonBench
DungeonBench هو معيار ومحرك محاكاة مبني على وثيقة مرجع نظام Dungeons & Dragons لعام 2014 (SRD). يقوم بترجمة نظام القتال الغني بالقواعد في D&D إلى مهمة اتخاذ قرار قابلة للقياس. تم تصميم النظام للاحتفاظ بالآليات التي غالبًا ما يتم تجريدها في محاكيات القتال المبسطة، بما في ذلك:
- الآليات المعقدة: ردود الفعل (Reactions)، التركيز (Concentration)، المناطق المستمرة، الاستدعاءات، الأفعال الأسطورية (Legendary Actions)، وميزات تعدد الفئات (Multi-classing).
- الفضاء التكتيكي ثلاثي الأبعاد: نظام شبكي ثنائي ونصف الأبعاد يدعم الارتفاع، الطيران، السقوط، وحجب خط الرؤية.
- استمرارية الموارد: تتبع نقاط الحياة (HP)، خانات التعاويذ (Spell Slots)، المواد الاستهلاكية، وتوقيت الاستراحة القصيرة عبر مواجهات متعددة.
واجهة القرار وتفكيك الإجراءات
لإدارة مساحة العمل الهائلة المتأصلة في D&D (مثل اختيار الأهداف، مستويات التعاويذ، وإحداثيات X وY وZ لتعاويذ التأثير في منطقة معينة)، يستخدم DungeonBench تفكيك الإجراءات الهرمي:
- توليد الخيارات القانونية: يقوم محرك القواعد بتوليد قائمة كاملة ومفهرسة من الخيارات القانونية القابلة للتنفيذ لكل نقطة قرار. لا يحتاج الوكلاء إلى تحليل الصيغ البرمجية أو اكتشاف الحركات القانونية؛ بل يجب عليهم ترتيب والاختيار من القائمة المقدمة.
- الخيارات المفككة: بدلاً من تقديم مساحة عمل مسطحة وضخمة، تقوم الواجهة بتفكيك الإجراءات المعقدة إلى تسلسلات. على سبيل المثال، يتضمن وضع تعويذة Fireball اختيار إحداثي X، ثم إحداثي Y مشروط بـ X، ثم إحداثي Z مشروط بـ (X, Y). وبالمثل، يتم تقديم الحركة أولاً كوجهة يمكن الوصول إليها، مع تفكيك اختيار المسار فقط إذا كانت المسارات المختلفة تؤدي إلى نتائج متباينة يراها المحاكي (مثل هجمات الفرصة أو المخاطر).
- الملاحظة: يتلقى الوكلاء ملاحظة تكتيكية كاملة تشمل إحصائيات المقاتلين، حالة الخريطة، التأثيرات النشطة، وسياق القرار الحالي. يفترض هذا المعيار الإدراك الكامل (Full Observability) لعزل التقييم التكتيكي عن مهام الإدراك أو الذاكرة.
مسارات الاختبار
يقيم المعيار الوكلاء في مسارين متميزين:
- مسار المواجهة (Encounter Track): يختبر الكفاءة التكتيكية المحلية في القتالات الفردية. يُقاس النجاح بالفوز في القتال أو تحقيق أهداف محددة (مثل حماية هدف، أو السيطرة على منطقة).
- مسار اليوم (Day Track): يربط عدة مواجهات من خلال حالة الفريق المستمرة والاستراحات القصيرة المحدودة. يجبر هذا المسار الوكلاء على الموازنة بين الميزة التكتيكية الفورية والقدرة على البقاء في المستقبل. يُعطى الوكلاء تسلسل المواجهات المستقبلية لاختبار قدرتهم على ميزانية الموارد (خانات التعاويذ، نرد الحياة، المواد الاستهلاكية) عبر "يوم" من المغامرة.
بروتوكول التقييم
يركز التقييم على نماذج اللغة المتطورة (مثل GPT-5.5، Claude Opus 4.7، Gemini 3.1 Pro) التي تعمل كسياسات (Policies).
- التحكم: يتم التحكم في فريق المعيار بواسطة النموذج المختبر، بينما يتم التحكم في جميع القوى المعارضة بواسطة مخطط استدلالي (Heuristic Planner) ثابت.
- الواجهة: تتفاعل النماذج عبر واجهة نصية مهيكلة، حيث تختار من معرفات الخيارات القانونية التي يولدها المحرك. يمكنها استخدام أدوات البحث لاسترجاع تفاصيل قواعد محددة (مثل تأثيرات التعاويذ، تكاليف الحركة) بدلاً من تضمين القواعد في كل مطالبة (Prompt).
- المقاييس:
- المواجهة: معدل الفوز، كسر نقاط حياة الفريق النهائي، كسر الناجين، وجولات الإنهاء.
- اليوم: معدل الإكمال الكامل (الفوز في جميع مواجهات اليوم)، الحالة النهائية للموارد، وكسر الناجين.
المساهمات الرئيسية
- محرك DungeonBench: محرك قواعد قتال ومجموعة أدوات معيارية تغطي نظام D&D SRD لعام 2014 المتعلق بالقتال، وقادر على حل التفاعلات المعقدة مثل الأفعال الأسطورية، التركيز، والتموضع ثلاثي الأبعاد دون الحاجة إلى تقدير مفتوح النهايات.
- التقييم ثنائي المسار: تقديم مساري المواجهة واليوم لفصل قياس اللعب التكتيكي المحلي مقابل ميزانية الموارد متوسطة المدى، مما يسلط الضوء على التباين بين "الفوز في قتال" و"الفوز باليوم".
- سطح سياسة موحد: تدفق قرار مشترك يدعم المتحكمات الاستدلالية، سياسات نماذج اللغة، ووكلاء التعلم المعزز، مما يسمح بالمقارنة المباشرة لتقييم الخيارات التكتيكية بين فئات النماذج المختلفة.
النتائج
يكشف تقييم نماذج اللغة المتطورة عن فجوة كبيرة بين الكفاءة التكتيكية المحلية وإدارة الموارد طويلة المدى:
- أداء المواجهة: حققت النماذج الرائدة (Gemini 3.1 Pro و GPT-5.5) معدلات فوز تقارب 82-83% في المواجهات الفردية، مع الحفاظ على نسب عالية من صحة الفريق والناجين. تباين الأداء بشكل كبير بين النماذج، حيث استخدمت بعض النماذج (مثل DeepSeek V4) المزيد من الرموز (Tokens) وأدوات البحث دون تحقيق معدلات فوز أعلى.
- أداء اليوم: انخفض الأداء بشكل حاد في مسار اليوم. نجحت أفضل النماذج في اجتياز 2 من أصل 5 أيام مواجهة مترابطة فقط.
- فشل ميزانية الموارد: غالبًا ما فشلت النماذج في الحفاظ على الموارد (خانات التعاويذ، نرد الحياة) للمواجهات اللاحقة، مما أدى إلى "الإبادة" (Wipes) في الغرف الأخيرة رغم الفوز في المواجهات الأولى.
- الهدف مقابل الاستنزاف: كانت حالات الفشل مختلفة نوعيًا عن إخفاقات المواجهة. فقد خسر بعض الأيام بسبب أخطاء في تسلسل الأهداف (مثل الفشل في تأمين هدف الخريطة) بدلاً من الاستنزاف التدريجي، بينما أظهرت حالات أخرى فوز النماذج في القتالات المبكرة ولكن استنفاد الموارد قبل الزعيم النهائي.
- تعقيد القرار: عرض مسار اليوم الوكلاء لآفاق أطول بكثير (328-391 قرارًا لكل حلقة مقابل 79-109 في المواجهة) ومجموعات خيارات أكبر، خاصة في سيناريوهات الأهداف والزعماء حيث يمكن أن تتجاوز عدد الخيارات المحلية 1,000 خيار.
الأهمية والادعاءات
يزعم البحث أن الملاحظات التكتيكية الكاملة لا تشبع المعيار. فبينما يمكن للنماذج الرائدة غالبًا الفوز بمواجهات معزولة، إلا أنها تعاني مع الانضباط المطلوب لميزانية الموارد والتخطيط التكتيكي الواعي بالقواعد عبر تسلسلات مترابطة.
تكمن أهمية DungeonBench في قدرته على:
- عزل الاستدلال التكتيكي: من خلال توفير معلومات حالة كاملة وخيارات قانونية، يزيل المعيار متغيرات الإدراك والذاكرة كعوامل مربكة، ويركز التقييم على تقييم الخيارات تحت قواعد معقدة.
- كشف النقاط العمياء الاستراتيجية: يوضح مسار اليوم أن الأداء العالي في الحلقات المنفردة لا يضمن الكفاءة في البيئات التي يجب فيها وزن المكاسب الفورية مقابل القيود المستقبلية.
- توفير بيئة اختبار واقعية: من خلال الاحتفاظ بـ "نسيج" قتال D&D (الشروط، ردود الفعل، الارتفاع، وندرة الموارد) دون تبسيطها، يوفر DungeonBench بيئة صارمة لاختبار وكلاء الذكاء الاصطناعي في اتخاذ القرارات المعتمدة على الحالة وغير المتجانسة.
يخلص المؤلفون إلى أن DungeonBench يوفر إطارًا قابلًا للقياس والتكرار لتقييم الوكلاء في تحدي الاستدلال التكتيكي الغني بالقواعد، مع التمييز بين التحسين المحلي والتخطيط الاستراتيجي العالمي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث AI كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.