← नवीनतम पेपर
🤖 AI

DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat

यह शोधपत्र DungeonBench पेश करता है, जो डन्जन्स एंड ड्रैगन्स (Dungeons & Dragons) युद्ध में सामरिक तर्क (tactical reasoning) के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, जो अत्याधुनिक भाषा मॉडलों को एकल मुठभेड़ों और बहु-मुठभेड़ वाले दिनों, दोनों में जटिल नियमों, ज्यामिति और संसाधन प्रबंधन को नेविगेट करने की चुनौती देता है, जिससे तात्कालिक सामरिक लाभों और दीर्घकालिक रणनीतिक स्थिरता के बीच संतुलन बनाने की उनकी क्षमता में महत्वपूर्ण अंतराल का पता चलता है।

मूल लेखक: Ismayil Ismayilov, Atakan Kara, Kaan Oktay

प्रकाशित 2026-08-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ismayil Ismayilov, Atakan Kara, Kaan Oktay

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खेल खेलना सिखाने की कोशिश कर रहे हैं। लंबे समय से, वैज्ञानिक रोबोटों को ऐसे खेल खेलने में माहिर बनाने में बहुत अच्छे रहे हैं जहाँ नियम सरल और लक्ष्य स्पष्ट होते हैं, जैसे ग्रिड पर किसी मोहरे को ले जाना या किसी लक्ष्य पर निशाना साधना। लेकिन एक विशेष प्रकार की सोच है जिसे सिखाना बहुत कठिन है: सामरिक तर्क (tactical reasoning)। यह केवल नियमों को जानने के बारे में नहीं है; यह इस बारे में है कि नियम आपस में कैसे टकराते हैं। यह यह जानने के बीच का अंतर है कि आप कूद सकते हैं, और यह जानने के बीच कि यदि आप अभी कूदते हैं, तो शायद आप किसी गड्ढे में गिर जाएंगे जिससे आप फिसल सकते हैं, या बाद में कूदने से आप टाइमर खत्म होने से पहले कोई पावर-अप हासिल कर पाएंगे। इस तरह की सोच के लिए ज्यामिति (चीजें कहाँ हैं), समय (चीजें कब होती हैं), और सीमित संसाधनों (जैसे सीमित ऊर्जा या गोला-बारूद) को एक साथ संभालने की आवश्यकता होती है। वैज्ञानिक इस पर इसलिए ध्यान देते हैं क्योंकि यदि हम कंप्यूटर को इस तरह के जटिल, "क्या-होगा-अगर" वाले विकल्प चुनने में सक्षम बना सकें, तो हम ऐसी AI बनाने के करीब पहुँच जाएंगे जो वास्तविक दुनिया की समस्याओं को हल कर सके जहाँ सब कुछ आपस में जुड़ा हुआ है और कुछ भी सरल नहीं है।

यहाँ आता है DungeonBench, एक नया "टेस्ट ट्रैक" यह देखने के लिए बनाया गया है कि क्या कृत्रिम बुद्धिमत्ता (AI) वास्तव में इस तरह की जटिल, नियम-प्रधान सोच में महारत हासिल कर सकती है। शोधकर्ताओं ने प्रसिद्ध टेबलटॉप गेम Dungeons & Dragons पर आधारित एक डिजिटल सिम्युलेटर बनाया, लेकिन उन्होंने इससे कहानी कहने और मानव रेफरी को हटा दिया। इसके बजाय, उन्होंने युद्ध का एक सख्त, गणितीय संस्करण बनाया जहाँ हर चाल, मंत्र और राक्षस की क्षमता एक हार्ड-कोडेड नियम है। उन्होंने AI से केवल एक लड़ाई जीतने के लिए नहीं कहा; उन्होंने इसे एक पूरे "एडवेंचरिंग डे" (साहसिक दिन) में जीवित रहने के लिए कहा जो कई लड़ाइयों से भरा हो, जहाँ पहली लड़ाई में बहुत अधिक जादू का उपयोग करने से टीम अंतिम लड़ाई में असहाय हो सकती है।

यह पेपर आज के सबसे स्मार्ट AI मॉडलों (जैसे GPT-5.5 और Gemini 3.1 Pro) का परीक्षण करता है ताकि यह देखा जा सके कि क्या वे एक अनुभवी डंजन मास्टर की तरह कार्य कर सकते हैं। सेटअप निष्पक्ष है: AI पूरे युद्धक्षेत्र को देखता है, सभी नियमों को जानता है, और उसके पास चुनने के लिए वैध चालों की एक सूची है। कार्य सैकड़ों विकल्पों में से सबसे अच्छा विकल्प चुनना है, जिसमें यह विचार करना शामिल है कि "यदि मैं यहाँ यह फायरबॉल चलाता हूँ, तो क्या यह बॉस को तो मारेगा ही, लेकिन साथ ही मेरे दोस्त को भी जला देगा?" या "क्या मुझे अपनी हीलिंग पोशन अभी बचाकर रखनी चाहिए, या इसका उपयोग इस लड़ाई को जल्दी खत्म करने के लिए करना चाहिए?"

परिणाम प्रभावशाली कौशल और मजेदार विफलताओं का मिश्रण हैं। जब AI का सामना केवल एक लड़ाई से हुआ ("Encounter" ट्रैक), तो शीर्ष मॉडल काफी अच्छे थे, जो लगभग 82% से 83% बार जीते। वे खुद को अच्छी स्थिति में रखने और अपने मंत्रों का प्रभावी ढंग से उपयोग करने में स्मार्ट थे। हालाँकि, जब शोधकर्ताओं ने उन लड़ाइयों को एक पूरे दिन ("Day" track) में जोड़ दिया, तो AI का प्रदर्शन गिर गया। इस कठिन मोड में, सर्वश्रेष्ठ मॉडल केवल 40% दिन सफलतापूर्वक पार कर पाए, और एक मॉडल एक भी दिन पार करने में विफल रहा।

वे क्यों विफल हुए? पेपर सुझाव देता है कि जबकि ये AI "वर्तमान क्षण" के लिए बहुत अच्छे हैं, उन्हें संसाधन बजट (resource budgeting) के साथ संघर्ष करना पड़ता है। वे पहली आसान लड़ाई जीतने के लिए अपने सबसे अच्छे मंत्रों और स्वास्थ्य पोशन (health potions) का उपयोग करने लगते हैं, जिससे दिन के अंत में कठिन बॉस के लिए उनके पास खाली हाथ और कम स्वास्थ्य बच जाता है। वे लड़ाई जीत जाते हैं लेकिन युद्ध हार जाते हैं। शोधकर्ताओं ने पाया कि भले ही AI भविष्य के पूरे शेड्यूल को देख सकता था, लेकिन वह अपनी शक्ति बचाने का तरीका नहीं निकाल सका।

संक्षेप में, DungeonBench दिखाता है कि वर्तमान AI नियम पालन करने और स्थानीय निर्णय लेने में बहुत अच्छा हो रहा है, लेकिन इसने अभी तक दीर्घकालिक रणनीति की कला को पूरी तरह से नहीं सीखा है। यह एक ऐसे शतरंज खिलाड़ी की तरह है जो प्रतिद्वंद्वी को चकमा देकर एक एकल खेल जीत सकता है, लेकिन जो टूर्नामेंट खत्म होने से पहले ही अपने मोहरे खत्म करता रहता है। पेपर निष्कर्ष निकालता है कि हालांकि हम प्रगति कर रहे हैं, लेकिन AI के वास्तव में एक सामरिक जीनियस की तरह सोचने से पहले अभी एक लंबा रास्ता तय करना बाकी है, जो यह जानता है कि कब पीछे हटना है और कब प्रहार करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →