← नवीनतम पेपर
🤖 machine learning

Monte Carlo Permutation Search

यह शोध पत्र मोंटे कार्लो परम्यूटेशन सर्च (MCPS) को प्रस्तुत करता है, जो एक सामान्य-उद्देश्य वाला MCTS एल्गोरिदम है जो पाथ-वाइड प्लेआउट सांख्यिकी को एक्सप्लोरेशन टर्म में शामिल करके और एक नया वेटिंग फॉर्मूला व्युत्पन्न करके हेक्स (Hex) और गो (Go) जैसे खेलों में GRAVE एल्गोरिदम से बेहतर प्रदर्शन करता है, जिससे GRAVE के बायस हाइपरपैरामीटर की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Tristan Cazenave

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tristan Cazenave

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि गो (Go) या हेक्स (Hex) का खेल, लेकिन आपके पास कोई सुपरकंप्यूटर या प्रशिक्षित AI नहीं है जो आपको सबसे अच्छा कदम बता सके। इसके बजाय, आपको अपने दिमाग में हजारों रैंडम भविष्य के परिदृश्यों को खेलकर "अनुमान लगाने और जांचने" (guessing and checking) पर निर्भर रहना होगा। यह इस तरह काम करता है कि एक कंप्यूटर प्रोग्राम जिसे मोंटे कार्लो ट्री सर्च (MCTS) कहा जाता है।

लंबे समय तक, इस अनुमान लगाने का सबसे अच्छा तरीका GRAVE नामक एक एल्गोरिदम था। यह भविष्य की भविष्यवाणी करने के लिए अतीत को देखने में अच्छा था, लेकिन इस पेपर के लेखक, ट्रिस्टन कैज़नेव (Tristan Cazenave) ने सोचा, "हम इससे बेहतर कर सकते हैं।"

उन्होंने एक नया एल्गोरिदम बनाया जिसे MCPS (मोंटे कार्लो परम्यूटेशन सर्च) कहा जाता है। यह कैसे काम करता है, यहाँ सरल रूप में समझाया गया है:

अतीत को देखने के तीन तरीके

अगला कदम उठाने का निर्णय लेने के लिए, MCPS अपने रैंडम गेम्स (जिन्हें "प्लेआउट्स" कहा जाता है) के इतिहास को तीन अलग-अलग तरीकों से देखता है। इन्हें एक कैमरा लेंस की तरह समझें:

  1. "सटीक पथ" लेंस (मानक दृश्य - Exact Path Lens):
    यह उन खेलों को देखता है जहाँ खिलाड़ी ने वर्तमान स्थान तक पहुँचने के लिए बिल्कुल उसी क्रम में चालें चलीं, और फिर वह विशिष्ट चाल चली जिसका हम परीक्षण कर रहे हैं।
  • उपमा: "मैंने मेन स्ट्रीट पर चलकर, बाएँ मुड़कर, कॉफी खरीदी। वह कैसा रहा?"
  1. "क्रम मायने नहीं रखता" लेंस (GRAVE का अपग्रेड - Order Doesn't Matter Lens):
    यह उन खेलों को देखता है जहाँ खिलाड़ी ने वही चालें चलीं जिनसे वह स्थान प्राप्त हुआ, लेकिन क्रम थोड़ा अलग था, और वह विशिष्ट चाल जिसका हम परीक्षण कर रहे हैं, खेल में बाद में आई।
  • उपमा: "मैंने कॉफी खरीदी, फिर मेन स्ट्रीट पर चला, फिर बाएँ मुड़ा। सामग्री वही है, बस रेसिपी का क्रम अलग है। क्या इसका स्वाद अभी भी अच्छा था?"
  • यह कैसे मदद करता है: कई खेलों में, आपके द्वारा अपनी गोटियाँ रखने का क्रम अंतिम बोर्ड की स्थिति को नहीं बदलता है। इसलिए, यह लेंस कंप्यूटर को केवल उन्हीं खेलों से सीखने की अनुमति देता है जो सटीक क्रम से मेल खाते हैं, न कि केवल उन्हीं से जो बिल्कुल समान हैं।
  1. "परम्यूटेशन" लेंस (MCPS का नया गुप्त मंत्र - Permutation Lens):
    यह नया जुड़ाव है। यह किसी भी ऐसे खेल को देखता है जिसमें खिलाड़ी ने चालों का वही सेट उपयोग किया (वर्तमान स्थान तक का रास्ता + नई चाल), चाहे वे क्रम में कैसे भी रहे हों।
  • उपमा: "मैंने शेल्फ बनाने के लिए एक हथौड़ा, एक पेचकश और एक कील का उपयोग किया। इससे कोई फर्क नहीं पड़ता कि मैंने पहले हथौड़ा चलाया या पहले पेचकश चलाया; यदि मैंने उन तीन उपकरणों का उपयोग किया, तो शेल्फ बन गई। उस संयोजन ने कैसा काम किया?"
  • सावधानी: कुछ खेलों में (जैसे अटा्रिगो/AtariGo), क्रम महत्व रखता है क्योंकि खेल जल्दी समाप्त हो सकता है (जैसे पत्थर को कैप्चर करना)। MCPS इसे स्मार्ट तरीके से हैंडल करता है कि वह इन चालों को कैसे ग्रुप करता है।

"जादुई फॉर्मूला"

पेपर बताता है कि MCHS केवल एक दृश्य को नहीं चुनता है; यह इन तीनों को आपस में मिला देता है। लेखक ने यह पता लगाने के लिए कुछ गणित किया कि इन तीन स्रोतों को मिलाने का सही तरीका क्या है।

इसे एक स्मूदी बनाने की तरह समझें। आपके पास तीन फल हैं (तीन सांख्यिकी/statistics)। GRAVE एक निश्चित रेसिपी का उपयोग करता था जो कभी-कभी खराब लगती थी। MCPS एक गणितीय रूप से सटीक रेसिपी का उपयोग करता है जो स्वचालित रूप से इन तीन फलों की मात्रा को उनके डेटा के आधार पर समायोजित करती है। सबसे अच्छी बात यह है कि इसे सही होने के लिए किसी "टेस्ट टेस्ट" (एक मानव द्वारा बायस पैरामीटर सेट करना) की आवश्यकता नहीं है; गणित इसे स्वचालित रूप से करता है।

वास्तविक दुनिया में इसका प्रदर्शन कैसे रहा

लेखक ने MCPS का परीक्षण पुराने चैंपियन (GRAVE) के खिलाफ पांच अलग-अलग प्रकार के खेलों पर किया:

  • हेक्स (एक आदर्श मिलान - Hex): इस खेल में, चालों का क्रम कभी भी अंतिम बोर्ड को नहीं बदलता है। MCPS यहाँ एक बड़ा विजेता रहा, विशेष रूप से बड़े बोर्डों पर। यह एक ऐसे मानचित्र की तरह था जो हर संभावित पथ दिखाता था, न कि केवल वही पथ जो आपने लिया था।
  • गो (एक गहरा विचारक - Go): छोटे बोर्डों पर, वे लगभग बराबर थे। लेकिन बड़े बोर्डों पर, जैसे-जैसे कंप्यूटर को सोचने के लिए अधिक समय दिया गया, MCPS आगे निकल गया। यह सबसे आशाजनक चालों की गहराई तक जाने के लिए उस अतिरिक्त समय का उपयोग करने में बेहतर था, जबकि पुराना तरीका उथले विकल्पों की खोज में ही फंसा रह जाता था।
  • अटारीगो (एक तेज़ फिनिशर - AtariGo): यह एक ऐसा खेल है जहाँ पहला कैप्चर जीतता है। यहाँ, क्रम महत्व रखता है। आश्चर्यजनक रूप से, MCPS फिर भी जीता, लेकिन इसका लाभ छोटे बोर्डों पर सबसे अधिक था जहाँ खेल जल्दी समाप्त हो जाता है। बड़े बोर्डों पर, खेल बहुत लंबा हो जाता है जिससे "क्रम मायने नहीं रखता" वाला तरीका मदद करने में उतना सक्षम नहीं रह पाता।
  • नोगो (एक सुसंगत विजेता - NoGo): यह एक ऐसा खेल है जहाँ आप तब हार जाते हैं जब आप कैप्चर करते हैं। MCPS लगभग हर जगह जीता, पुराने तरीके को ठोस अंतर से लगातार पीछे छोड़ते हुए।
  • वॉरगेम (एक स्पीड डेमन - Wargame): इस कस्टम रणनीति खेल में, MCPS ने न केवल बेहतर खेला; बल्कि यह तेजी से भी खेला। इसने उन खेलों का अनुकरण किया जो जल्दी समाप्त हुए और जीतने वाली रणनीति को अधिक तेज़ी से खोजा, जिससे यह समान समय में अधिक सिमुलेशन चलाने में सक्षम हुआ।

निष्कर्ष

पेपर का दावा है कि MCPS बिना डीप लर्निंग या भारी ट्रेनिंग के, कंप्यूटर के लिए गेम खेलने का एक स्मार्ट और अधिक कुशल तरीका है।

यह इस तथ्य को पहचानकर काम करता है कि कई खेलों में, आपके द्वारा की जाने वाली चालों का सेट (समूह), इस बात से अधिक महत्वपूर्ण है कि आपने उन्हें किस क्रम में किया। उन चालों के विशिष्ट सेट को गिनकर, जो रैंडम गेम्स में दिखाई दिए, MCPS एक बेहतर "अंतर्ज्ञान" (intuition) बनाता है कि कौन सी चालें अच्छी हैं। यह एक ऐसे जासूस की तरह है जो महसूस करता है कि भले ही संदिग्ध अलग-अलग क्रम में आए हों, लेकिन तथ्य यह है कि वे सभी घटनास्थल पर मौजूद थे, यही असली सुराग है।

परिणामस्वरूप, यह लगभग हर परीक्षण किए गए परिदृश्य में पिछले सर्वोत्तम तरीके को हरा देने वाला एक सामान्य-उद्देश्य वाला टूल है, जो इसे उन स्थितियों में गेम-प्ले AI के लिए एक शक्तिशाली नया मानक बनाता है जहाँ आपके पास सुपरकंप्यूटर उपलब्ध नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →