← नवीनतम पेपर
💻 computer science

Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX

यह शोध पत्र Mahjax को प्रस्तुत करता है, जो JAX में निर्मित एक पूर्णतः वेक्टरकृत (fully vectorized), GPU-त्वरितित (GPU-accelerated) रीची माजों (Riichi Mahjong) वातावरण है जो प्रति सेकंड 2 मिलियन स्टेप्स तक के थ्रूपुट के साथ बड़े पैमाने पर सुदृढीकरण शिक्षण (reinforcement learning) को सक्षम बनाता है, जिससे मानव खेल लॉग्स पर निर्भरता के बिना एजेंटों को शून्य से प्रशिक्षित करना सुलभ होता है।

मूल लेखक: Soichiro Nishimori, Shinri Okano, Keigo Habara, Sotetsu Koyamada, Eason Yu, Masashi Sugiyama

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Soichiro Nishimori, Shinri Okano, Keigo Habara, Sotetsu Koyamada, Eason Yu, Masashi Sugiyama

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को महाजों (Mahjong) खेलना सिखाना चाहते हैं, जो एक बहुत ही जटिल टाइल गेम है जिसमें भाग्य की बड़ी भूमिका होती है और आप सभी के कार्ड नहीं देख सकते। इसमें वास्तव में कुशल होने के लिए, कंप्यूटर को लाखों बार अभ्यास करने की आवश्यकता होगी, जिसमें वह अलग-अलग चालें आजमाएगा और अपनी गलतियों से सीखेगा। इसे "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) कहा जाता है।

समस्या यह है कि महाजों एक विशाल, अराजक ट्रैफिक जंक्शन की तरह है। यदि आप इसे एक मानक कंप्यूटर प्रोसेसर ("सामान्य कंप्यूटर का मस्तिष्क") पर चलाने की कोशिश करते हैं, तो यह बहुत धीमा चलता है। यह उस ट्रैफिक जंक्शन को एक बार में एक कार करके क्लियर करने की कोशिश करने जैसा है। जब तक कंप्यूटर कुछ सीख पाएगा, तब तक वर्षों बीत जाएंगे।

पेश है, Mahjax।

लेखकों ने एक नया, सुपर-फास्ट सिम्युलेटर बनाया है जिसे Mahjax कहा जाता है। Mahjax को एक साधारण सड़क से बदलकर एक विशाल, 100-लेन वाले सुपरहाइवे में अपग्रेड करने के बारे में सोचें जो एक ग्राफिक्स प्रोसेसिंग यूनिट (GPU) पर चलता है—वही शक्तिशाली चिप जो हाई-एंड वीडियो गेम कंप्यूटरों में पाई जाती है।

यहाँ उन्होंने क्या किया और यह क्यों महत्वपूर्ण है, इसका विवरण सरल उपमाओं (analogies) के माध्यम से दिया गया है:

1. "फैक्ट्री" की उपमा (वेक्टराइजेशन - Vectorization)

पुराने सिम्युलेटर एक अकेले कर्मचारी की तरह थे जो एक समय में एक खिलौना असेंबल करता था। यदि आप एक AI को प्रशिक्षित करना चाहते थे, तो आपको अगले को शुरू करने से पहले उस एक कर्मचारी के पूरा होने का इंतजार करना पड़ता था।

Mahjax एक विशाल फैक्ट्री की तरह है जिसमें हजारों रोबोटिक भुजाएं पूर्ण तालमेल में काम कर रही हैं। क्योंकि यह JAX नामक एक टूल का उपयोग करके बनाया गया है, यह एक ही GPU पर एक साथ हजारों महाजों गेम चला सकता है। एक गेम खेलने के बजाय, यह एक ही समय में 1,000 गेम, फिर 10,000, और फिर 100,000 गेम खेलता है। इसे "वेक्टराइजेशन" कहा जाता है।

2. स्पीड रिकॉर्ड

लेखकों ने इस नए "फैक्ट्री" का परीक्षण आठ शक्तिशाली NVIDIA A100 GPU पर किया (जो आठ सुपर-कंप्यूटरों के एक साथ काम करने जैसा है)।

  • परिणाम: Mahjax प्रति सेकंड 2 मिलियन गेम स्टेप्स (सरल नियमों के संस्करण के लिए) और 1 मिलियन स्टेप्स प्रति सेकंड (लाल टाइल्स वाले मानक संस्करण के लिए) को सिम्युलेट कर सकता है।
  • तुलना: यह पिछले सर्वश्रेष्ठ सिम्युलेटरों की तुलना में 10 गुना से अधिक तेज़ है जो मानक CPU पर चलते थे। यह एक घोंघे के रेंगने और एक बुलेट ट्रेन के तेजी से दौड़ने के बीच का अंतर है।

3. शून्य से सीखना (Tabula Rasa)

वर्तमान के कई महाजों AI उन छात्रों की तरह हैं जो केवल मानव विशेषज्ञों द्वारा लिखी गई पाठ्यपुस्तकों को याद करके सीखते हैं (सुपरवाइज्ड लर्निंग का उपयोग करके)। वे मानव लॉग देखते हैं कि इंसानों ने कैसे खेला और उनकी नकल करने की कोशिश करते हैं।

लेखक यह देखना चाहते हैं कि क्या एक AI शून्य से सीख सकता है (जैसे एक बच्चा चलना सीखता है), बिना पहले मानव लॉग देखे। यह "अल्फाजीरो" (AlphaZero) शैली की लर्निंग है। इसे करने के लिए, AI को अपने आप सबसे अच्छी चालें समझने के लिए बहुत तेजी से अरबों गेम खेलने की आवश्यकता है। Mahjax इस "शून्य से सीखने" को संभव बनाने के लिए आवश्यक गति प्रदान करता है।

4. "डीबगर" (विजुअलाइजेशन - Visualization)

नया खेल सीखना कठिन है, और एक कंप्यूटर प्रोग्राम को डीबग करना जो इसे खेल रहा है, और भी कठिन है। लेखकों ने एक विशेष टूल शामिल किया है जो आपको टीवी ब्रॉडकास्ट की तरह स्क्रीन पर गेम को चलते हुए देखने की अनुमति देता है।

  • यह जटिल जापानी टाइल प्रतीकों को अंग्रेजी शब्दों में अनुवादित करता है।
  • यह शोधकर्ताओं को यह देखने में मदद करता है कि AI वास्तव में क्या कर रहा है, ताकि वे बग्स को ठीक कर सकें या समझ सकें कि AI ने अजीब चाल क्यों चली।

5. क्या यह काम कर गया?

टीम ने एक मानक लर्निंग एल्गोरिदम (PPO) का उपयोग करके एक AI एजेंट को प्रशिक्षित करके सिस्टम का परीक्षण किया।

  • उन्होंने AI को एक बुनियादी "नकल करने वाली" रणनीति (Behavioral Cloning) के साथ शुरू किया ताकि उसे शुरुआत मिल सके।
  • फिर, उन्होंने इसे नए Mahjax सिम्युलेटर का उपयोग करके अपने आप के खिलाफ खेलने दिया।
  • परिणाम: AI गेम में काफी बेहतर हो गया, जिससे बेसलाइन विरोधियों के मुकाबले उसकी रैंकिंग में सुधार हुआ। यह साबित करता है कि Mahjax स्थिर और तेज़ है, जिससे वास्तव में उच्च-स्तरीय AI एजेंटों को प्रशिक्षित करना संभव है।

सारांश

संक्षेप में, यह पेपर Mahjax को पेश करता है, जो महाजों को सिम्युलेट करने की धीमी, सिंगल-थ्रेडेड प्रक्रिया को एक उच्च-गति, समानांतर प्रक्रिया में बदल देता है। यह एक विशाल इंजन के रूप में कार्य करता है जो शोधकर्ताओं को केवल इंसानों की नकल करने के बजाय, शून्य से महाजों में महारत हासिल करने के लिए AI एजेंटों को प्रशिक्षित करने की अनुमति देता है, जिससे वे कुछ हजार गेम प्रोसेस करने के समय में लाखों गेम परिदृश्यों को प्रोसेस कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →