← أحدث الأبحاث
💻 computer science

Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX

تقدم هذه الورقة Mahjax، وهي بيئة ريشي ماهجونج (Riichi Mahjong) مُتجهة بالكامل ومعززة بوحدة معالجة الرسومات ومبنية بلغة JAX، تتيح التعلم المعزز واسع النطاق بمعدلات إنتاجية تصل إلى مليوني خطوة في الثانية، مما يسهل تدريب الوكلاء من الصفر دون الاعتماد على سجلات اللعب البشري.

المؤلفون الأصليون: Soichiro Nishimori, Shinri Okano, Keigo Habara, Sotetsu Koyamada, Eason Yu, Masashi Sugiyama

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Soichiro Nishimori, Shinri Okano, Keigo Habara, Sotetsu Koyamada, Eason Yu, Masashi Sugiyama

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم كمبيوتر كيف يلعب لعبة الماجونج (Mahjong)، وهي لعبة بلاطات معقدة تلعب فيها الحظ دوراً كبيراً ولا يمكنك رؤية بطاقات الجميع. لكي يصبح الكمبيوتر بارعاً حقاً، يحتاج إلى التدرب ملايين المرات، وتجربة حركات مختلفة والتعلم من أخطائه. هذا ما يسمى "التعلم التعزيزي" (Reinforcement Learning).

المشكلة هي أن الماجونج تشبه تقاطع طرق مزدحماً وفوضوياً. إذا حاولت محاكاة هذه اللعبة على معالج كمبيوتر قياسي (وهو "دماغ" الكمبيوتر العادي)، فستتحرك ببطء شديد. الأمر يشبه محاولة فك اختناق ذلك التقاطع سيارة تلو الأخرى؛ فبحلول الوقت الذي يتعلم فيه الكمبيوتر أي شيء، سيستغرق الأمر سنوات.

إليك "ماهاجاكس" (Mahjax).

قام مؤلفو هذه الورقة البحثية ببناء محاكي جديد فائق السرعة يسمى Mahjax. فكر في Mahjax كعملية ترقية من طريق ذي مسار واحد إلى طريق سريع ضخم مكون من 100 مسار يعمل على وحدة معالجة الرسومات (GPU) — وهي نفس الشريحة القوية الموجودة في أجهزة الكمبيوتر المخصصة للألعاب المتطورة.

إليك تفصيل لما فعلوه ولماذا يهم ذلك، باستخدام تشبيهات بسيطة:

1. تشبيه "المصنع" (المتجهات - Vectorization)

كانت المحاكيات القديمة تشبه عاملاً واحداً يقوم بتجميع لعبة واحدة في كل مرة. إذا كنت تريد تدريب ذكاء اصطناعي، كان عليك الانتظار حتى ينتهي ذلك العامل الواحد قبل البدء في التالي.

أما Mahjax فهو يشبه مصنعاً ضخماً يحتوي على آلاف الأذرع الروبوتية التي تعمل بتناغم تام. نظرًا لأنه مبني باستخدام أداة تسمى JAX، فإنه يستطيع تشغيل آلاف ألعاب الماجونج في وقت واحد على وحدة معالجة رسومات واحدة. فبدلاً من لعب مباراة واحدة، هو يلعب 1,000 مباراة في نفس الوقت، ثم 10,000، ثم 100,000. وهذا ما يسمى "المتجهات" (Vectorization).

2. الرقم القياسي للسرعة

اختبرت الورقة البحثية هذا "المصنع" الجديد على ثماني وحدات معالجة رسومات NVIDIA A100 قوية (والتي تشبه امتلاك ثمانية حواسيب فائقة تعمل معاً).

  • النتيجة: يمكن لـ Mahjax محاكاة مليوني خطوة لعبة في الثانية (لنسخة أبسط من القواعد) و مليون خطوة في الثانية (للنسخة القياسية التي تحتوي على بلاطات "حمراء").
  • المقارنة: هذا أسرع بأكثر من 10 مرات من أفضل المحاكيات السابقة التي كانت تعمل على وحدات المعالجة المركزية (CPUs) القياسية. إنه الفرق بين زحف الحلزون وانطلاق القطار الرصاصة.

3. التعلم من الصفر (اللوح الفارغ - Tabula Rasa)

العديد من أنظمة الذكاء الاصطناعي الحالية للماجونج تشبه الطلاب الذين يتعلمون فقط عن طريق حفظ الكتب المدرسية التي كتبها خبراء بشريون (باستخدام "التعلم الخاضع للإشراف"). فهم ينظرون إلى سجلات كيفية لعب البشر ويحاولون تقليدهم.

يريد المؤلفون معرفة ما إذا كان بإمكان الذكاء الاصطناعي التعلم من الصفر (مثل طفل يتعلم المشي)، دون النظر إلى سجلات البشر أولاً. هذا هو أسلوب تعلم "AlphaZero". وللقيام بذلك، يحتاج الذكاء الاصطناعي إلى لعب مليارات الألعاب بسرعة كبيرة ليفهم أفضل الحركات بمفرده. يوفر Mahjax السرعة اللازمة لجعل هذا النوع من "التعلم من الصفر" ممكناً.

4. "المصحح" (التصور المرئي - Visualization)

تعلم لعبة جديدة أمر صعب، وتصحيح أخطاء برنامج كمبيوتر يلعبها أمر أكثر صعوبة. أدرج المؤلفون أداة خاصة تسم تتيح لك مشاهدة اللعبة وهي تتكشف على الشاشة، مثل بث تلفزيوني.

  • تقوم الأداة بترجمة رموز بلاطات الماجونج اليابانية المعقدة إلى كلمات إنجليزية.
  • تساعد الباحثين على رؤية ما يفعله الذكاء الاصطناعي بالضبط، حتى يتمكنوا من إصلاح الأخطاء أو فهم سبب اتخاذ الذكاء الاصطناعي لحركة غريبة.

5. هل نجح الأمر؟

اختبر الفريق النظام عن طريق تدريب وكيل ذكاء اصطناعي باستخدام خوارزمية تعلم قياسية (PPO).

  • بدأوا بالذكاء الاصطناعي باستراتيجية "تقليد" أساسية (Behavioral Cloning) للبدم.
  • ثم تركوه يلعب ضد نفسه باستخدام محاكي Mahjax الجديد.
  • النتيجة: أصبح الذكاء الاصطناعي أفضل بشكل ملحوظ في اللعبة، حيث تحسن تصنيفه مقابل الخصوم المرجعيين. وهذا يثبت أن Mahjax مستقر وسريع بما يكفي لتدريب وكلاء ذكاء اصطناعي رفيعي المستوى بالفعل.

الملخص

باختصار، تقدم هذه الورقة البحثية Mahjax، وهي أداة تحول عملية محاكاة الماجونج البطيئة أحادية المسار إلى عملية متوازية فائقة السرعة. إنه يعمل كمحرك ضخم يسمح للباحثين بتدريب وكلاء الذكاء الاصطناعي لإتقان الماجونج من الصفر، بدلاً من مجرد تقليد البشر، وذلك عبر معالجة ملايين السيناريوهات اللعبية في الوقت الذي كان يستغرقه معالجة بضعة آلاف فقط سابقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →