← أحدث الأبحاث
🤖 AI

Impartial Games: A Challenge for Reinforcement Learning

تُثبت هذه الورقة أن خوارزميات التعلم التعزيزي من نمط "ألفا زيرو" (AlphaZero) تفشل في تحقيق إتقان بمستوى الخبراء في الألعاب المحايدة مثل لعبة "نيم" (Nim) بسبب وجود عقبة تمثيلية جوهرية في تعلم المبادئ الرياضية المجردة، مما يكشف أن الضبط البسيط للمعلمات الفائقة لا يمكنه التغلب على عدم قدرتها على التعميم لما وراء الحالات المحفوظة.

المؤلفون الأصليون: Bei Zhou, Søren Riis

نُشر 2026-09-09
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Bei Zhou, Søren Riis

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي، اشتهر نوع معين من برامج الكمبيوتر مؤخرًا بقدرته على إتقان ألعاب الاستراتيجية المعقدة. فمن خلال لعب ملايين المباريات ضد نفسها، تتعلم هذه البرامج القيام بنقلات غالبًا ما تفاجئ حتى كبار الخبراء البشر. لقد أصبحت بطلة في ألعاب مثل الشطرنج و"غو" (Go)، حيث يعتمد النجاح على التعرف على الأنماط، وتقييم المواقف، والتخطيط لخطوات عديدة قادمة. والفكرة الكامنة وراء ذلك هي أنه إذا تمكنت الآلة من تعلم الفوز عبر فهم تدفق اللعبة، فقد تتعلم في النهاية حل أي مشكلة معقدة. ومع ذلك، فقد خلق هذا النجاح شعورًا زائفًا بالأمان؛ إذ تبين أن طريقة تعلم هذه الآلات ليست عالمية. فهناك فئة محددة من الألعاب تكون قواعدها بسيطة، وقطعها مشتركة بين كلا اللاعبين، وتعتمد استراتيجية الفوز فيها على منطق رياضي خفي بدلاً من التعرف على الأنماط. وفي هذه الألعاب، تصطدم أكثر أنظمة الذكاء الاصطناعي تطورًا بحائط مسدود، وتفشل في تعلم المبادئ التي تجعل اللعبة قابلة للحل بالنسبة للبشر.

قرر باحثون من "إمبريال كوليدج لندن" وجامعة "كويين ماري" بلندن التحقيق في هذه النقطة العمياء باستخدام لعبة تسمى "نيم" (Nim). "نيم" هي لعبة تُلعب بعدة أكوام من الأشياء، حيث يأخذ لاعبان أدوارًا لإزالة أي عدد من الأشياء من كومة واحدة. والهدف هو أن تكون أنت من يأخذ آخر قطعة. وبينما تبدو اللعبة بسيطة، فإن سر الفوز يكمن في عملية حسابية محددة تتضمن الأعداد الثنائية (binary) لأحجام الأكوام. بالنسبة للإنسان، يعد تعلم هذه القاعدة مسألة فهم مفهوم مجرد واحد. أما بالنسبة للذكاء الاصطناعي، فإن التحدي مختلف. أراد الباحثون معرفة ما إذا كانت نفس خوارزميات التعلم التي غزت الشطرنج يمكنها تعلم الفوز في "نيم"، وإذا لم يكن الأمر كذلك، فما السبب. قاموا ببناء نسخة مخصصة من نظام التعلم الشهير "ألفا زيرو" (AlphaZero) ودربوه على لعب "نيم" على لوحات ذات أحجام متزايدة، مراقبين عن كثب كيف يتطور فهم الكمبيوتر.

كانت النتائج صارخة وكاشفة. فعندما اختبر الباحثون النظام على لوحة "نيم" صغيرة مكونة من خمس أكوام، تعلم الكمبيوتر اللعب بشكل جيد؛ حيث استطاع الفوز باستمرار، متصرفًا كبطل يعرف كيف يبدأ اللعبة ويوجهها نحو النصر. ومع ذلك، بمجرد أن زاد حجم اللوحة إلى ست أو سبع أكوام، انهار أداء النظام. توقف الكمبيوتر عن تعلم كيفية الفوز، وبدلاً من العثور على النقلات الصحيحة، بدأ بالتخمين، مؤديًا أداءً لا يتجاوز الاختيار العشوائي. اكتشف الباحثون أن المشكلة لم تكن في كون اللعبة معقدة للغاية أو أن الكمبيوتر يحتاج إلى مزيد من الوقت للتدريب، بل كانت المشكلة جوهرية في كيفية معالجة "دماغ" الكمبيوتر، وهو نوع من الشبكات العصبية، للمعلومات. فهذه الشبكات ممتازة في رصد الروابط بين الأشياء، مثل إدراك أن ترتيبًا معينًا لقطع الشطرنج يؤدي عادةً إلى الفوز، لكنها تعاني بشدة مع نوع محدد من المنطق يسمى "التكافؤ" (parity)، وهو في الأساس طريقة لعد ما إذا كان الرقم فرديًا أم زوجيًا عبر مجموعة من العناصر. وفي لعبة "نيم"، يعتمد النقل الرابح تمامًا على هذا النوع من منطق العد.

ولفهم سبب أهمية ذلك، قدم الباحثون طريقة جديدة لقياس مهارة الذكاء الاصطناعي؛ حيث ميزوا بين "البطل" و"الخبير". البطل هو لاعب يمكنه الفوز من وضع البداية عبر توجيه اللعبة إلى مناطق مألوفة يعرف ما يجب فعله فيها. أما الخبير، فهو من يستطيع القيام بالنقلة المثالية من أي وضع على اللوحة، حتى المواقف التي لم يرها من قبل. أظهرت الدراسة أن الذكاء الاصطناعي يمكن أن يصبح بطلاً في اللوحات الصغيرة عبر حفظ نقلات البداية الصحيحة، لكنه فشل في أن يصبح خبيرًا. فعندما تنتقل اللعبة إلى مراحل المنتصف أو النهاية، أو عندما تصبح اللوحة أكبر، لا يستطيع الكمبيوتر تحديد النقلة الصحيحة. أصبح دليله الداخلي، الذي يُفترض به أن يخبره أي النقلات جيدة، مرتبكًا؛ حيث كان يمنح احتمالية عالية لنقلة خاسرة ويتجاهل النقلة الرابحة. وحتى عندما أجرى الكمبيوتر ملايين عمليات المحاكاة للتحقق من خياراته، لم يستطع تصحيح خطئه الأولي لأن تخمينه الأولي كان بعيدًا جدًا عن الصواب.

اختبر الباحثون ما إذا كان هذا الفشل يعود إلى طريقة التعلم نفسها أم إلى صعوبة منطق اللعبة. فقاموا بإنشاء نسخة معدلة من اللعبة حيث يتحكم اللاعبان في أكوام مختلفة ولا يحتاجان إلى استخدام منطق "التكافؤ" للفوز. في هذه النسخة المعدلة، تعلم نفس الذكاء الاصطناعي بسرعة وسهولة، مما أثبت أن نظام التعلم نفسه كان قادرًا. وأكد هذا أن المشكلة لم تكن في عملية التدريب، بل في النوع المحدد من الرياضيات المطلوبة للعبة الأصلية. ببساطة، لم يستطع الكمبيوتر تعلم القاعدة المجردة للتكافؤ من البيانات التي أنتجها من خلال اللعب ضد نفسه؛ إذ جعلت "الضوضاء" في البيانات، الناتجة عن ارتكاب الكمبيوتر للأخطاء خلال مرحلة التعلم المبكرة، من المستحيل على الشبكة استيعاب النمط الأساسي.

يتحدى هذا الاكتشاف الفكرة القائلة بأن الذكاء الاصطناعي الحالي يمكنه حل أي مشكلة إذا توفرت له كمية كافية من البيانات وقوة الحوسبة. فهو يشير إلى أن هناك أنواعًا معينة من الاستدلال المنطقي لا تستطيع هذه الأنظمة تعلمها بمفردها. ويقترح الباحثون أنه لكي يتقن الذكاء الاصطناعي حقًا ألعابًا مثل "نيم"، وربما غيرها من المشكلات المعقدة التي تعتمد على الرياضيات المجردة، يجب بناء الذكاء الاصطناعي المستقبلي بشكل مختلف. إنهم يقترحون دمج قوة مطابقة الأنماط الموجودة في الأنظمة الحالية مع وحدة استدلال رمزي منفصلة يمكنها التعامل مع هذه القواعد المنطقية المحددة. وإلى أن يتم إجراء مثل هذا التغيير، ستظل هذه الأنظمة التعليمية القوية "أبطالاً" في بعض المجالات، لكنها ستظل "عمياء" عن المنطق الأساسي في مجالات أخرى، وغير قادرة على الوصول إلى مستوى الخبرة الحقيقية التي يمكن للإنسان تحقيقها بلمحة ذهنية واحدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →