← أحدث الأبحاث
💻 computer science

Evaluating Language Models' Evaluations of Games

تقدم هذه الورقة صياغة ومجموعة بيانات لتقييم قدرة أنظمة الذكاء الاصطناعي على تقييم ألعاب الألواح، كاشفةً أنه في حين تتوافق نماذج الاستنتاج مع الأحكام البشرية بشكل أفضل من النماذج غير الاستنتاجية، فإن ملاءمتها للبيانات البشرية تضعف كلما اقتربت من الأمثلية نظرية اللعبة وتظهر استهلاكاً غير متوقع للموارد.

المؤلفون الأصليون: Katherine M. Collins, Cedegao E. Zhang, Graham Todd, Lance Ying, Mauricio Barba da Costa, Ryan Liu, Prafull Sharma, Adrian Weller, Ionatan Kuperwajs, Lionel Wong, Joshua B. Tenenbaum, Thomas L. Griffi
نُشر 2026-04-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Katherine M. Collins, Cedegao E. Zhang, Graham Todd, Lance Ying, Mauricio Barba da Costa, Ryan Liu, Prafull Sharma, Adrian Weller, Ionatan Kuperwajs, Lionel Wong, Joshua B. Tenenbaum, Thomas L. Griffiths

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك في حفلة حيث يحاول الجميع حل لغز ضخم ومعقد. عادةً، عندما نختبر الذكاء الاصطناعي، نسأل الذكاء الاصطناوي: "هل يمكنك حل هذا اللغز؟" ونرى مدى سرعته أو دقته في إيجاد الإجابة.

لكن هذه الورقة البحثية تسأل سؤالاً مختلفاً وأكثر دقة: "هل يمكن للذكاء الاصطناعي أن ينظر إلى اللغز ويخبرنا ما إذا كان يستحق الحل أصلاً؟"

أراد الباحثون معرفة ما إذا كانت نماذج الذكاء الاصطناعي يمكن أن تعمل كناقد للألعاب أو كحكم، بدلاً من مجرد لاعب. لقد اختبروا ذلك من خلال إعطاء الذكاء الاصطناعي 121 لعبة لوحية جديدة تماماً (ألعاب لم يسبق للذكاء الاصطناعي رؤيتها من قبل) وسؤاله عن سؤالين محددين حول كل لعبة:

  1. سؤال "العدالة": إذا لعب شخصان بشكل مثالي، فمن سيفوز؟ هل اللعبة متوازنة، أم أن أحد اللاعبين محكوم عليه بالفشل منذ البداية؟
  2. سؤال "المتعة": هل سيستمتع الناس حقاً بلعب هذه اللعبة؟

إليك ما وجدوه، مقسماً إلى مفاهيم بسيطة:

1. "الذكي" مقابل "البشري"

قارن الباحثون بين ثلاثة أنواع من "المفكرين":

  • المخمن الفوري: نماذج الذكاء الاصطناعي القياسية التي تطلق إجابة فوراً.
  • المفكر العميق: نماذج الذكاء الاصطناعي الأحدث التي تأخذ وقتاً لـ "التفكير" (باستخدام سلسلة من الأفكار) قبل الإجابة.
  • الإنسان: أشخاص حقيقيون نظروا إلى قواعد اللعبة وأعطوا شعورهم الداخلي.

النتيجة: كانت "المخمنات الفورية" سيئة للغاية. بدت واثقة من نفسها لكنها كانت غالباً مخطئة تماماً، والسبب الرئيسي هو أنها كانت تخمن بناءً على الأنماط التي رأتها في بيانات تدريبها بدلاً من تحليل القواعد الجديدة فعلياً.

أما "المفكرون العميقون" فكانوا أفضل بكثير. لقد نظروا بالفعل في القواعد، وحاكوا اللعبة في "عقولهم"، وأعطوا إجابات كانت أقرب إلى ما فكر فيه البشر. ومع ذلك، لم يكونوا مثاليين.

2. مشكلة "غولديلوكس" (أن تكون ذكياً جداً هو أمر سيء)

إليك الاكتشاف الأكثر إثارة للدهشة. وجد الباحثون علاقة غير خطية غريبة بين مدى "ذكاء" الذكاء الاصطناعي ومدى اتفاقه مع البشر.

  • غبي جداً: يخمن الذكاء الاصطناعي عشوائياً ويختلف مع البشر.
  • مثالي (في المنتصف): يفكر الذكاء الاصطناعي بعمق ويتفق مع البشر.
  • مثالي جداً: عندما يصبح الذكاء الاصطناعي بارعاً للغاية في حساب النتيجة الرياضية المثالية (مثل محرك شطرنج فائق القدرة)، يبدأ في الاختلاف مع البشر مرة أخرى.

التشبيه: تخيل لعبة "حجر، ورقة، مقص".

  • الإنسان يفكر: "سأختار الحجر لأنني أشعر بالحظ".
  • ذكاء اصطناعي "في المنتصف" يفكر: "البشر غالباً ما يختارون الحجر، لذا يجب أن أختار الورقة".
  • ذكاء اصطناعي "مثالي جداً" يفكر: "إحصائياً، الحركة المثلى هي الورقة، لذا سأختار الورقة".

وجدت الورقة البحثية أنه عندما يصبح الذكاء الاصطناعي مهووساً جداً بأن يكون مثالياً من الناحية الرياضية، فإنه يتوقف عن فهم ما قد يفعله أو يشعر به الإنسان. يصبح عقلانياً للغاية لدرجة أنه يفقد "اللمسة البشرية".

3. عامل "المتعة" يصعب قياسه

عندما سُئل الذكاء الاصطناعي عن "العدالة" (الرياضيات)، كانت النتائج متسقة. ولكن عندما سُئل عن "المتعة"، كانت النتائج مشتتة للغاية.

التشبيه: سؤال الذكاء الاصطناعي عن "العدالة" يشبه طلب قياس طول طاولة باستخدام مسطرة؛ هناك إجابة واضحة. أما سؤال الذكاء الاصطناعي عن "المتعة" فهو يشبه طلب قياس "السعادة" في أغنية؛ الأمر ذاتي وفوضوي.

وجدت الورقة البحثية أن نماذج الذكاء الاصطناعي المختلفة لديها أفكار مختلفة جداً حول ما يجعل اللعبة ممتعة. بعضها اعتقد أن اللعبة القصيرة ممتعة، والبعض الآخر اعتقد أن اللعبة الطويلة والاستراتيجية ممتعة. ولأن "المتعة" يصعب تعريفها، كانت نماذج الذكاء الاصطناعي غير متسقة، وفي بعض الأحيان حتى أكثر النماذج تقدماً لم تستطع الاتفاق فيما بينها، ناهيك عن الاتفاق مع البشر.

4. مشكلة "مشروب الطاقة"

أخيراً، نظر الباحثون في مقدار "قوة الدماغ" (موارد الحوسبة) التي استخدمها الذكاء الاصطناعي للإجابة على هذه الأسئلة.

التشبيه: تخيل أنك طُلب منك تقرير ما إذا كانت وصفة طعام جديدة جيدة أم لا.

  • أحياناً تكتفي بإلقاء نظرة سريعة على قائمة المكونات (جهد منخفض).
  • وأحياناً تقرأ الوصفة بأكملها، وتتخيل المذاق، وتتحقق من وقت الطهي (جهد عالٍ).

وجدت الورقة البحثية أن نماذج الذكاء الاصطناعي كانت غير متوقعة للغاية. فأحياناً استخدمت قدراً ضئيلاً من الجهد للحكم على لعبة معقدة، وأحياناً أخرى استخدمت قدراً هائلاً من الجهد للحكم على لعبة بسيطة. لم يبدُ أن لديها حساً جيداً بـ "متى تتوقف عن التفكير". لم تكن تعرف كيف تكون "عقلانية في استخدام الموارد"؛ لم تكن تعرف متى توفر طاقتها.

الملخص

تشير هذه الورقة البحثية إلى أنه لكي يكون الذكاء الاصطناعي شريكاً حقيقياً للبشر، فإنه يحتاج إلى فعل أكثر من مجرد حل المشكلات. يحتاج إلى أن يكون قادراً على تقييم المشكلات.

  • الذكاء الاصطناعي القياسي يشبه الآلة الحاسبة: سريع في الرياضيات، لكنه سيء في فهم "الأجواء".
  • ذكاء الاستنتاج (Reasoning AI) أفضل: يمكنه التفكير في القواعد والاقتراب من الآراء البشرية.
  • العقبة: إذا أصبح الذكاء الاصطناعي مركزاً للغاية على أن يكون مثالياً رياضياً، فإنه يتوقف عن كونه بشرياً. وعندما يتعلق الأمر بالأمور الذاتية مثل "المتعة"، فإن حتى أكثر أجهزة الذكاء الاصطناعي ذكاءً تعاني في الاتفاق على ما يجعل اللعبة ممتعة.

يخلص المؤلفون إلى أننا بحاجة إلى تعليم الذكاء الاصطناعي ليس فقط كيفية الحل، بل كيفية اتخاذ القرار بشأن ما إذا كان الشيء يستحق الحل، وكيف يستخدم قوة دماغه بكفاءة دون الإفراط في التفكير أو التقصير فيه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →