← أحدث الأبحاث
💬 NLP

CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models

تقدم هذه الورقة CommonWhy، وهي مجموعة بيانات تضم 15,000 سؤال من نوع "لماذا" القائم على الكيانات، والتي تُقيّم قدرات النماذج اللغوية الكبيرة في الاستنتاج السببي للمنطق العام والقدرة على التفسير الاستنباطي، مما يكشف عن قصور كبير في النماذج الحالية رغم توفر المعرفة الداعمة في Wikidata.

المؤلفون الأصليون: Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

نُشر 2026-05-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً ومطلعاً، وقد سألته آلاف الأسئلة مثل: "هل صحيح أن هاري بوتر يمكنه الطيران؟" أو "هل كان أرسطو يمتلك حاسوباً محمولاً؟". لقد أصبح الروبوت بارعاً جداً في الإجابة على هذه الأسئلة التي تتطلب "نعم" أو "لا" لأنه يستطيع مسح مكتبته الضخمة من الحقائق وإيجاد الإجابة.

ولكن الآن، تخيل أنك سألته سؤالاً أكثر صعوبة بكثير: "لماذا لم تكن كاتارينا بارلي بحاجة إلى تأشيرة لمشاهدة نهائي دوري أبطال أوروبا لعام 2024؟"

هنا يبدأ الروبوت في التعثر. وهذا هو المشكل الذي تحاول ورقة CommonWhy حله.

المشكلة: الروبوت لا يستطيع "ربط النقاط"

يجادل المؤلفون بأنه بينما تتفوق الروبوتات في استرجاع الحقائق (إيجاد حقيقة محددة في كتاب)، إلا أنها سيئة جداً في الاستدلال السببي (معرفة لماذا حدث شيء ما من خلال ربط حقائق مختلفة بالمنطق السليم).

فكر في الأمر كالتالي:

  • استرجاع الحقائق يشبه البحث عن رقم هاتف في دليل الهاتف.
  • الاستدلال السببي يشبه كونك محققاً. عليك أن تنظر إلى رقم الهاتف، وتدرك أن الشخص يعيش في دولة أخرى، وتتذكر أن تلك الدولة لديها اتفاقية دخول بدون تأشيرة مع بلد الشخص الأم، ثم تستنتج: "آه، لهذا السبب لم تكن بحاجة إلى تأشيرة!".

غالباً ما تفشل الروبوتات الحالية في هذا العمل التحقيقي. قد تخمن الإجابة، أو تخترع حقائق (هلوسات)، أو ببساطة تتعثر لأن الإجابة ليست مكتوبة في جملة واحدة في بيانات تدريبها.

الحل: "امتحان محقق" جديد

قام الباحثون بإنشاء مجموعة بيانات جديدة تسمى CommonWhy. فكر في هذا كـ "امتحان محقق" ضخم مكون من 15,000 سؤال، مصمم خصيصاً لاختبار مدى قدرة هذه الروبوتات على اكتشاف لماذا تحدث الأشياء.

إليك كيف بنوا هذا الامتحان:

  1. القواعد (المسلمات): أولاً، أعطوا الذكاء الاصطناعي بعض القواعد الأساسية للعالم، مثل "إذا كنت مواطناً في الدولة (أ)، وكانت الدولة (ب) تسمح لمواطني الدولة (أ) بالزيارة بدون تأشيرة، فإنك لن تحتاج إلى تأشيرة".
  2. الشخصيات (الكيانات): أخذوا أشخاصاً وأماكن وأحداثاً حقيقية من قاعدة بيانات ضخمة تسمى Wikidata (مثل ويكيبيديا للبيانات المهيكلة).
  3. الأسئلة: مزجوا القواعد مع الشخصيات لإنشاء أسئلة. على سبيل المثال: "لماذا لم يحتج الشخص (س) إلى تأشيرة للذهاب إلى الحدث (ص)؟"
  4. الإجابات: من الضروري ملاحظة أنهم لم يبحثوا عن إجابة واحدة صحيحة فقط. في العالم الحقيقي، غالباً ما تكون هناك أسباب متعددة. ربما لم يحتج الشخص (س) إلى تأشيرة لأنه مواطن في الدولة المضيفة، أو ربما لأنه دبلوماسي. تتضمن مجموعة البيانات كل هذه الاحتمالات الصالحة.

النتائج: الروبوتات رسبت في الامتحان

اختبر الباحثون أذكى نماذج الذكاء الاصطنا-عي المتاحة اليوم (بما في ذلك أحدث نماذج "الاستدلال") في هذا الامتحان. كانت النتائج مفاجئة ومثيرة للقلق نوعاً ما:

  • تعثروا: حتى أفضل النماذج لم تحصل إلا على حوالي 68% من الإجابات الصحيحة. إنها درجة رسوب لنظام نتوقع منه أن يكون فائق الذكاء.
  • اخترعوا أشياء: عندما كانت النماذج تصل إلى الإجابة الصحيحة، فإنها غالباً ما تضمن حقائق مزيفة للوصول إليها. يشبه الأمر طالباً يحصل على الإجابة الرياضية الصحيحة ولكنه يستخدم معادلة مختلقة للقيام بذلك.
  • مشكلة "الذيل الطويل": كان أداء الروبوتات أسوأ بكما عندما تضمنت الأسئلة أشخاصاً أو أماكن أقل شهرة أو غامضة ("الذيل الطويل"). بدا وكأنهم يعتمدون على حفظ الحقائق الشهيرة بدلاً من التفكير المنطقي من خلالها.
  • الأدوات القديمة لا تعمل: حاولوا استخدام أدوات قياسية مصممة لأسئلة قواعد البيانات (KGQA)، لكن تلك الأدوات فشلت فشلاً ذريعاً. فهي مصممة لإيجاد الحقائق، وليس لشرح لماذا تحدث الأشياء.

الصورة الكبيرة

تخلص الورقة إلى أن لدينا تحدياً جديداً وصعباً للغاية أمام الذكاء الاصطناعي. لا يمكننا الاكتفاء بمطالبة الروبوتات بحفظ الحقائق أو الإجابة على أسئلة بسيطة مثل "صواب/خطأ". إذا أردنا منهم التفاعل مع العالم الحقيقي بفعالية، فنحن بحاجة إلى تعليمهم كيف يكونون محققين — كيف يجمعون بين الحقائق الصلبة والمنطق السليم لشرح لماذا يعمل العالم بالطريقة التي يعمل بها.

CommonWhy هي أول أداة نملكها لقياس ما إذا كانت الروبوتات تصبح بالفعل أفضل في هذا النوع من التفكير، أم أنها مجرد تتحسن في التخمين. في الوقت الحالي، تقول الورقة إنهم في الغالب يقومون بالتخمين فقط.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →