← أحدث الأبحاث
💬 NLP

Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?

تكشف هذه الدراسة أن صيغة الأسئلة، بما في ذلك عدد الخيارات وصياغة محددة، تؤثر بشكل كبير على أداء النماذج اللغوية الكبيرة في مهام الاستدلال، مما يتسبب غالباً في حدوث انفصال بين دقة خطوات الاستدلال وصحة الإجابة النهائية.

المؤلفون الأصليون: Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك معلم تحاول اختبار مدى ذكاء طالب جديد (ذكاء اصطناعي) في حل الألغاز المنطقية. تريد أن ترى ما إذا كان الطالب يفهم الرياضيات أو المنطق حقاً، أم أنه يكتفي فقط بتخمين الإجابة الصحيحة.

هذه الورقة البحثية تشبه "تقرير درجات" من دراسة قام فيها الباحثون بسؤال نفس المسائل المنطقية لخمسة طلاب مختلفين من الذكاء الاصطناعي، لكنهم طرحوا الأسئلة بثلاث طرق مختلفة تماماً:

  1. أسلوب "المقال" (الإجابة القصيرة): "إليك مسألة. حلها وأعطني الإجابة."
  2. أسلوب "الاختيار من متعدد": "إليك مسألة. اختر الإجابة الصحيحة من بين هذه الخيارات الـ 5 أو الـ 11."
  3. أسلوب "الصح أم الخطأ": "إليك مسألة وإجابة محددة. هل هذه الإجابة صحيحة أم خاطئة؟"

أراد الباحثون معرفة: هل تغير طريقة طرحك للسؤال من أداء الذكاء الاصطناعي؟

إليك النتائج الرئيسية، مشروحة ببساطة:

1. تأثير "لعبة التخمين"

كانت المفاجأة الكبرى هي أن الحصول على الإجابة النهائية الصحيحة لا يعني دائماً أن الذكاء الاصطناعي قام بالعمل الصحيح.

  • التشبيه: تخيل طالباً يؤدي اختبار اختيار من متعدد. قد لا يعرف كيفية إجراء العملية الحسابية، لكنه يخمن حرف "ج" ويصيب الإجابة. إذا نظرت فقط إلى ورقة الإجابات، ستجد أنه حصل على درجة 100%. ولكن إذا نظرت إلى مسودة الحل الخاصة به، ستجد أنه كتب كلاماً غير مفهوم.
  • النتيجة: غالباً ما كان الذكاء الاصطناعي "يخمن" الحرف الصحيح في أسئلة الاختيار من متعدد حتى عندما كانت خطوات تفكيره خاطئة. وعلى العكس من ذلك، في بعض الأحيان كان يقوم بالرياضيات بشكل مثالي ولكنه يختار الحرف الخطأ في النهاية لأنه ارتبك بسبب الخيارات المتاحة.
  • الدرس المستفاد: إذا تحققت فقط من الإجابة النهائية، فقد تعتقد أن الذكاء الاصطناعي أذكى مما هو عليه في الواقع.

2. مشكلة "القائمة" (الاختيار من متعدد)

عندما أعطى الباحثون الذكاء الاصطناعي قائمة من الخيارات للاختيار من بينها، كان عدد الخيارات والكلمات المستخدمة أمراً مؤثراً.

  • خيارات كثيرة جداً: عندما زادت القائمة من 5 خيارات إلى 11 خياراً، انخفض أداء الذكاء الاصطناعي غالباً. الأمر يشبه عرض 5 نكهات آيس كريم عليك مقابل 50 نكهة؛ فقد ارتبك الذكاء الاصطناعي وبدأ في التخمين أكثر.
  • خيار "شيء آخر": أضاف الباحثون خياراً غريباً يسمى "شيء آخر" (أو "لا شيء مما سبق").
    • إذا كان "شيء آخر" هو الإجابة الصحيحة، فغال Largely واجه الذكاء الاصطناعي صعوبة في اختياره، حتى لو قام بالحسابات بشكل صحيح. بدا وكأنه يفضل اختيار رقم محدد، حتى لو كان هذا الرقم خاطئاً.
    • كما بدا أن لدى الذكاء الاصطناعي "تحيزاً للمقعد المفضل". فقد كان يختار الخيار الأول أو الأخير بشكل متكرر بغض النظر عما إذا كان صحيحاً أم لا.

3. فخ "نعم/لا" (الصح أم الخطأ)

عند طرح أسئلة "صح أم خطأ"، غيرت الكلمات المحددة المستخدمة النتائج.

  • صحيح مقابل خطأ: كان الذكاء الاصطناعي أفضل حالاً في قول "صحيح" عندما تكون الإجابة صحيحة، من قوله "خطأ" عندما تكون الإجابة خاطئة. بدا وكأن لديه تحيزاً للموافقة.
  • الصياغة: تغيير الطلب من "صح أم خطأ" إلى "نعم أم لا" جعل الذكاء الاصطناعي أسوأ أداءً بشكل ملحوظ في بعض المهام. إنه يشبه كيف قد يجيب شخص ما بـ "نعم" على سؤال "هل تريد الذهاب؟" بينما قد يتردد على سؤال "هل صحيح أنك تريد الذهاب؟". الذكاء الاصطناعي حساس لهذه التحولات اللغوية الطفيفة.

4. ارتباك "التعليمات"

حاول الباحثون مساعدة الذكاء الاصطناعي بإضافة تعليمات مثل: "حل المسألة أولاً، ثم قرر ما إذا كانت صحيحة أم خاطئة".

  • النتيجة: أدى ذلك أحياناً إلى المساعدة، ولكن في كثير من الأحيان تسبب في إرباك الذكاء الاصطناعي أو جعل أدائه أسوأ. أحياناً كان الذكاء الاصطناعي يركز بشدة على التعليمات لدرجة أنه ينسى المنطق الفعلي للمسألة.

الملخص: ماذا يجب أن نتعلم؟

تخلص الورقة البحثية إلى أن لا يمكننا مجرد النظر إلى النتيجة النهائية للحكم على ذكاء الذكاء الاصطناعي.

  • إذا سألت الذكاء الاصطناعي سؤال اختيار من متعدد، فقد يكون "يغش" عن طريق تخمين الحرف الصحيح دون فهم المنطق.
  • إذا سألته سؤال "صح أم خطأ"، فإن الكلمات المحددة التي تستخدمها يمكن أن تخدعه ليكون أقل دقة.
  • لمعرفة ما إذا كان الذكاء الاصطناعي ذكياً حقاً، يجب عليك فحص "مسودة الحل" الخاصة به (خطوات تفكيره)، وليس مجرد الدائرة النهائية التي ملأها.

لقد بنى الباحثون مجموعة جديدة من الاختبارات (معيار قياسي) لمساعدة المطورين في المستقبل على فهم هذه العيوب، لضمان أننا عندما نختبر الذكاء الاصطناعي، لا نختبر فقط مدى براعته في التخمين، بل مدى براعته في التفكير.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →