← أحدث الأبحاث
💬 NLP

BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks

تقدم الورقة البحثية BenchMarker، وهي مجموعة أدوات مستوحاة من التعليم تستخدم حكامًا يعتمدون على النماذج اللغوية الكبيرة للكشف عن التلوث، والاختصارات، وأخطاء الكتابة في معايير الاختبار متعددة الخيارات، كاشفةً أن مثل هذه العيوب تستمر عبر 12 مجموعة بيانات رئيسية، وتؤدي إلى تشويه مقاييس التقييم بشكل كبير، وغالبًا ما تظهر حتى في المعايير التي تم إصلاحها مسبقًا.

المؤلفون الأصليون: Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

نُشر 2026-04-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك معلم يستعد لإعداد امتحان نهائي لطلابك. أنت تريد أن يكون الاختبار عادلاً، وواضحاً، وأن يقيس بالفعل ما تعلمه الطلاب، وليس فقط مدى براعتهم في الغش أو التخمين.

الآن، تخيل أن الباحثين في عالم الذكاء الاصطناعي (AI) يفعلون الشيء نفسه تماماً. إنهم ينشئون "امتحانات" (تسمى المعايير المرجعية - Benchmarks) لاختبار مدى ذكاء نماذج الذكاء الاصطناعي الخاصة بهم. ولكن، وفقاً لهذه الورقة البحثية، فإن العديد من امتحانات الذكاء الاصطناعي هذه معطلة. فهي مليئة بالأخطاء المطبعية، والأسئلة المربكة، وبعض الأسئلة سهلة جداً بحيث يمكن العثور عليها عبر الإنترنت، مما يجعل الذكاء الاصطناعي "يغش" بمجرد حفظ الإجابات بدلاً من التفكير.

لقد قام مؤلفو هذه الورقة، وهم فريق من الباحثين من جامعات وشركات مثل Scale AI، ببناء أداة جديدة تسمى BenchMarker. فكر في BenchMarker كـ مساعد تدريس صارم للغاية وخبير في مجال التعليم، مهمته الوحيدة هي تصحيح الامتحانات قبل أن يخوضها الذكاء الاصطناعي.

إليك كيف يعمل BenchMarker، باستخدام ثلاث طرق بسيطة لرصد سؤال سيء في الامتحان:

1. فحص "الغش" (التلوث - Contamination)

المشكلة: تخيل أنك تعطي طالباً مسألة رياضية، ولكن هذه المسألة ذاتها نُشرت على موقع شهير للمساعدة في الواجبات المنزلية الأسبوع الماضي. إذا بحث الطالب عنها في جوجل، سيحصل على الإجابة فوراً. هو لم يتعلم الرياضيات؛ بل وجد مفتاح الإجابة فحسب.
حل BenchMarker: يعمل BenchMarker كالمحقق. يأخذ كل سؤال في امتحان الذكاء الاصطناعي ويبحث في الإنترنت بأكمله. إذا وجد السؤال (أو الإجابة) موجوداً على موقع إلكتروني، فإنه يصنفه على أنه "ملوث" (Contaminated).

  • النتيجة: وجدوا أن ما يقرب من نصف الأسئلة في أحد الاختبارات الشهيرة (TruthfulQA) كانت موجودة بالفعل عبر الإنترنت. لم يكن الذكاء الاصطناعي ذكياً؛ بل كان مجرد يتذكر ما رآه على الإنترنت.

2. فحص "السؤال الخادع" (الاختصارات - Shortcuts)

المشكلة: تخيل سؤالاً من نوع الاختيار من متعدد حيث يسأل السؤال: "أي من هذه الفواكه؟" والخيارات هي: أ) سيارة، ب) كلب، ج) تفاحة، د) شاحنة.
لست بحاجة حتى لقراءة السؤال لتعرف أن الإجابة هي تفاحة. إنها الفاكهة الوحيدة. يمكن للذكال الاصطناعي تخمين الإجابة بمجرد النظر إلى الخيارات، دون الحاجة لفهم السؤال. هذا يسمى "اختصاراً".
حل BenchMarker: يلعب BenchMarker لعبة "خمن السؤال". يأخذ الخيارات (سيارة، كلب، تفاحة، شاحنة) ويسأل ذكاءً اصطناعياً فائق الذكاء: "ما هو السؤال الذي تعتقد أنه يناسب هذه الإجابات؟" إذا استطاع الذكاء الاصطناعي تخمين السؤال بمجرد النظر إلى الخيارات، فهذا يعني أن الامتحان يحتوي على اختصار.

  • النتيجة: وجدوا أن بعض الامتحانات مليئة بهذه الحيل لدرجة أن الذكاء الاصطناعي يلعب فعلياً لعبة تخمين، وليس لعبة تفكير.

3. فحص "شرطة القواعد" (الأخطاء الكتابية - Writing Errors)

المشكلة: تخيل اختباراً حيث كُتبت بعض الأسئلة بواسطة شخص لغته الأم هي الإنجليزية، بينما كُتبت أسئلة أخرى بواسطة روبوت نسي وضع نقطة في نهاية الجملة، أو حيث لا تتوافق الإجابات مع قواعد السؤال (على سبيل المثال، السؤال يطلب اسماً جمعاً، لكن جميع الإجابات أسماء مفردة). هذا يربك الطالب ويجعل الاختبار غير عادل.
حل BenchMarker: يستخدم BenchMarker قائمة مراجعة مكونة من 19 نقطة مستعارة من خبراء التعليم الحقيقيين. وهو يتحقق من أمور مثل:

  • هل القواعد النحوية متسقة؟
  • هل الإجابات طويلة جداً أو قصيرة جداً مقارنة ببعضها البعض؟
  • هل توجد إجابة واحدة صحيحة فقط؟
  • النتي بوجهة نظرهم: وجدوا أن بعض معايير الذكاء الاصطناعي هي عبارة عن فوضى. على سبيل المثال، في مجموعة بيانات تسمى HellaSwag، كسر كل سؤال على الأقل قاعدتين من قواعد اللغة هذه.

لماذا يهم هذا؟

تظهر الورقة البحثية أنه عندما تقوم بإصلاح هذه الأسئلة المعطلة، تتغير الدرجات بشكل جذري.

  • "الدرجات العالية المزيفة": عندما يخوض الذكاء الاصطناعي اختباراً مليئاً بأسئلة "الغش" (التلوث)، فإنه يحصل على درجة عالية. ولكن إذا قمت بإزالة تلك الأسئلة، تنخفض الدرجة. لم يكن الذكاء الاصطناعي ذكياً حقاً.
  • "الدرجات المنخفضة المزيفة": عندما يكون الاختبار مليئاً بالأخطاء المطبعية والقواعد السيئة، يحصل الذكاء الاصطناعي على درجة منخفضة. لكن هذا لا يعني أن الذكاء الاصطناعي غبي؛ بل يعني فقط أن الاختبار كُتب بشكل سيء.
  • "تغيير الترتيب": النتيجة الأكثر صدمة هي أن إصلاح هذه الأخطاء يغير لوحة المتصدرين (Leaderboard). فقد يهبط نموذج الذكاء الاصطناعي الذي كان يحتل المركز الأول إلى المركز الثالث بمجرد تنظيف الاختبار. إنه يشبه سباقاً حيث وصل الفائز إلى خط النهاية مبكراً لأن المضمار كان مكسوراً.

الدرس الكبير

يقول المؤلفون إنه لفترة طويلة، كان باحثو الذكاء الاصطناعي يحاولون إصلاح هذه الاختبارات عن طريق إعادة كتابتها فقط. لكنهم غالباً ما يصلحون مشكلة واحدة ويتسببون دون قصد في مشكلة جديدة (مثل جعل الأسئلة صعبة للغاية لدرجة أنها تصبح مربكة).

BenchMarker هو الحل. إنه مجموعة أدوات تساعد الباحثين على مراجعة امتحاناتهم، تماماً كما يراجع المعلم اختباراً قبل توزيعه على الطلاب. ومن خلال استعارة القواعد من التعليم البشري، يأملون في بناء اختبارات أفضل، وأكثر عدلاً، وأكثر صدقاً للذكاء الاصطناعي.

باختصار: BenchMarker هو الأداة التي تمنع الذكاء الاصطناعي من الغش، والتخمين، والارتباك بسبب القواعد اللغوية السيئة، مما يضمن أنه عندما نقول إن الذكاء الاصطناعي "ذكي"، فإننا نعني ذلك حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →