← أحدث الأبحاث
💬 NLP

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

تقدم هذه الورقة ArxivRoll، وهو إطار تقييم ديناميكي مستوحى من تشفير لوحة المرة الواحدة (one-time pad)، يستخدم معياراً آلياً نصف سنوي يتم إنشاؤه من مقالات ArXiv الحديثة لقياس وتخفيف المبالغة في تقدير النماذج اللغوية الكبيرة (LLMs) الناتجة عن تلوث البيانات وتحيز التدريب.

المؤلفون الأصليون: Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "إلى أي مدى تغش النماذج اللغوية الكبيرة في التقييم؟" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

المشكلة الكبرى: الاختبار "مفتوح الكتاب"

تخيل أنك معلم تحاول اختبار ذكاء طلابك، فتعطيهم اختباراً قياسياً في الرياضيات. لكن الطلاب قاموا سراً بحفظ الإجابات الخاصة بهذا الاختبار تحديداً من دليل دراسي وجدوه على الإنترنت.

عندما يؤدون الاختبار، يحصلون على درجة 100% في الأسئلة التي حفظوها. ولكن إذا سألتهم مسألة رياضية جديدة لم يروها من قبل، فقد يفشلون.

هذا هو بالضبط ما يحدث مع النماذج اللغوية الكبيرة (LLMs) (مثل الذكاء الاصطناي الذي تتحدث إليه).

  • الغش: يتم تدريب العديد من نماذج الذكاء الاصطناعي على بيانات تتضمن إجابات الاختبارات الشهيرة (المعايير) المستخدمة لقياس ذكائها.
  • النتيجة: هي لا "تتعلم" أو "تفكر" فعلياً؛ بل هي فقط تسترجع إجابات رأتها من قبل. هذا يجعلها تبدو أذكى مما هي عليه في الواقع، مما يؤدي إلى مقارنات غير عادلة بين شركات الذكاء الاصطناي المختلفة.

الحل: ArxivRoll (اختبار "لوحة المرة الواحدة")

ابتكر الباحثون من جامعة هونج كونج للعلوم والتكنولوجيا نظاماً جديداً يسمى ArxivRoll لكشف هؤلاء الغشاشين. وقد استلهموا فكرتهم من مفهوم في علم التشفير يسمى "لوحة المرة الواحدة" (One-Time Pad).

التشبيه: المفتاح السري لمرة واحدة
في علم التشفير، "لوحة المرة الواحدة" هي مفتاح سري يُستخدم لتشفير رسالة. والقاعدة هي: استخدم المفتاح مرة واحدة، ثم تخلص منه. إذا استخدمت نفس المفتاح مرتين، فسيتم كشف السر.

يطبق ArxivRoll هذه القاعدة على الاختبار:

  1. مكونات طازجة: بدلاً من استخدام أسئلة اختبار قديمة وثابتة، يقومون بإنشاء اختبارات جديدة كل ستة أشهر باستخدام أوراق بحثية جديدة تماماً من موقع ArXiv (وهو موقع ينشر فيه العلماء أحدث أعمالهم غير المنشورة بعد).
  2. الاختبار "غير المرئي": ولأن هذه الأوراق جديدة جداً، لم يسبق لأي نموذج ذكاء اصطناعي رؤيتها أثناء تدريبه. الأمر يشبه إعطاء طالب اختباراً بناءً على كتاب طُبع بالأمس فقط.
  3. الاستخدام ثم التخلص: بمجرد انتهاء الاختبار، تُنشر الإجابات للجميع للتحقق من العمل، ولكن تُعتبر أسئلة الاختبار المحددة "منتهية الصلاحية" ولا تُستخدم مرة أخرى أبداً. هذا يضمن عدم قدرة أي ذكاء اصطناي مستقبلي على حفظها.

كيف يعمل الاختبار: لعبة "ملء الفراغات"

لجعل هذه الاختبارات تتم تلقائياً (دون الحاجة لبشر لكتابة آلاف الأسئلة)، يستخدمون طريقة تسمى SCP (التسلسل، والملء، والتنبؤ). فكر في الأمر كنسخة متطورة من لعبة "Mad Libs" أو لعبة الألغاز:

  • التسلسل (Sequencing): يُعطى الذكاء الاصطناعي فقرة حيث تم خلط جملها مثل أوراق اللعب. وعليه إعادة ترتيبها بشكل صحيح.
  • الملء (Cloze): يُعطى الذكاء الاصطناي فقرة بها بعض الجمل المفقودة (محجوبة). وعليه اختيار الجملة الصحيحة لملء الفراغ من قائمة خيارات.
  • التنبؤ (Prediction): يقرأ الذكاء الاصطناي قصة وعليه تخمين الجملة التالية مباشرة، بالاختيار من بين أربعة خيارات مختلفة.

ولأن هذه الأسئلة يتم إنشاؤها عشوائياً من نصوص حديثة، لا يمكن للذكاء الاصطناي مجرد "حفظ" النمط؛ بل يجب عليه فعلياً فهم المنطق.

لوحة النتائج: "الدرجات المتينة" (Rugged Scores)

تقدم الورقة البحثية طريقة جديدة لتقييم هذه النماذج تسمى الدرجات المتينة (RS). تخيل أنك تحكم على عداء:

  • الدرجة العامة: مدى سرعته في الجري على المضمار الذي تدرب عليه (الاختبارات القديمة الملوثة بالمعلومات).
  • الدرجة الخاصة: مدى سرعته في الجري على مسار جديد وغير معروف (اختبار ArxivRoll).

الدرجة المتينة تقيس الفجوة بين هاتين الدرجتين.

  • درجة متينة منخفضة: أدى العداء بشكل مشابه في كلا المسارين. إنه يتمتع بلياقة حقيقية.
  • درجة متينة عالية: كان سريعاً جداً في مضمار التدريب ولكنه بطيء في المسار الجديد. هذا يعني أنه كان "يغش" عبر حفظ مضمار التدريب.

ما الذي وجدوه؟

اختبر الباحثون العديد من نماذج الذكاء الاصطناي الشهيرة (مثل Llama و Qwen و GPT و Claude) باستخدام هذا النظام الجديد.

  1. "المبالغة في التقدير" حقيقة واقعة: العديد من النماذج التي بدت كأنها عباقرة في لوحات الصدارة العامة انخفض ترتيبها بشكل كبير عند اختبارها على اختبارات ArxivRoll الجديدة والخاصة.
  2. بعض النماذج "مفرطة التدريب": وجدوا أن بعض النماذج تم ضبطها خصيصاً لتفوق نوع معين من الأسئلة (مثل الرياضيات أو التمويل) لكنها فشلت فشلاً ذريعاً في أنواع أخرى. الأمر يشبه الطالب الذي درس فقط لامتحان التاريخ النهائي لكنه رسب في اختبار العلوم.
  3. الفجوة ضخمة: بالنسبة لبعض النماذج، كان الفرق بين "درجتها العامة" و"درجتها الخاصة" هائلاً، مما يثبت أن جزءاً كبيراً من ذكائها المعلن كان مجرد حفظ وتلقين.

الملخص

تجادل الورقة البحثية بأننا كنا مخدوعين بمعايير تقييم الذكاء الاصطاني. ومن خلال استخدام نظام يجدد أسئلته باستمرار باستخدام أبحاث جديدة تماماً وغير مسبوقة (ArxivRoll) وقياس الفجوة بين الاختبارات القديمة والجديدة (الدرجات المتينة)، يمكننا معرفة مقدار "ذكاء" الذكاء الاصطناي الحقيقي ومقدار ما هو مجرد غش. إنها طريقة لضمان أنه عندما نقول إن الذكاء الاصطناي ذكي، فهو ذكي بالفعل، وليس مجرد بارع في حفظ الاختبار.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →