← أحدث الأبحاث
💻 computer science

Test of Time: Rethinking Temporal Signal of Benchmark Contamination

تتحدى هذه الورقة الافتراض القائل بأن تدهور الأداء بعد تاريخ قطع البيانات يشير بشكل موثوق إلى تلوث المعايير المرجعية، حيث تثبت من خلال تحليل LiveCodeBench ودوال التأثير أن هذه الإشارة الزمنية حساسة للغاية لصياغة الأسئلة ويمكن استحثاثها أو إزالتها اصطناعياً بواسطة التحويلات المولدة بواسطة النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Terry Jingchen Zhang, Gopal Dev, Ning Wang, Max Obreiter, Punya Syon Pandey, Keenan Samway, Wenyuan Jiang, Yinya Huang, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin

نُشر 2026-04-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Terry Jingchen Zhang, Gopal Dev, Ning Wang, Max Obreiter, Punya Syon Pandey, Keenan Samway, Wenyuan Jiang, Yinya Huang, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "اختبار الزمن: إعادة التفكير في الإشارة الزمنية لتلوث المعايير المرجعية"، مقسمة إلى مفاهيم بسيطة مع تشبيهات من الحياة اليومية.

الفكرة الكبرى: اختبار "الحداثة" معطل

تخيل أنك معلم يحاول معرفة ما إذا كان أحد الطلاب قد غش في الامتحان النهائي. إحدى الحيل الشائعة التي يستخدمها المعلمون هي التحقق مما إذا كان الطالب قد أدى بشكل أفضل في الأسئلة المأخوذة من كتاب العام الماضي (الذي ربما حفظه) مقابل أسئال من كتاب جديد تماماً صدر بعد توقف الطالب عن الدراسة.

إذا سجل الطالب درجات عالية في الأسئلة القديمة ومنخفضة في الجديدة، يفترض المعلم: "آه! لقد حفظ الكتاب القديم لكنه لا يفهم المادة حقاً". يُسمى هذا الانخفاض في الدرجات بـ "تدهور الأداء بعد تاريخ القطع" (post-cutoff performance decay).

لفترة طويلة، استخدم الباحثون "اختبار الحداثة" هذا لكشف نماذج الذكاء الاصطناعي التي كانت قد حفظت بيانات تدريبها سراً (وهي مشكلة تسمى تلوث المعايير المرجعية - benchmark contamination). إذا كان أداء الذكاء الاصطناعي أسوأ في الأسئلة الجديدة، فكان ذلك يُعت-بر دليلاً على الغش.

هذه الورقة البحثية تجادل بأن هذا الاختبار غير موثوق. حيث يوضح المؤلفون أن نتيجة الاختبار تعتمد كلياً على كيفية كتابة الأسئلة، وليس فقط على ما إذا كان الذكاء الاصطناعي قد حفظ الإجابات أم لا.


التجربة: "نفس الحساء، في أوعية مختلفة"

لإثبات وجهة نظرهم، أعد الباحثون تجربة محددة للغاية باستخدام نفس "المكونات" (مواد مصدرية من أوراق علمية) ولكن قدموها في "وعاءين" مختلفين (تنسيقات أسئلة مختلفة).

1. الوعاء (أ): أسئلة "ملء الفراغات" (Cloze)

تخيل أخذ جملة من كتاب مدرسي وتغطية الكلمات الأكثر أهمية بشريط أسود، وطلب ملء الفراغات.

  • مثال: "عاصمة فرنسا هي [______]."
  • النتيجة: عندما رأى الذكاء الاصطناعي هذه الأسئلة، فشل في اختبار الحداثة. فقد سجل درجات عالية في الأسئلة القديمة ومنخفضة في الجديدة. بدا هذا وكأنه غش واضح؛ فالذكاء الاصطناعي كان يسترجع النص المحدد الذي رآه من قبل.

2. الوعاء (ب): الأسئلة "المعاد صياغتها بواسطة الذكاء الاصطناعي"

الآن، تخيل أخذ نفس هذه الجملة تماماً وطلب من ذكاء اصطناعي فائق الذكاء إعادة صياغتها إلى لغز جديد ومعقد يتطلب نفس المنطق للحل، ولكن باستخدام كلمات وهيكل مختلفين.

  • مثال: بدلاً من "عاصمة فرنسا هي [______]"، يسأل الذكاء الاصطناعي: "إذا كنت ستسافر إلى المدينة المعروفة ببرج إيفل واللوفر، فما الاسم الذي ستكتبه على جواز سفرك؟"
  • النتيجة: عندما رأى الذكاء الاصطناعي هذه الأسئلة المعاد صياغتها، اختفى "اختبار الحداثة". فقد سجل الذكاء الاصطناعي درجات جيدة في الأسئلة "الجديدة" تماماً كما في الأسئلة "القديمة".

الاستنتاج الصادم: على الرغم من أن الذكاء الاصطناعي كان ينظر إلى نفس المادة المصدرية تماماً في كلتا الحالتين، إلا أن إشارة "الغش" (انخفاض الدرجات في الأسئلة الجديدة) قد اختفت ببساطة لأن الأسئلة تمت إعادة صياغتها.

دليل "المحقق": دوال التأثير (Influence Functions)

لفهم سبب حدوث ذلك، استخدم الباحثون "أداة كشف" تسمى "دوال التأثير" (Influence Functions). فكر في هذا كعدسة مكبرة جنائية تسأل الذكاء الاصطناعي: "أي صفحة محددة في مكتبة التدريب الخاصة بك ساعدتك في الإجابة على هذا السؤال؟"

  • في أسئلة "ملء الفراغات": أشار الذكاء الاصطناعي مباشرة إلى الورقة المصدرية الأصلية. قال: "أنا أعرف هذا لأنني قرأت هذه الصفحة بالضبط". (ثقة عالية في الذاكرة).
  • في الأسئلة "المعاد صياغتها بواسطة الذكاء الاصطناعي": واجه الذكاء الاصطناعي صعوبة في الإشارة إلى المصدر. كان من الصعب جداً على الذكاء الاصطناعي تتبع الإجابة والربط بينها وبين الصفحة المحددة التي حفظها.

هذا يثبت أن عملية إعادة صياغة السؤال (حتى لو قام بها ذكاء اصطناعي آخر) تكسر الرابط المباشر بين السؤال والنص المحفوظ. الذكاء الاصطناعي لا يقوم بالضرورة بـ "التفكير" بشكل أفضل؛ بل ببساطة لا يستطيع العثور على تطابق الذاكرة الدقيق بعد الآن.

لماذا يهم هذا؟

تخلص الورقة إلى أنه لا يمكننا الوثوق بـ "اختبار الحداثة" (التحقق مما إذا كانت الدرجات تنخفض في التواريخ الجديدة) كدليل قائم بذاته على الغش.

  • الاعتقاد القديم: "إذا انخفضت درجات الذكاء الاصطناعي في الأسئلة الجديدة، فلا بد أنه حفظ القديمة".
  • الواقع الجديد: "إذا انخفضت درجات الذكاء الاصطناعي في الأسئلة الجديدة، فقد يكون ذلك لمجرد أن الأسئلة الجديدة كُتبت بطريقة تتطابق مع الأسئلة القديمة بشكل وثيق جداً (مثل ملء الفراغات). إذا أعدنا صياغة الأسئلة، فإن إشارة 'الغش' ستختفي، حتى لو ظل لدى الذكاء الاصطناي نفس المعرفة".

الخلاصة

يقول المؤلفون لمجتمع أبحاث الذكاء الاصطناعي: توقفوا عن الاعتماد على اختبار واحد يعتمد على التاريخ لكشف الغش.

مجرد فشل الذكاء الاصطناعي في سؤال "جديد" لا يعني أنه مذنب، ومجرد نجاحه في سؤال "جديد" لا يعني أنه بريء. الطريقة التي تكتب بها سؤال الاختبار تغير النتيجة أكثر مما تفعل ذاكرة الذكاء الاصطناعي الفعلية. نحن بحاجة إلى طرق أفضل وأكثر قوة للتحقق مما إذا كان الذكاء الاصطناعي يقوم بالاستنتاج المنطقي حقاً أم أنه مجرد حفظ للمعلومات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →