← أحدث الأبحاث
💬 NLP

SimpleQA Verified: A Reliable Factuality Benchmark to Measure Parametric Knowledge

تقدم الورقة البحثية SimpleQA Verified، وهو معيار اختبار مكون من 1,000 مطالبة مُفلترة بدقة ومصمم للتغلب على قيود SimpleQA الأصلي الخاص بـ OpenAI من خلال توفير تقييم أكثر موثوقية لواقعية النماذج اللغوية الكبيرة، والذي حقق فيه نموذج Gemini 2.5 Pro درجة F1 هي الأفضل حالياً بمعدل 55.6.

المؤلفون الأصليون: Lukas Haas, Gal Yona, Giovanni D'Antonio, Sasha Goldshtein, Dipanjan Das

نُشر 2026-03-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lukas Haas, Gal Yona, Giovanni D'Antonio, Sasha Goldshtein, Dipanjan Das

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول اختبار مدى معرفة طالب بالعالم دون السماح له باستخدام كتاب مدرسي أو إنترنت. أنت تريد أن ترى ما هو مخزن بالفعل في عقله (معرفته البارامترية).

لفترة من الوقت، استخدم مجتمع الذكاء الاصطناعي اختبارًا يسمى SimpleQA للقيال بذلك. ولكن، تمامًا مثل امتحان في المدرسة الثانوية كتبه معلم واحد لديه هوس غريب بشعراء القرن التاسم عشر ويستمر في طرح نفس السؤال بثلاث طرق مختلفة، كان للاختبار الأصلي عيوب رئيسية؛ فقد كان مليئًا بالضجيج، والتحيز، وأحيانًا كان مفتاح الإجابة نفسه خاطئًا.

إليك SimpleQA Verified. فكر في هذا كإعادة فحص "المعيار الذهبي" لذلك الاختبار، والذي أنشأته Google DeepMind لإصلاح الفوضى.

إليك قصة كيف قاموا بتنقيته، مشروحة عبر تشبيهات من الحياة اليومية:

1. مشكلة "المدخلات الرديئة تؤدي لمخرجات رديئة" (Garbage In, Garbage Out)

كان SimpleQA الأصلي يشبه دلوًا من الفاكهة يحتوي على بعض التفاح الفاسد، وبعض البرتقال المكرر، وقسم كامل مخصص فقط للأناناس.

  • المشكلة: كانت الأسئلة الأصلية متشابهة جدًا (متكررة)، ومصدرها مجموعة ضيقة من المصادر (منحازة)، وأحيانًا كانت الإجابات خاطئة (ملصقات ضوضائية).
  • الحل: تصرف الباحثون مثل فريق من أمناء المكتبات الصارمين ولكن العادلين. لقد مروا عبر الدلو وقاموا بـ:
    • إزالة التكرارات: إذا كان سؤالان متشابهين في الجوهر (مثل: "متى تأسست المدينة أ؟" و"متى تأسست المدينة ب؟" عندما يكونان مجرد تنويعات على نفس الحقيقة)، فقد احتفظوا بالأصعب منهما فقط.
    • احترام الملاك: بعض المواقع وضعت لافتات "ممنوع الإزعاج" (robots.txt) تقول: "مهلاً، لا تستخدموا محتوانا لتدريب عقول الذكاء الاصطناعي". احترم الباحثون ذلك وأزالوا الأسئلة التي تعتمد على تلك المواقع.
    • موازنة القائمة: تأكدوا من أن الاختبار ليس مقتصرًا فقط على العلوم والرياضيات. لقد أضافوا أسئلة حول الفن، والرياضة، والجغرافيا لضمان أن الاختبار يقيس المعرفة العامة، وليس مهارة محددة واحدة.

2. مشكلة "الرياضيات الضبابية"

أحد أكبر الصداع في تقييم الذكاء الاصطناعي هو الأرقام.

  • الطريقة القديمة: إذا كانت الإجابة هي "8,282" وقال الذكاء الاصطناعي "8,333"، فإن نظام التصحيح القديم سيعتبرها خاطئة. هذا يشبه إرساب طالب لأن تقديره للمسافة إلى القمر كان 238,900 ميل بدلاً من 238,855 ميل.
  • الطريقة الجديدة: قدم الباحثون قاعدة "هامش الخطأ". الآن، إذا كانت الإجابة رقمًا، فإنهم يمنحون الذكاء الاصطناعي مساحة بسيطة من المناورة (مثل هدف يحتوي على مركز وداخل دائرة محيطة به). إذا أصاب الذكاء الاصطناğı الدائرة المحيطة، فإنه يحصل على الدرجة. هذا يجعل الاختبار أكثر عدلاً وأقل تركيزًا على حفظ الأرقام بدقة متناهية، وأكثر تركيزًا على معرفة النطاق الصحيح.

3. ترقية "المعلم الآلي"

لتقييم هذه الاختبارات، يستخدمون ذكاءً اصطناعيًا آخر (مُقيّم آلي) ليعمل كمعلم.

  • المشكلة: المعلم القديم كان يسهل تشتيته. إذا قدم الطالب الذكاء الاصطناعي إجابة صحيحة ولكنه أضاف شرحًا طويلًا ومهذبًا أو قال: "أعتقد أنه X، ولكن ربما Y"، فإن المعلم القديم كان يرتبك ويعتبرها خطأ.
  • الحل: أعطوا المعلم كتاب قواعد جديدًا. الآن، يُطلب من المعلم: "تجاهل الحشو. ابحث فقط عن الإجابة الجوهرية. إذا كان الطالب يتردد في إجابته (يقول 'ربما')، فاعتبرها 'لم تُحاول' حتى لا يتمكنوا من التلاعب بالنظام عبر التخمين العشوائي".

النتائج: من الذي نجح؟

قاموا بتشغيل الاختبار الجديد الأكثر صرامة وعدلاً على أذكى نماذج الذكاء الاصطناعي في العالم (مثل GPT-5، وClaude Opus، وGemini).

  • الفائز: استحوذ Gemini 2.5 Pro على المركز الأول بنتيجة 55.6%.
  • السياق: لا تقلق إذا بدا رقم 55% منخفضًا! تذكر، هذا اختبار صعب. إنه يشبه امتحان التأهيل للدكتوراه. الحصول على 55% يعني أن الذكاء الاصطناعي يعرف الكثير، لكنه لا يزال يهلوس (يختلق أشياء) بنسبة 45% من الوقت.
  • الخلاصة: أدت النماذج الأخرى (مثل GPT-5 وClaude) أداءً جيدًا، لكن Gemini 2.5 Pro كان الوحيد الذي تفوق عليهم باستمرار في هذا الاختبار المحدد والمنقح.

لماذا يجب أن تهتم؟

فكر في SimpleQA Verified كعداد سرعة جديد وعالي الجودة للذكاء الاصطناعي.

  • قبل ذلك، كان عداد السرعة معطلًا؛ كان يخبرك أن السيارة تسير بسرعة 100 ميل في الساعة بينما هي في الواقع تسير بسرعة 60، أو كان يرتبك بسبب المطر.
  • الآن، لدينا عداد سرعة موثوق. هذا يساعد الباحثين على رؤية التقدم الحقيقي. هل تصبح نماذج الذكاء الاصطناعي أكثر ذكاءً في تذكر الحقائق، أم أنها تقوم فقط بحفظ الإجابات للاختبار القديم المعيب؟

من خلال إصدار هذا المعيار الجديد، تقول Google: "إليكم مسطرة نظيفة وصادقة. دعونا نقيس مستقبل الذكاء الاصطناعي بها، حتى نبني أنظمة يمكن الوثوق بها حقًا ولا تكتفي بمجرد اختلاق الأشياء".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →