← أحدث الأبحاث
💬 NLP

SciClaimEval: Cross-modal Claim Verification in Scientific Papers

تقدم الورقة البحثية SciClaimEval، وهي مجموعة بيانات للتحقق من الادعاءات العلمية متعددة الوسائط تتميز بادعاءات وأدلة حقيقية مستمدة من تعديل الأشكال والجداول في الأوراق المنشورة، مما يكشف عن فجوات أداء كبيرة بين النماذج التأسيسية متعددة الوسائط الحالية والخبراء البشر، لا سيما في التحقق القائم على الأشكال.

المؤلفون الأصليون: Xanh Ho, Yun-Ang Wu, Sunisth Kumar, Tian Cheng Xia, Florian Boudin, Andre Greiner-Petter, Akiko Aizawa

نُشر 2026-02-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xanh Ho, Yun-Ang Wu, Sunisth Kumar, Tian Cheng Xia, Florian Boudin, Andre Greiner-Petter, Akiko Aizawa

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك قاضٍ في محكمة رفيعة المستوى. المحامون (العلماء) يقدمون قضاياهم، زاعمين أن اكتشافاتهم الجديدة حقيقية. إنهم يحضرون أدلة: رسومًا بيانية، ومخططات، وجداول بيانات. مهمتك هي اتخاذ القرار: هل يقول المحامي الحقيقة، أم أنه ينسج قصة لا تتطابق مع الأدلة؟

تقدم هذه الورقة أداة جديدة تسمى SciClaimEval، وهي في الأساس "صالة ألعاب رياضية للتدريب" للذكاء الاصطناعي ليتعلم كيف يكون ذلك القاضي.

إليك تفصيل ما قام به الباحثون، باستخدام تشبيهات بسيطة:

1. المشكلة: بيانات التدريب المزيفة

في الماضي، لتعليم الذاء الاصطناعي كيفية كشف الأكاذيب، كان الباحثون ينشئون بيانات تدريب "مزيفة". كانوا يأخذون عبارة حقيقية ويضيفون إليها كلمة "ليس" أو "لا" فقط.

  • التشبيه: تخيل تعليم طفل كيفية كشف عملة مزيفة عن طريق أخذ عملة حقيقية ووضع نقطة سوداء عليها. سيتعلم الطفل البحث عن النقطة السوداء، وليس فهم كيف تبدو العملة الحقيقية.
  • المشكلة: الأكاذيب العلمية الحقيقية ليست مجرد "عبارات حقيقية تمت إضافة 'لا' إليها". إنها دقيقة وخفية. مجموعات البيانات الموجودة كانت سهلة للغاية ولم تعكس الواقع العلمي.

2. الحل: SciClaimEval (الصالة الرياضية "الحقيقية")

قام المؤلفون ببناء مجموعة بيانات جديدة باستخدام أوراق علمية حقيقية من ثلاثة مجالات: تعلم الآلة، ومعالجة اللغات الطبيعية (مثل روبوتات الدردشة)، والطب.

بدلاً من تزييف الأكذوبة، استخدموا حيلة ذكية: لقد قاموا بـ "تخريب" الأدلة.

  • التشبيه: تخيل طباخاً يدعي: "هذا الحساء مالح لأنني أضفت الملح". لاختبار ما إذا كان بإمكان الذكاء الاصطناعي كشف الكذب، لم يقم الباحثون بتغيير الجملة إلى "هذا الحساء حلو المذاق". بدلاً من ذلك، قاموا سرًا بتغيير وعاء الملح في الصورة إلى وعاء سكر.
  • كيف فعلوا ذلك: أخذوا أشكالاً (رسومات بيانية) وجداول حقيقية من الأوراق العلمية وقاموا بتعديلها ببراعة.
    • بالنسبة للجداول: قاموا باستبدال الأرقام، أو نقل الصفوف، أو تغيير قيم الخلايا.
    • بالنسبة للرسوم البيانية: قاموا بقلب الرسوم، أو تبديل تسميات المفتاح (Legend)، أو حتى إضافة نقاط بيانات وهمية.
  • النتيجة: يجب على الذكاء الاصطناعي النظر إلى الصورة أو الجدول الفعلي وإدراك: "مهلاً، الصورة تقول (س)، لكن الجملة تقول (ص). إنهما لا يتطابقان!"

3. التنوع: أكثر من مجرد صور

معظم مجموعات البيانات تعطي الذكاء الاصطناعي صورة لجدول فقط. أما SciClaimEval فهو مثل "السكين السويسري"؛ فهو يعطي الذكاء الاصطناعي الأدلة في تنسيقات عديدة:

  • الصور: تمامًا مثل النظر إلى صورة لمخطط بياني.
  • LaTeX/HTML/JSON: "الكود المصدري" أو البيانات الخام وراء الجدول.
  • لماذا هذا مهم: الأمر يشبه إعطاء ميكانيكي ليس فقط صورة لمحرك معطل، بل أيضًا المخططات الهندسية وقائمة قطع الغيار الفعلية. هذا يساعد الذكاء الاصطناعي على تعلم قراءة العلم بطرق مختلفة.

4. الاختبار: ما مدى ذكاء الذكاء الاصطناعي؟

أخضع الباحثون 11 نموذجًا مختلفًا من نماذج الذكاء الاصطناعي (سواء كانت مفتوحة المصدر أو "مملوكة" باهظة الثمن مثل o4-mini من OpenAI) لهذه الصالة الرياضية.

النتائج:

  • تحدي "الجدول": أدى الذكاء الاصطناعي بشكل جيد جدًا عند فحص الجداول. كان تقريبًا بمستوى خبير بشري. فكر في الأمر كأن الذكاء الاصطناعي بارع في قراءة جداول البيانات.
  • تحدي "الرسم البياني": عانى الذكاء الاصطناعي بشكل كبير مع المخططات والرسوم البيانية. حتى أذكى نماذج الذكاء الاصطناعي ارتكبت أخطاء لم يرتكبها البشر.
    • التشبيه: الذكاء الاصطناعي بارع في قراءة قائمة الطعام (الجداول) ولكنه يرتبك عندما يحاول تفسير لوحة معقدة (الرسوم البيانية). غالبًا ما يغفل عن التفاصيل الدقيقة، مثل محور مقلوب أو تسمية متبادلة.
  • الفجوة: لا تزال هناك فجوة كبيرة بين أفضل نماذج الذكاء الاصطناعي والخبير البشري، خاصة عندما يتعلق الأمر بالبيانات المرئية.

5. لماذا هذا مهم

هذه الورقة هي بمثابة جرس إنذار. بينما يبدأ الذكاء الاصطناعي في كتابة ومراجعة الأوراق العلمية، نحتاج إلى التأكد من قدرته على التحقق من العمل، وليس مجرد التخمين.

  • الوضع الحالي: يتحسن الذكاء الاصطناعي في قراءة النصوص، لكنه لا يزال متعثرًا في "رؤية" الحقيقة في المخططات والرسوم البيانية.
  • الهدف المستقبلي: نحن بحاجة إلى بناء ذكاء اصطناعي لا يحفظ الأنماط فحسب، بل يمكنه حقًا فهم العلاقة بين ادعاء العالم والدليل البصري الذي يقدمه.

باختصار: قام المؤلفون ببناء اختبار "كاشف كذب" واقعي للذكاء الاصطناعي باستخدام أوراق علمية حقيقية. ووجدوا أنه بينما أصبح الذكاء الاصطناعي جيدًا في قراءة جدا البيانات، إلا أنه لا يزال لديه الكثير من الواجبات المنزلية ليقوم بها قبل أن يتمكن من كشف الأكاذب في المخططات والرسوم البيانية العلمية بشكل موثوق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →