← أحدث الأبحاث
💻 computer science

PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies

يُعدُّ PRISMM-Bench أول معيار مرجعي يستند إلى التناقضات الحقيقية التي رصدها مراجعون أقران في النصوص والأشكال والجداول والمعادلات عبر الأوراق العلمية، وهو مصمم لتقييم وكشف القصور الكبير في النماذج اللغوية الكبيرة متعددة الوسائط الحالية في اكتشاف الأخطاء العلمية متعددة الوسائط وتصحيحها والاستنتاج بشأنها بشكل صارم.

المؤلفون الأصليون: Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك رئيس تحرير أول في مجلة علمية مرموقة. مهمتك هي مراجعة المسودات النهائية للأوراق البحثية قبل طباعتها. لاحظت شيئًا غريبًا: أحيانًا يقول النص شيئًا، لكن الصور أو الرسوم البيانية تظهر شيئًا مختلفًا تمامًا. رب درجة تقول إن نموذج تعلم آلي دقيق بنسبة 99%، بينما يظهر الرسم البياني فشله في نصف الحالات. أو يصف النص جسرًا، بينما يظهر المخطط قاربًا.

هذه هي التناقضات متعددة الوسائط (multimodal inconsistencies). إنها دقيقة، ومربكة، وخطيرة لأنها تقوض الثقة في العلم.

تقدم هذه الورقة أداة جديدة تسمى PRISMM-Bench (والذي يبدو كمنشور زجاجي يكسر الضوء إلى ألوان، لكنه هنا يفكك الأوراق المعقدة إلى تناقضاتها). إليك قصة ما فعلوه، مشروحة ببساطة:

1. المشكلة: فجوة "ثق ولكن تحقق"

بدأ العلماء في استخدام النماذج اللغوية الكبيرة متعددة الوسائط (LMMs) — وهي مساعدون أذكياء للغاية من الذكاء الاصطناعي يمكنهم قراءة النصوص وأيضًا النظر إلى الصور — للمساعدة في كتابة وفحص الأوراق البحثية. والأمل هو أن تتمكن هذه الأنظمة من رصد الأخطاء التي يغفل عنها البشر.

لكن هنا تكمن العقبة: هل تستطيع هذه الأنظمة بالفعل رصد التناقضات الدقيقة بين الكلمات والصور؟
الاختبارات الحالية لهذه الأنظمة تشبه إعطاءها اختبارًا في الرياضيات يحتوي على أخطاء واضحة (مثل: "2 + 2 = 5"). أما الأوراق العلمية الحقيقية فهي أصعب؛ فالأخطاء فيها تشبه خطأ مطبعيًا في عقد، أو خريطة لا تتطابق مع التضاريس. الاختبارات الموجودة لم تكن تلتقط هذا التعقيد الواقعي.

2. الحل: التنقيب عن الذهب في "النفايات"

احتاج الباحثون إلى طريقة لاختبار هذه الأنظمة بناءً على أخطاء حقيقية. لذا، ذهبوا للبحث في قاعدة بيانات OpenReview، حيث يقدم العلماء أوراقهم البحثية ويحصلون على مراجعات النظراء.

  • التشبيه: تخيل مكتبة ضخمة حيث يوجد لكل كتاب "بطاقة مراجعة" مرفقة به. معظم البطاقات تقول: "كتاب رائع!" لكن بعضها يقول: "مهلًا، المؤلف يقول إن البطل طويل في الفصل الأول، لكن الصورة في الفصل الخامس تظهره قزمًا".
  • العملية: استخدم الفريق حاسوبًا لمسح آلاف بطاقات المراجعة هذه للعثور على شكاوى مثل "الطويل مقابل القزم". ثم قام خبراء بشريون بالتحقق منها.
  • النتيجة: بنوا مجموعة بيانات تضم 384 تناقضًا حقيقيًا من 353 ورقة علمية. هذه هي "PRISMM-Bench" الخاصة بهم. إنها ليست من صنع الخيال؛ بل هي الأمور الحقيقية التي أشار إليها المراجعون بالفعل.

3. الاختبار: ثلاثة مستويات من الصعوبة

لم يكتفوا بسؤال الذكاء الاصطناعي: "هل هناك خطأ؟" بل جعلواهم يلعبون ثلاث ألعاب مختلفة:

  1. المحقق (التحديد): "إليك نص وصورة. أين تكمن الكذبة؟"
  2. الطبيب (العلاج): "حسنًا، لقد وجدت الكذبة. كيف نصلحها؟ هل نغير النص أم نعيد رسم الصورة؟"
  3. الخاطبة (الاقتران): "إليك وصف نصي. أي من هذه الصور الأربع يتناقض معه؟"

4. الحيلة الماكرة: فخ "الاختيار من متعدد"

لاحظ الباحثون مشكلة مضحكة. عندما أعطوا نماذج الذكاء الاصطناعي أسئلة اختيار من متعدد (أ، ب، ج، د)، حصلت النماذج على درجات عالية جدًا. لكن عندما نزعوا الصور وأظهروا النص فقط، استمرت النماذج في الحصول على درجات عالية أيضًا!

  • الاستعارة: الأمر يشبه طالبًا يخوض اختبارًا دون أن يقرأ السؤال. هو فقط ينظر إلى الإجابات ويقول: "الخيار (ج) هو الأطول دائمًا، لذا سأختاره". أو: "الخيار (أ) يبدو فخمًا، لذا لا بد أن يكون هو الصحيح". كان الذكاء الاصطناعي يغش عبر تخمين الأنماط اللغوية، وليس عبر النظر الفعلي إلى الصور.

الحل: لمنع هذا الغش، قاموا بتغيير التنسيق. بدلًا من الجمل الطويلة والمنمقة للإجابات، أجبروا الذكاء الاصطناعي على ملء نموذج JSON (صندوق بيانات مهيكل).

  • الطريقة القديمة: "تظهر الصورة سيارة حمراء، لكن النص يقول زرقاء".
  • الطريقة الجديدة: {"Attribute": "Color", "Claim": "Blue", "Evidence": "Red"}

لقد جرد هذا التنسيق اللغة من "الكلمات المنمقة" وأجبر الذكاء الاصطناعي على النظر فعليًا إلى البيانات لملء الخانات. كان الأمر أشبه بسحب ورقة الغش من يد الطالب.

5. النتائج: الذكاء الاصطناعي لا يزال مبتدئًا

اختبروا 21 نموذجًا من أذكى نماذج الذكاء الاصطناعي في العالم (بما في ذلك أسماء كبيرة مثل GPT-5 وGemini).

  • الدرجة: حتى أفضل النماذج لم تحصل إلا على حوالي 54% فقط من الإجابات الصحيحة.
  • الواقع المرير: الخبير البشري سيحصل على درجات أعلى بكثير. لا تزال نماذج الذكاء الاصطناعي تعاني في ربط الجملة بالمخطط البياني. غالبًا ما تفوتها الأدلة الدقيقة أو يتشتت انتباهها بسبب الكم الهائل من النصوص.
  • دفعة "الاستنتاج": وجدوا أن النماذج التي طُلب منها "التفكير خطوة بخطوة" (مثل الإنسان الذي يحل لغزًا بصوت عالٍ) حققت نتائج أفضل بكثير من تلك التي كانت تكتفي بالتخمين فقط.

الخلاصة الكبرى

هذه الورقة هي بمثابة جرس إنذار. نحن نريد للذكاء الاصطناعي أن يكون مساعدنا العلمي، يساعدنا في كتابة وفحص الأوراق البحثية. ولكن في الوقت الحالي، إذا طلبت من ذكاء اصطناعي فحص ورقة بحثية بحثًا عن التناقضات بين النص والصور، فهو ليس موثوقًا بعد. إنه يشبه توظيف مصحح لغوي قد يغفل عن الأخطاء المطبعية لأنه مشغول جدًا بالتخمين بناءً على حجم الخط.

PRISMM-Bench هو "اختبار القيادة" الجديد لهؤلاء المساعدين من الذكاء الاصطناعي. وهو يثبت أنه بينما يصبحون أكثر ذكاءً، إلا أن أمامهم طريقًا طويلاً جدًا قبل أن يمكن الوثوق بهم للحفاظ على نزاهة العلم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →