← أحدث الأبحاث
💻 computer science

Can MLLMs "Read" What is Missing?

تقدم هذه الورقة البحثية MMTR-Bench، وهو معيار مرجعي جديد يقيم القدرة الجوهرية للنماذج اللغوية الكبيرة متعددة الوسائط على إعادة بناء النصوص المحجوبة مباشرة من السياق البصري دون مطالبات صريحة، مما يعزل ويقيم قدراتها في فهم التخطيط، والتأسيس البصري، وتكامل المعرفة.

المؤلفون الأصليون: Jindi Guo, Xi Fang, Chaozheng Huang

نُشر 2026-04-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jindi Guo, Xi Fang, Chaozheng Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تنظر إلى ملصق "مطلوب للعدالة" (Wanted Poster) من الغرب الأمريكي القديم. قام الشريف بتغطية اسم المجرم بقطعة من الشريط الأسود. مهمتك ليست الإجابة على سؤال مثل، "من هو المجرم؟" بل عليك النظر إلى القرائن المحيطة بالشريط — وصف الندبة، الحصان الذي يركبه، البلدة التي سرقها — لتكتشف بالضبط الاسم الذي كان مخفيًا تحت الشريط.

هذا هو بالضبط جوهر ما يدور حوله هذا البحث، MMTR-Bench.

إليك تفصيل الورقة البحثية باستخدام تشبيهات بسيطة:

١. المشكلة: المعلم "الخدوم أكثر من اللازم"

لفترة طويلة، كنا نختبر نماذج الذكاء الاصطناعي (الطلاب) باستخدام اختبارات السؤال والجواب (Q&A).

  • الطريقة القديمة: يشير المعلم إلى صورة كلب ويسأل، "ما لون الكلب؟" فينظر الذكاء الاصطناعي إلى الكلب ويقول ببساطة "بني".
  • المشكلة: في العالم الحقيقي، لا نحصل دائمًا على سؤال مساعد. أحيانًا نرى صفحة ويب فوضوية، أو مخططًا معقدًا، أو تقريرًا متعدد الصفحات، وعلينا أن نستنتج بأنفسنا ما هو المفقود أو ما يعنيه. الاختبارات القديمة لم تتحقق مما إذا كان بإمكان الذكاء الاصطناعي القيام بهذا "العمل التحري" دون إخباره بما يجب أن يبحث عنه تحديدًا.

٢. الحل: لعبة "الصندوق الأسود"

ابتكر المؤلفون لعبة جديدة تسمى MMTR-Bench (اختبار إعادة بناء النص المقنع متعدد الوسائط).

  • الإعداد: يأخذون وثائق حقيقية (مثل الأوراق العلمية، صفحات الويب، أو المخططات) ويغطون كلمة أو جملة محددة بصندوق أسود.
  • المهمة: يعطون الذكاء الاصطناعي الصورة دون طرح أي سؤال. يجب على الذكاء الاصطناعي أن يقول: "بناءً على التنسيق، والصور، والنص المحيط بالصندوق الأسود، فإن الكلمة المفقودة هي..."
  • الهدف: هذا يختبر ما إذا كان الذك তৈเข้าใจ (يفهم) السياق البصري حقًا، أم أنه مجرد يخمن بناءً على السؤال الذي طُرح عليه.

٣. مستويات الصعوبة: من "أكمل الفراغ" إلى "اكتب رواية"

أدرك الباحثون أن تخمين رقم مفقود يختلف عن تخمين فقرة كاملة. لذا، أنشأوا أربعة مستويات من الصعوبة، مثل ألعاب الفيديو:

  • المستوى ١ (سهل للغاية): تخمين كلمة قصيرة، مثل سنة (٢٠٢٤) أو اسم. الأمر يشبه حل لغز الكلمات المتقاطعة.
  • المستوى ٢ و٣ (الأجزاء المخادعة): تخمين جملة كاملة. يجب على الذكاء الاصطناعي التأكد من أن القواعد والمعنى يتناسبان تمامًا.
  • المستوى ٤ (قتال الزعيم - Boss Fight): تخمين فقرة كاملة. يجب على الذكاء الاصطناعي فهم القصة والمنطق بأكمله لملء الفجوة.

٤. حكم "التحقق من الحقائق"

كيف تقيم ذكاءً اصطناعيًا يكتب فقرة؟ إذا أصاب في المعنى ولكنه استخدم كلمات مختلفة، هل يعتبر ناجحًا؟

  • الطريقة القديمة: مجرد عدّ كم عدد الكلمات المتطابقة.
  • الطريقة الجديدة: يستخدمون "حكمًا للتحقق من الحقائق" (ذكاء اصطناعي آخر). إذا خمن الذكاء الاصطناناعي الفكرة الصحيحة ولكنه أخطأ في حقيقة جوهرية (مثل قول أن التاريخ هو ١٩٩٠ بدلاً من ٢٠٢٤)، فإن الحكم يضع علامة "رسوب" (FAIL) على الإجابة، حتى لو كانت بقية الجملة تبدو جيدة. هذا يضمن أن الذكاء الاصطناعي لا يقوم فقط بإنشاء "هراء" يبدو منمقًا.

٥. النتائج: من اجتاز الاختبار؟

اختبرت الورقة العديد من نماذج الذكاء الاصطناعي (سواء النماذج القوية والمكلفة من شركات التقنية الكبرى أو النماذج الأصغر والمفتوحة المصدر).

  • الفائزون: النماذج "مغلقة المصدر" الأكبر والأكثر قوة (مثل تلك التابعة لجوجل وOpenAI) حققت الأداء الأفضل، لكن حتى هي واجهت صعوبات.
  • الخاسرون: غالبًا ما تعثرت النماذج الأصغر. كان بإمكانها تخمين السنة المفقودة، ولكن عندما طُلب منها تخمين فقرة كاملة، بدأت في "الهلوسة" أو نسخ نص خاطئ من الأجزاء المجاورة.
  • الخلاصة الكبرى: الذكاء الاصطناعي الحالي بارع في الإجابة على الأسئلة عندما تشير إليه مباشرة إلى الإجابة، لكنه لا يزال يتعلم كيف يكون محققًا حقيقيًا عندما تكون الأدلة مبعثرة عبر صفحة معقدة.

٦. لماذا يهم هذا؟

فكر في الأمر كتعليم طفل القراءة.

  • الطريقة القديمة: تشير إلى كلمة وتسأل، "ما هذه؟"
  • طريقة MMTR-Bench: تغطي الكلمة بيدك وتسأل، "ما هي الكلمة التي تناسب هذا المكان بناءً على بقية القصة؟"

هذا الاختبار الجديد يجبر الذكاء الاصطناعي على التوقف عن الاعتماد على "أكواد الغش" (الأسئلة الصريحة) والبدء في تعلم كيفية الرؤية، والاستنتاج، وفهم العالم من حوله حقًا، تمامًا كما يفعل البشر عند قراءة وثيقة معقدة.

باخت-صار: تقدم هذه الورقة اختبارًا جديدًا وأكثر صعوبة للذكاء الاصطناعي، حيث يزيل "التلميحات" ليرى ما إذا كانت النماذج قادرة حقًا على فهم الوثائق المرئية بمفردها. وتظهر النتائج أنه بينما يصبح الذكاء الاصطناعي أكثر ذكاءً، إلا أنه لا يزال أمامه طريق طويل قبل أن يتمكن من "قراءة" ما هو مفقود بشكل مثالي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →