← أحدث الأبحاث
🤖 AI

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

تقدم هذه الورقة ViDoRe v3، وهو معيار متعدد الوسائط شامل يتكون من 10 مجموعات بيانات متنوعة و3,099 استعلاماً تم التحقق منها بشرياً عبر 6 لغات، صُمم لتقييم أنظمة التوليد المعزز بالاسترجاع على مستندات واقعية معقدة وغنية بصرياً مع تسليط الضوء على القيود الحالية في التأسيس البصري والتركيب متعدد المستندات.

المؤلفون الأصليون: António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

نُشر 2026-04-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق تحاول حل قضية معقدة، ولكن بدلاً من مجرد قراءة ملفات نصية، يتعين عليك البحث في مكتبة ضخمة من المخططات القديمة، والرسوم البيانية المالية، وسجلات الصيانة المكتوبة بخط اليد، والرسوم التوضيحية العلمية. أنت بحاجة إلى العثور على أدلة محددة، ودمج المعلومات من صفحات مختلفة، والإشارة بدقة إلى مكان اختباء الدليل.

هذا هو بالضبط التحدي الذي تعالجه ورقة بحثية بعنوان ViDoRe V3. إنها تقدم "أرض تدريب" جديدة (معيار اختبار) لاختبار مدى قدرة أنظمة الذكاء الاصطناوي على العمل كمحققين.

إليك تفصيل الورقة البحثية باستخدام تشبيهات بسيطة:

1. المشكلة: المحقق "النصي فقط" تائه

لفترة طويلة، كانت مساعدو الذكاء الاصطناعي (أنظمة RAG) مثل المحققين الذين يعرفون فقط كيفية قراءة النصوص المجردة. إذا سألتهم: "أين صمام الوقود في هذه الطائرة؟" وكانت الإجابة داخل رسم توضيحي معقد أو جدول، فغالباً ما كان الذكاء الاصطناعي يرتبك، أو يتجاهل الصورة، أو يبتدع إجابة من عنده (يهلوس).

كانت الاختبارات الحالية لهذه الأنظمة سهلة للغاية؛ كانت تشبه طلب البحث عن اسم في دليل هاتف. لم تكن تختبر ما إذا كان بإمكان الذكاء الاصطناعي:

  • قراءة رسم بياني أو خريطة.
  • دمج الأدلة من ثلاثة مستندات مختلفة لحل لغز.
  • الإشارة إلى المكان المحدد في الصفحة حيث توجد الإجابة.

2. الحل: معسكر تدريب "ViDoRe V3"

أنشأ المؤلفون ViDoRe V3، وهو يشبه معسكر تدريب ضخم وعالي المخاطر للمحققين من الذكاء الاصطناعي.

  • المكتبة: جمعوا 26,000 صفحة من وثائق حقيقية (مثل كتيبات الطائرات، والتقارير المالية، والإرشادات الطبية) وهي مليئة بالصور والجداول والرسوم البيانية.
  • القضايا: أنشأوا 3,099 "قضية" (سؤالاً) تتسم بالدهاء. بعضها يسأل عن حقائق بسيطة، لكن البعض الآخر يطلب استنتاجاً معقداً، مثل: "قارن بين سجلات السلامة لهذين المحركين بناءً على الرسوم البيانية في هذه الكتيبات الثلاثة".
  • الحكام البشريون: لضمان عدالة التدريب، قضى البشر 12,000 ساعة (ما يعادل 1.5 سنة من العمل بدوام كامل!) في التحقق من الإجابات. لم يكتفوا بكتابة الإجابة فحسب، بل رسموا مربعات حول النص أو الصورة الدقيقة التي تثبت صحة الإجابة.

3. الاختبار الكبير: كيف كان أداء الذكاء الاصطناعي؟

وضع الباحثون أذكى نماذج الذكاء الاصطناعي المتاحة في هذا المعسكر التدريبي ليروا كيف سيكون أداؤها. وإليكم ما وجدوه:

  • العيون أفضل من الآذان: عندما سُمح للذكاء الاصطناائي بـ "رؤية" صور المستندات (الاسترجاع البصري)، كان أداؤه أفضل بكثير مما كان عليه عندما يقرأ النص فقط. الأمر يشبه إعطاء محقق صورة لمسرح الجريمة بدلاً من مجرد وصف مكتوب لها.
  • قوة الرأي الثاني: أصبح الذكاء الاصطناعي أكثر ذكاءً عندما استخدم "أداة إعادة ترتيب" (re-ranker). تخيل أن المحقق وجد 10 أدلة، لكن خبيراً ثانياً (أداة إعادة الترتيب) يساعده في اختيار أفضل 3 أدلة للتركيز عليها. هذه الخطوة أحدثت فرقاً هائلاً.
  • نهج "الهجين" هو الفائز: جاءت أفضل النتائج من خلال عمل جماعي: ذكاء اصطناعي ينظر إلى الصور وآخر يقرأ النص، ثم يدمجان نتائج أحدهما مع الآخر. هذا يشبه وجود خبير بصري وخبير نصوص يعملان معاً.
  • نقاط الضعف: لا تزال حتى أفضل أنظمة الذكاء الاصطناعي تعاني من:
    • الأسئلة مفتوحة النهايات: "اشرح تاريخ هذه الآلة" أصعب من "في أي عام صُنعت؟".
    • القضايا متعددة اللغات: إذا كان السؤال بالإسبانية ولكن الدليل بالإنجليزية، فإن الذكاء الاصطناعي غالباً ما يتوه.
    • تحديد الإصبع: رغم أن الذكاء الاصطناعي يمكنه غالباً العثور على الصفحة الصحيحة، إلا أنه لا يزال سيئاً في رسم المربع الدقيق حول جملة أو خلية جدول معينة. الأمر يشبه العثور على الغرفة الصحيحة في منزل، لكنك لا تعرف أي كرسي يوجد تحته المفتاح.

4. لماذا يهم هذا الأمر؟

هذه الورقة البحثية هي بمثابة جرس إنذار لصناعة الذكاء الاصطناعي. فهي تظهر أنه لبناء مساعدين حقيقيين ومفيدين للذكاء الاصطناعي في العالم الحقيقي (للأطباء، والمهندسين، والمحامين)، لا يمكننا الاعتماد فقط على النصوص. نحن بحاجة إلى أنظمة يمكنها الرؤية، والاستنتاج عبر مستندات متعددة، وإثبات من أين حصلت على معلوماتها.

باختصار: ViDoRe V3 هو "امتحان نهائي" صارم للذكاء الاصطناعي. إنه يثبت أنه بينما أصبح الذكاء الاصطناعي جيداً في القراءة، فلا يزال أمامه الكثير من الواجبات المنزلية ليقوم بها قبل أن يتمكن حقاً من فهم عالم الوثائق المعقد والبصري والفوضوي. والخبر الجيد؟ لقد أتاحوا أسئلة الامتحان للجمهور حتى يتمكن الجميع من مساعدة الذكاء الاصطناعي على الدراسة ويصبح أكثر ذكاءً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →