← أحدث الأبحاث
💬 NLP

Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

تقدم الورقة البحثية "سلسلة الأدلة" (Chain of Evidence - CoE)، وهو إطار عمل غير مرتبط بنوع محدد من أدوات الاسترجاع، يستفيد من نماذج الرؤية واللغة لتمكين الإسناد البصري على مستوى البكسل في عملية التوليد المعزز بالاسترجاع التكراري، مما يتغلب على قيود التحليل النصي فقط عبر التفكير المباشر في لقطات الشاشة للمستندات لتوفير استشهادات دقيقة لمربعات الإحاطة والحفاظ على معلومات التخطيط البصري الأساسية.

المؤلفون الأصليون: Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق يحاول حل لغز معقد. في الماضي، كان عليك قراءة مئات الصفحات من التقارير المطبوعة للعثور على الأدلة. إذا قال التقرير: "المشتبه به كان في باريس"، كان عليك الوثوق بذلك. ولكن ماذا لو كان التقرير في الواقع منشوراً إعلانياً فوضوياً يحتوي على خريطة، وصورة لتذكرة قطار، وملاحظة مكتوبة بخط اليد؟ إذا قمت فقط بكتابة الكلمات الموجودة في هذا المنشور، فستفقد الخريطة والصورة، ولن تدرك أين يختبئ الدليل في الصفحة.

هذه هي المشكلة التي يعمل مؤلفو هذه الورقة البحثية على حلها باستخدام نظام جديد يسمى سلسلة الأدلة (Chain of Evidence - CoE).

المشكلة: "النسخة الضوئية الباهتة"

تعمل أنظمة الذكاء الاصطناعي الحالية التي تجيب على الأسئلة (والتي تسمى "التوليد المعزز بالاسترجاع" أو RAG) عادةً بهذا الشكل:

  1. تطرح سؤالاً.
  2. يجد الذكاء الاصطناعي بعض المستندات.
  3. يقوم بتجريد كل الصور، والرسوم البيانية، والتنسيقات المميزة، محولاً كل شيء إلى نص مجرد (مثل نسخة ضوئية باهتة).
  4. يعطيك إجابة ويقول: "لقد وجدت هذا في المستند أ".

الفخ: إذا كان "المستند أ" عبارة عن عرض تقديمي يحتوي على رسم بياني أو ملف PDF يحتوي على جدول معقد، فإن تحويله إلى نص مجرد يدمر المنطق. الأمر يشبه محاولة فهم وصفة طعام من خلال قراءة قائمة المكونات فقط مع تجاهل صور طريقة الخلط. علاوة على على ذلك، عندما يقول الذكاء الاصططني "المستند أ"، فإنه لا يخبرك أي جزء من هذا المستند يحتوي على الإجابة. سيتعين عليك التمرير يدوياً عبر 50 صفحة لتجد الجملة المحددة. هذه هي "عقبة التحقق".

الحل: "المحقق على مستوى البكسل"

يقترح المؤلفون سلسلة الأدلة (CoE)، الذي يغير قواعد اللعبة من خلال التعامل مع المستندات كـ صور (لقطات شاشة) بدلاً من مجرد نصوص.

فكر في (CoE) كمحقق لا يكتفي بقراءة التقرير، بل ينظر إلى الصورة الأصلية غير المعدلة للمستند.

  • لا مزيد من التجريد: هو لا يحول المستند إلى نص أولاً؛ بل ينظر إلى لقطة الشاشة، محتفظاً بجميع الرسوم البيانية، والأسهم، والتنسيقات كما هي.
  • "الهايلايتر السحري": بدلاً من الاكتفاء بالقول "إنه في المستند 3"، يقوم (CoE) برسم صندوق دقيق (صندوق إحاطة) حول المكان المحدد في الصورة حيث توجد الإجابة. إنه يشير مباشرة إلى رقم معين في رسم بياني أو سطر محدد في فقرة.
  • السلسلة: بالنسبة للأسئلة المعقدة التي تتطلب خطوات متعددة (على سبيل المثال: "من أخرج الفيلم، وأين درس؟")، يبني (CoE) سلسلة بصرية. فهو يوضح لك: "الخطوة 1: انظر إلى هذا الصندوق في المستند (أ) لتجد المخرج. الخطوة 2: انظر إلى هذا الصندوق في المستند (ب) لتجد المدرسة".

كيف اختبروه

لإثبات نجاح هذا الأسلوب، قام الفريق ببناء "ساحتين للتدريب" (مجموعات بيانات) جديدتين:

  1. Wiki-CoE: مجموعة ضخمة من صفحات ويكيبيديا التي تحولت إلى لقطات شاشة. لقد أخذوا أسئلة تتطلب التنقل بين صفحات متعددة وعلموا الذكاء الاصطناعي كيفية العثور على الموقع البصري الدقيق للإجابة.
  2. SlideVQA: مجموعة من شرائح العروض التقديمية ذات التنسيقات الفوضوية، والأسهم، والرسوم التوضيحية المعقدة. هذا هو "الوضع الصعب" للاختبار لأن الأنظمة القائمة على النصوص عادة ما تفشل هنا.

النتائج: لماذا يهم هذا؟

تظهر الورقة البحثية أن (CoE) يغير قواعد اللعبة، خاصة بالنسبة للمستندات التي ليست مجرد نصوص مجردة:

  • هو أذكى في تحديد "أين": في الشرائح المعقدة، غالباً ما تضيع أنظمة الذكاء الاصطناعي القياسية التي تعتمد على النصوص. أما (CoE)، ومن خلال النظر إلى التنسيق البصري، فقد حدد الأدلة بشكل صحيح في كثير من الأحيان أكثر من غيره.
  • إنه موثوق: نظرًا لأن (CoE) يرسم صندوقًا حول الدليل، يمكنك التحقق من الإجابة فوراً. لا يتعين عليك التخمين؛ يمكنك رؤية الإثبات أمامك مباشرة على الشاشة.
  • لا يحتاج إلى محرك بحث محدد: يعمل (CoE) مع أي أداة بحث تجد المستندات. فهو يأخذ أفضل 5 نتائج فقط (كصور) ثم يستنتج المنطق.

الخلاصة

يجادل المؤلفون بأنه لكي يكون الذكاء الاصطناعي موثوقاً حقاً، خاصة مع المستندات المعقدة مثل التقارير، والشرائح، والرسوم البيانية، فإنه يحتاج إلى "رؤية" المستند، وليس فقط "قراءة" نسخة نصية منه. سلسلة الأدلة (CoE) تحول الذكاء الاصطناعي إلى محقق بصري يمكنه الإشارة بإصبعه مباشرة إلى الحقيقة، مما يجعل عملية الاستنتاج شفافة وسهلة التحقق من قبل البشر.

باختصار: بدلاً من إعطائك إشارة غامضة إلى كتاب ما، يقوم (CoE) بتسليمك الكتاب، ويفتحه على الصفحة المحددة، ويرسم دائرة حول الجملة التي تحتاجها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →