← أحدث الأبحاث
💻 computer science

VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents

يُعد VLD-RAG إطار عمل لوكيل توليد مدعم بالاسترجاع متعدد الوسائط، يستخدم الفهرسة الحافظة للصفحات، واستراتيجيات الاسترجاع الهجينة، وسير عمل منسق متعدد الوكلاء للإجابة بفعالية على الأسئلة من خلال تركيب الأدلة النصية والبصرية المتفرقة عبر مستندات طويلة غنية بصرياً ومتعددة الصفحات.

المؤلفون الأصليون: Seonok Kim

نُشر 2026-07-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Seonok Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز ضخم مكون من 100 صفحة، لكن الأدلة مبعثرة في كل مكان. بعض الأدلة مكتوبة بنص صريح، وبعضها مخفي داخل مخططات معقدة، وبعضها الآخر مدسوس داخل رسوم بيانية، وبعضها مجرد جزء من تخطيط الصفحة. هذا هو عالم "الوثائق الغنية بصرياً" — فكر فيها كأنها التقارير، والكتيبات، والعروض التقديمية المزدحمة بالألوان والمعلومات التي نراها في العالم الحقيقي. لفترة طويلة، واجهت الحواسيب التي تحاول قراءة هذه الوثائق مشكلة رئيسية: كانت غالباً ما تحاول تجريد كل الصور والتخطيطات للاكتفاء بقراءة الكلمات فقط. كان الأمر يشبه محاولة فهم كتاب مصور عن طريق قراءة فقاعات الحوار فقط وتجاهل الرسومات؛ كنت ستفقد السياق، والنكات، وتحولات الحبكة.

ولإصلاح ذلك، يستخدم العلماء تقنية تسمى "التوليد المعزز بالاسترجاع" (Retrie-Augmented Generation - RAG). فكر في RAG كأنه أمين مكتبة ذكي جداً لا يكتفي بحفظ الكتب فحسب، بل يخرج ليبحث عن الصفحات الدقيقة التي تحتاجها قبل الإجابة على سؤالك. ومع ذلك، عندما تكون هذه "الكتب" عبارة عن وثائق بصرية فوضوية متعددة الصفحات، فإن أمناء المكتبة التقليديين غالباً ما يضلون الطريق. قد يلتقطون الصفحة الخطأ لأنهم نظروا فقط إلى النص، أو قد يفوتهم مخطط مهم لأنهم لم يعرفوا كيف "يرون" الصورة. السؤال الكبير هو: كيف نبني نظاماً يمكنه مطاردة الأدلة الصحيحة عبر عشرات الصفحات، ويمزج بين النص والصور بشكل مثالي، للإجابة على سؤال ما بشكل صحيح؟

إليك VLD-RAG، وهو إطار عمل جديد صُمم ليكون المحقق النهائي لهذه الوثائق البصرية الطويلة. أدرك الباحثون وراء هذا العمل أنه لكي تحل لغزاً ممتداً عبر 150 صفحة، لا يمكنك الاعتماد على حيلة واحدة فقط. بدلاً من ذلك، بنوا نظاماً "وكالياً" (agentic) — وهو عبارة عن فريق من المتخصصين في الذكاء الاصطناعي يعملون معاً. تخيل ثلاثياً من المحققين: أحدهم هو صائد الكلمات المفتاحية الذي يمسح الكلمات والأرقام الدقيقة؛ والآخر هو المحقق البصري الذي ينظر إلى "الانطباع العام" والتخطيط للصفحات؛ والثالث هو المتحقق الناقد الذي يراجع عملهم.

إليك كيف يعملون معاً. أولاً، يقوم النظام بتفكيك سؤالك إلى خطة. هو لا يسأل فقط: "ما هو الربح؟"، بل يسأل: "ابحث عن الجدول في القسم 3، وابحث عن المخطط الذي يحمل عنوان 'نتائج الربع الرابع'، وتحقق من النص للحصول على المبلغ المحدد بالدولار". بعد ذلك، ينطلق صائد الكلمات المفتاحية والمحقق البصري للبحث في الوثيقة في وقت واحد. يلتقط الصائد الصفحات التي تحتوي على الكلمات الصحيحة، بينما يلتقط المحقق البصري الصفحات التي تبدو وكأنها تحتوي على الإجابة، حتى لو كانت الكلمات مختلفة.

تحدث المعجزة عندما يقارنون ملاحظاتهم. إذا قال الصائد: "الصفحة 12 تبدو جيدة"، لكن المحقق البصري قال: "الصفحة 12 تبدو خاطئة تماماً"، فإن النظام لا يكتفي بالتخمين. بل يستخدم "فحص اتساق" خاص لإدراك أن هناك خطأ ما. إذا بدا الدليل ضعيفاً أو مفقوداً، يتدخل المتحقق الناقد ويقول: "مهلاً، لقد فاتنا شيء ما! دعونا نحاول طرح السؤال بطريقة مختلفة". هذا يؤدي إلى عملية بحث ثانية، مما يؤدي إلى تنقيح الأدلة حتى يجدوا الصفحات الصحيحة. أخيراً، يجمع النظام الأدلة — قصاصات من النصوص، وقصات من المخططات، وأرقام الصفحات — ويقدمها إلى "مولد" لكتابة الإجابة النهائية، مع التأكد من أن كل ادعاء مدعوم بالوثيقة الفعلية.

اختبر الباحثون هذا الفريق من المحققين في تحديين هائلين: MMLongBench-Doc و LongDocURL. هذه هي بمثابة "الأولمبياد" لقراءة الوثائق، حيث تحتوي على مئات الوثائق وآلاف الصفحات، وجداول معقدة، وأسئلة مخادعة. كانت النتائج مبهرة. لم يجد VLD-RAG الصفحات الصحيحة بشكل متكرر أكثر من الطرق السابقة فحسب، بل وجد المزيد من الصفحات الصحيحة. في اختبار LongDocURL، الذي يتميز بوثائق يبلغ متوسط طولها 85.6 صفحة، تمكن VLD-RAG من استرجاع صفحات الأدلة الصحيحة في 81.16% من الحالات عند النظر في أفضل 5 نتائج (Recall@5)، متفوقاً على جميع الطرق الأخرى. كما قام بترتيب الصفحات الأكثر صلة في مراتب أعلى من أي شخص آخر، مما يعني أن الإجابة كانت موجودة عادةً في أعلى القائمة.

تشير الورقة البحثية إلى أن هذا النجاح يأتي من عدم إجبار الكمبيوتر على الاختيار بين "القراءة" و"الرؤية". فمن خلال الحفاظ على التخطيط البصري والنص منفصلين ولكن يعملان معاً، ومن خلال السماح لوكلاء الذكاء الاصطناعي بمراجعة عمل بعضهم البعض، يتجنب النظام الأخطاء التي تحدث عندما تحاول تسطيح وثيقة غنية وملونة إلى نص بسيط. وبينما يشير الباحثون إلى أن هذا النهج مخصص تحديداً للوثائق التي تتوزع فيها المعلومات عبر صفحات متعددة، فإن النتائج تشير بقوة إلى أنه بالنسبة لهذه الألغاز المعقدة متعددة الصفحات، فإن فريقاً من الوكلاء المتخصصين والمدققين هو أفضل بكماً من البحث الفردي المنعزل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →