VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
تقترح الورقة البحثية EVisRAG، وهو إطار عمل موجه بالأدلة يعمل على الحد من الهلوسة البصرية في الاستنتاج متعدد الصور من خلال الجمع الصريح للأدلة البصرية ذات الصلة بالسؤال وتوظيف خوارزمية RS-GRPO مبتكرة لتحسين التحسين المشترك للتحديد والاستنتاج، مما يحقق مكاسب كبيرة في الأداء في معايير الإجابة على الأسئلة البصرية.
المؤلفون الأصليون:Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun
تخيل أنك تحاول حل لغز ما، ولكن بدلاً من خيط واحد، وُضعت أمامك كومة فوضوية من ثلاث صحف وصور وخرائط مختلفة. لديك محقق فائق الذكاء في جيبك — برنامج كمبيوتر يسمى "نموذج لغة-رؤية" (VLM) — يمكنه قراءة النصوص والنظر إلى الصور. هذا المحقق بارع في الإجابة على الأسئلة، ولكنه أحياناً، عندما يواجه كومة ضخمة من الصور، يصاب بالارتباك. قد يبدأ في اختلاق تفاصيل لم يرها، مثل الادعاء بأن الصورة تظهر قطة بينما هي في الواقع كلب، أو خلط الحقائق من صفحتين مختلفتين. يُسمى هذا "الهلوسة البصرية".
ولمساعدة هؤلاء المحققين، طور العلماء نظاماً يسمى "التوليد المعزز بالاسترجاع البصري" (VRAG). فكر في الأمر كأنك تمنح المحقق بطاقة مكتبة. عندما تطرح سؤالاً، يقوم النظام فوراً بسحب الصفحات الأكثر صلة من المكتبة ويقدمها للمحقق. الفكرة هي أنه إذا كان لدى المحقق الأدلة الصحيحة أمامه مباشرة، فلن يحتاج إلى التخمين أو اختلاق الأمور. ومع ذلك، حتى مع وجود الصفحات الصحيحة، غالباً ما يجد المحقق صعوبة في العثور على الجملة أو الصورة المحددة التي يحتاجها وسط الضجيج، أو قد يتشتت بتفاصيل غير ذات صلة ويستمر في اختلاق إجابة. السؤال الكبير هو: كيف نعلم المحقق ليكون محققاً حقيقياً يمسح كل صفحة بعناية، ويكتب فقط الحقائق التي يراها بالفعل، ثم يحل اللغز دون تخمين؟
هذا هو بالضبط ما تسعى ورقة "VisRAG2.0" (وتحديداً إطار عمل EVisRAG) لحله. يقترح المؤلفون، وهم فريق من الباحثين من جامعات صينية، طريقة جديدة لتدريب هؤلاء المحققين من الذكاء الاصطعي ليتوقفوا عن الهلوسة ويبدأوا في الاستنتاج بناءً على أدلة حقيقية. لقد وجدوا أن الأساليب السابقة كانت تشبه إعطاء المحقق كومة من الأوراق وقول: "فقط افهم الأمر!"، مما أدى غالباً إلى الارتباك. بدلاً من ذلك، يجبر EVisRAG النموذج على التصرف كمحقق دقيق يتبع عملية صارمة من ثلاث خطوات: الملاحظة، التسجيل، والاستنتاج.
أولاً، ينظر النموذج إلى الصور المسترجعة ويوضح صراحة ما يراه، صفحة تلو الأخرى. ثانياً، ينشئ "سجل أدلة"، حيث يكتب حقائق محددة من كل صورة، ومن المهم جداً، يلاحظ متى لا تحتوي الصورة على أي معلومات مفيدة. أخيراً، يستخدم السجل المكتوب فقط لحل المشكلة. وللتأكد من أن النموذج يتعلم هذا السلوك فعلياً، اخترع الباحثون طريقة تدريب جديدة تسمى RS-GRPO (تحسين السياسة الجماعية النسبية ذات النطاق المكافئ للمكافأة). يمكنك التفكير في هذا كمدرب صارم جداً لا يكتفي بإعطاء درجة للإجابة النهائية فحسب، بل يعطي درجات منفصلة لـ "هل نظرت إلى الصورة الصحيحة؟" وأخرى لـ "هل كتبت الحقيقة بشكل صحيح؟". هذا يمنع النموذج من الحصول على درجة جيدة لمجرد تخمين الإجابة الصحيحة بالصدفة، مما يضمن أنه يتعلم فعلياً إيجاد الأدلة أولاً.
النتائج لهذا النهج الجديد مثيرة للإعجاب حقاً. فعند اختباره على مختلف معايير الإجابة على الأسئلة البصرية (مثل قراءة الرسوم البيانية، والمستندات، والشرائح)، تفوق نموذج EVisRAG باستمرار على "النماذج الأساسية" بمتوسط دقة يصل إلى حوالي 19%. والأهم من ذلك، أنه قلل بشكل كبير من عدد المرات التي يخترع فيها النموذج حقائق. في اختبار محدد، قد ينظر نموذج قياسي إلى رسم بياني ويقول بثقة إن الدولة الخاطئة لديها عدد سكان أكبر لأنه هلوس برقم ما. ومع ذلك، فإن EVisRAG سينظر إلى الرسم البياني، ويكتب الأرقام الصحيحة في سجل الأدلة الخاص به، ثم يستنتج الإجابة الصحيحة.
كما تجادل الورقة ضد فكرة أن مجرد جعل النموذج "يفكر لفترة أطول" أو إضافة وكلاء أكثر تعقيداً إلى النظام هو الحل الأفضل. بدلاً من ذلك، يظهرون أن نهجاً مهيكلاً وموجهاً بالأدلة، مقترناً بطريقة تدريبهم الخاصة (RS-GRPO)، هو أكثر فعالية. لقد أثبتوا أنه من خلال تحديد نطاق المكافآت — أي منح الفضل للأفعال الصحيحة في الوقت الصحيح — يصبح النموذج أكثر استقراراً وموثوقية. وبينما لا تدعي الورقة أنها تحل كل المشكلات الممكنة في الذكاء الاصطناعي، إلا أن التجارب تشير إلى أن هذه الطريقة تمثل خطوة كبيرة للأمام في جعل أنظمة الذكاء الاصطناعي البصرية أكثر موثوقية، ودقة، وأقل عرضة لاختلاق الأمور عند النظر إلى صور متعددة.
ملخص تقني: VisRAG2.0 (EVisRAG)
بيان المشكلة
يهدف التوليد المعزز بالاسترجاع البصري (VRAG) إلى تزويد نماذج اللغة الرؤية (VLMs) بأدلة بصرية خارجية للإجابة على الأسئلة التي تتجاوز المعرفة البارامترية. ومع ذلك، تواجه أساليب VRAG الحالية تحديات كبيرة في بيئات الصور المتعددة:
الهلوسة البصرية: غالبًا ما تفشل نماذج اللغة الرؤية في تحديد الأدلة ذات الصله بالسؤال بدقة عبر الصور المسترجعة المتعددة، مما يؤدي إلى إجابات خاطئة أو اختلاق محتوى بصري غير موجود.
الافتقار إلى جمع الأدلة الصريح: تعتمد الطرق الحالية غالبًا على نقل ممارسات RAG القائمة على النصوص إلى المجال البصري دون عملية صريحة لجمع الأدلة عبر الصور. وهي تعتمد على وكلاء أو أدوات خارجية، مما يزيد من التعقيد الهيكلي والتكلفة الحسابية.
عدم استقرار التدريب: يؤدي تحسين الإدراك البصري والاستدلال بشكل مشترك باستخدام مكافآت مختلطة إلى تدريب غير مستقر. كما أن غياب التخصيص الواضح للائتمان (credit assignment) يسبب تداخلًا بين الإشارات، حيث تتنافس التدرجات من الأهداف غير المتجانسة عبر الرموز (tokens) غير ذات الصلة.
المنهجية: EVisRAG
يقترح المؤلفون EVisRAG (التوليد المعزز بالاسترجاع البصري الموجه بالأدلة)، وهو إطار عمل مصمم لتمكين نماذج اللغة الرؤية من إجراء إدراك واستدلال بصري دقيق عبر صور متعددة.
1. عملية الاستدلال الموجهة بالأدلة
يهيكل EVisRAG عملية التوليد إلى أربع مراحل متميزة، متجاوزًا سلسلة الأفكال (CoT) القياسية من خلال الفصل الصريح بين الملاحظة، وتسجيل الأدلة، والاستدلال:
الاسترجاع (Retrieval): يسترجع لقطات صفحات المستندات الـ k الأولى ذات الصلة بالاستعلام.
تسجيل الأدلة (Evidence Recording): بناءً على الاستعلام والملاحظات، يولد النموذج تسلسلات أدلة لكل صورة (ye). ومن الأهمية بمكان أنه يسجل صراحةً "لا توجد معلومات ذات صلة" للصور التي تفتقر إلى الأدلة، مما يمنع النموذج من فرض تفاصيل غير ذات صلة في عملية الاستدلال.
استدلال الإجابة (Answer Reasoning): يقوم النموذج بعملية استدلال "بأسلوب المحقق" (yr) فوق الأدلة المجمعة (yp={yo,ye})، حيث يصيغ الفرضيات، ويتحقق من التناقضات، وينظم مسارًا متماسكًا قبل توليد الإجابة النهائية (ya).
2. تحسين السياسة النسبي المخصص للنطاق (RS-GRPO)
لتدريب EVisRAG بفعالية، قدم المؤلفون RS-GRPO، وهو امتداد لتحسين السياسة النسبي للمجموعات (GRPO) يعالج مشكلة تخصيص الائتمان في الاستدلال متعدد المراحل.
نطاقات المكافأة (Reward Scopes): يتم تقسيم تسلسل المخرجات إلى أربعة نطاقات: الملاحظة (To)، تسجيل الأدلة (Te)، الاستدلال (Tr)، والإجابة (Ta).
المكافآت الدقيقة (Fine-Grained Rewards): يتم تطبيق ثلاث مكافآت محددة:
مكافأة التنسيق (Rformat): تفرض الالتزام بسير العمل الهيكلي (ملاحظة ← تسجيل ← استدلال ← إجابة).
مكافأة الإدراك (Rperception): تقيم ما إذا كانت المناطق ذات الصلة بالسؤال قد تم تحديدها وتلخيصها بشكل صحيح في مرحلة تسجيل الأدلة.
مكافأة الاشتقاق (Rderivation): تقيم ما إذا كانت الإجابة النهائية قد اشتُقت بشكل صحيح من الأدلة المسجلة.
التحسين المخصص للنطاق (Scoped Optimization): على عكس الطرق التقليدية التي تبث المكافآت عبر التسلسل بأكمله، يقيّد RS-GRPO كل مكافأة بنطاق الرموز الفعال الخاص بها (على سبيل المثال، Rperception يشرف فقط على To و Te). وهذا يقلل من التداخل بين المراحل، ويشحذ إشارات التحسين، ويجعل التدريب أكثر استقرارًا.
المساهمات الرئيسية
إطار عمل EVisRAG: بنية مبتكرة تفصل صراحةً بين جمع الأدلة البصرية والاستدلال، مما يمكن نماذج اللغة الرؤية من العمل مثل "المحققين" عبر جمع والتحقق من الأدلة صورة تلو الأخرى قبل الوصول إلى الاستنتاج.
خوارزمية RS-GRPO: استراتيجية تدريب تقدم مكافآت مخصصة للنطاق لمواءمة إشارات المكافأة مع نطاقات رموز محددة. وهذا يخفف من التداخل بين أهداف الإدراك والاستدلال، مما يؤدي إلى تحسين أكثر استقرارًا وفعالية للعمليات المشتركة.
تقييم شامل: تجارب واسعة النطاق عبر خمسة معايير متنوعة لمهام السؤال والجواب البصري (ChartQA, InfoVQA, DocVQA, SlideVQA, ViDoSeek) تثبت فعالية النهج.
النتائج التجريبية
مكاسب الأداء: يتفوق EVisRAG (باستخدام نموذج خلفي بقوة 7 مليار معلمة) باستمرار على النموذج المرجعي Qwen2.5-VL-7B بمتوسط 19% في الدقة و 27% في مقياس F1. كما يتفوق على النماذج الأكبر حجمًا (32 مليار معلمة) وعلى أساليب VLRM و VRAG المتطورة الأخرى.
تقليل الهلوسة: يقلل إطار العمل بشكل كبير من الهلوسة البصرية. في السيناريوهات التي يكون فيها الاسترجاع غير صحيح، يظهر EVisRAG زيادة منضبطة في الامتناع (رفض الإجابة) بدلاً من توليد إجابات خاطئة، مما يشير إلى تحسن في الأمانة تجاه المحتوى المسترجع.
دراسات الاستئصال (Ablation Studies):
استبدال سلسلة الأفكار (CoT) العامة باستدلال موجه بالأدلة يحقق مكاسب ثابتة، مما يثبت قيمة تحديد الأدلة الهيكلية.
يتفوق RS-GRPO على DAPO و StepGRPO، مما يؤكد أن تخصيص الائتمان المخصص للنطاق أمر بالغ الأهمية للأداء.
تحليل الانتباه: يحقق EVisRAG أعلى نسبة انتباه للأدلة البصرية (التركيز على صناديق الأدلة الموضحة بشريًا) مقارنة بالطرق الأخرى، وهو ما يرتبط بقوة بدقة الاستدلال العالية.
الكفاءة: رغم تعدد مراحل التوليد، يحافظ EVisRAG على زمن انتقال استدلال تنافسي (حوالي 100 ثانية) وطول مخرجات مستقر، متفوقًا على النماذج المرجعية مثل R1-Router التي تتكبد تكاليف حسابية أعلى مقابل دقة أقل أو مماثلة.
الأهمية
يزعم البحث أن جمع الأدلة الصريح و تصميم المكافأة المخصص للنطاق هما آليتان فعالتان لتحسين التأسيس البصري وموثوقية الاستدلال في بيئات الصور المتعددة. من خلال فصل الإدراك عن الاستدلال وتطبيق الإشراف المستهدف، يعالج EVisRAG الأسباب الجذرية للهلوسة البصرية في VRAG. يوضح هذا العمل أن نموذجًا بقوة 7 مليار معلمة مجهز بهذا الإطار يمكنه تجاوز أداء النماذج الأكبر حجمًا بكثير، مما يوفر مسارًا عمليًا وقابلًا للتوسع نحو أنظمة توليد معززة بالاسترجاع البصري أكثر موثوقية، وقابلية للتفسير، ومقاومة للهلوسة.