MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning
تقترح الورقة البحثية MCite-RL، وهو إطار عمل للتعلم التعزيزي الوكيل المعزز بالاستشهادات، والذي يعمل على تحسين موثوقية أنظمة التوليد المعزز بالاسترجاع (RAG) متعددة الوسائط من خلال إدخال وحدة صقل وكيلية تكرارية للاستشهاد البصري الديناميكي وآلية مكافأة ثنائية المستوى لتحسين دقة الإجابة وقابلية تتبع المصدر بشكل مشترك.
المؤلفون الأصليون:Suifeng Zhao, Zida Liu, Xinyu Lei, Lei Sun, Jun Gao, Sujian Li
في العصر الرقمي الحديث، تعلم الذكاء الاصطناعي قراءة النصوص والنظر إلى الصور بمهارة ملحوظة. وعندما تُوجَّه لهذه الأنظمة أسئلة معقدة، فإنها غالباً ما تلجأ إلى مكتبة من الوثائق لإيجاد الإجابة الصحيحة، وهي عملية تُعرف باسم "التوليد المعزز بالاسترجاع". تخيل أنك تسأل أمين مكتبة عن حقيقة محددة؛ فيجد أمين المكتبة الكتاب، ويقرأ الصفحة، ثم يخبرك بالإجابة. لسنوات، عمل هذا النظام بشكل جيد مع النصوص وحدها. ومع ذلك، مع ازدياد تطور نماذج الذكاء الاصطناعي هذه، بدأت في التعامل مع وثائق مليئة بالمخططات والرسوم البيانية والصور الفوتوغرافية. التحدي الآن لا يقتصر فقط على إيجاد الصفحة الصحيحة، بل في الإشارة بدقة إلى البقعة المحددة في تلك الصفحة — الجزء الصغير من رسم بياني أو صندوق صغير في صورة — الذي يثبت صحة الإجابة. وبدون هذه القدرة على الإشارة إلى الدليل، يكون النظام مثل طالب يعطي الإجابة الصحيحة في الاختبار ولكنه لا يستطيع إظهار خطوات عمله، مما يترك المعلم غير قادر على التحقق مما إذا كان الطالب قد فهم المادة حقاً أم أنه مجرد خمن الإجابة.
لقد طور فريق من الباحثين من جامعة بكين وشركة باناسونيك كونكتت (Panasonic Connect) طريقة جديدة لحل مشكلة "إظهار خطوات العمل" هذه في العالم المرئي. وقد أطلقوا على نظامهم اسم MCite-RL. الفكرة الجوهرية هي تعليم الذكاء الاصطناعي ليس فقط إيجاد الإجابة، بل معاملة عملية البحث عن الدليل كتحقيق دقيق وخطوة بخطوة. فبدلاً من التخمين لموقع الدليل في نظرة واحدة سريعة، يتم تدريب النظام ليعمل مثل محقق يقوم بالتقريب (zoom in) على وثيقة، ويقص الأجزاء غير ذات الصلة، ويضيق نطاق البحث حتى لا يتبقى سوى قطعة المعلومات الحاسمة. وتتم عملية التوجيه هذه عبر نوع جديد من التعلم حيث يتلقى الذكاء الاصطناعي تعليقات (feedback) ليس فقط على ما إذا كانت الإجابة النهائية صحيحة، بل أيضاً على مدى جودة تحديد موقع الدليل المرئي على طول الطريق.
وجد الباحثون أن الطرق السابقة غالباً ما كانت تفشل بطريقتين محددتين. فأحياناً، كان الذكاء الاصطناعي يشير إلى صورة كبيرة جداً، تغطي مخططاً كاملاً بدلاً من الرقم الوحيد المطلوب، مما يجعل الاستشهاد عديم الفائدة للتحقق. وفي أحيان أخرى، كان الذكاء الاصطناعي يعطي إجابة صحيحة ولكنه يشير إلى جزء مختلف تماماً من الصورة، كما لو كانت الإجابة والدليل منفصلين. ولإصلاح ذلك، ابتكر الفريق عملية تدريب تجمع بين مرحلة "البداية الباردة" (cold start)، حيث يتعلم الذكاء الاصطناعي الخطوات الأساسية للبحث وقص الصور، ومرحلة التعلم المعزز. في هذه المرحلة الثانية، يلعب الذكاء الاصطناعي العديد من السيناريوهات المختلفة، محاولاً إيجاد الإجابة والدليل. فإذا نجح في تضييق نطاق الصورة إلى المكان الصحيح وحصل على الإجابة الصحيحة، فإنه يتلقى مكافأة. وإذا ضل طريقه أو أشار إلى منطقة خاطئة، فإنه يتعلم من خطئه.
تم اختبار نتائج هذا النهج على ثلاث مجموعات مختلفة من الوثائق الصعبة، بما في ذلك التقارير المالية وصفحات ويكيبيديا الطويلة. وقد تفوق النظام الجديد بشكل كبير على الطرق الحالية. وفي أحد الاختبارات الرئيسية، حسن دقة الإشارة إلى الدليل المرئي الصحيح بأكثر من 26 بالمائة مقارنة بالطرق القياسية. ولعل الأمر الأكثر إثارة للدهشة هو أنه من خلال إجبار الذكاء الاصطناعي على أن يكون دقيقاً بشأن مكان وجد المعلومات، أصبح النظام أيضاً أفضل في الحصول على الإجابة الفعلية الصحيحة، حيث ارتفعت الدقة بنسبة تقارب 6 بالمائة في المتوسط. وتشير الدراسة إلى أنه عندما يتم تدريب الذكاء الاصطناعي ليكون صارماً بشأن مصادره، فإنه يصبح أكثر موثوقية بشكل عام. ويشير الباحثون إلى أنه بينما يعد هذا النظام خطوة كبيرة للأمام، فإنه لا يزال يتطلب إشرافاً بشرياً دقيقاً، خاصة في المواقف عالية المخاطر، وهو يعمل حالياً بشكل أفضل مع الصور المنفردة بدلاً من الوثائق المعقدة متعددة الصفحات. وفي نهاية المطاف، يوضح هذا العمل أن تعليم الذكاء الاصطناعي كيفية الإشارة إلى أدلته ليس مجرد وسيلة للتحقق من عمله، بل هو أداة قوية لمساعدته على التفكير بوضوح أكبر.
ملخص تقني: MCite-RL
بيان المشكلة تهدف أنظمة الاسترجاع المعزز بالتوليد متعدد الوسائط (Multimodal RAG) إلى تعزيز إمكانية التتبع والتحقق في النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) من خلال ربط الإجابات المولدة بالأدلة المرئية. ومع ذلك، تواجه النهج الحالية، لا سيما تلك التي تعتمد على الضبط الدقيق الخاضع للإشراف (SFT) أو مسارات RAG الثابتة، قصورين حرجين:
الاستشهاد المرئي غير الدقيق: تفشل النماذج غالبًا في تحديد موقع الأدلة بالدقة المناسبة، حيث تنتج صناديق إحاطة (bounding boxes) تكون إما فضفاضة جدًا (تغطي مناطق غير ذات صلة) أو دقيقة جدًا (تفتقر إلى التفاصيل الرئيسية)، مما يؤدي إلى انزياح مكاني.
الانفصال بين الإجابة والاستشهاد: يوجد غالبًا عدم توافق بين الإجابة المولدة والمنطقة المرئية المستشهد بها. قد تولد النماذج إجابة صحيحة بناءً على استدلالها الداخلي ولكنها تستشهد بمنطقة مرئية من سياق مختلف تمامًا، مما يقوض موثوقية النظام.
تعامل الطرق الموجودة التأسيس المرئي (visual grounding) كعملية ثابتة أحادية الخطوة أو كإشارة وسيطة ضمنية، وتفتقر إلى عملية الصقل التكراري والتحسين الصريح اللازمين للاستشهاد الدقيق والموثوق في الوثائق متعددة الوسائط المعقدة.
المنهجية: MCite-RL يقترح المؤلفون MCite-RL، وهو إطار عمل للتعلم التعزيزي المعزز بالاستشهاد (citation-enhanced agentic reinforcement learning) مصمم لتحسين دقة الإجابة وتتبع المصدر بشكل مشترك. يتكون الإطار من مكونين أساسيين:
سير عمل الصقل الوكيل (Agentic Refinement Workflow):
بدلاً من التوليد أحادي الخطوة، يعمل النموذج كوكيل ينفذ مسار اتخاذ قرار متسلسل (τ).
تتضمن العملية الاسترجاع التكراري والقص المرئي التدريجي. يتنقل الوكيل بين استرجاع الصور ذات الصلة وتقليم المناطق المرئية غير ذات الصلة لتضييق نطاق البحث.
يحول هذا المسار الديناميكي الاستشهاد من خطوة ثابتة إلى حلقة استدلال مدفوعة بالأدلة، مما يسمح للنموذج بالتقارب التدريجي نحو المنطقة المرئية المثلى (v^cT) قبل توليد الإجابة والاستشهاد النهائيين معًا.
آلية مكافأة معززة بالاستشهاد:
يستخدم الإطار دالة مكافأة مركبة R(τ) تدمج التغذية الراجعة على مستوى العملية وعلى مستوى النتيجة ضمن نموذج تعلم تعزيزي (تحديدًا باستخدام تحسين السياسة النسبي الجماعي - GRPO).
مكافأة مستوى العملية (Rcitproc): تستخدم مقياس "التقاطع مع الحقيقة الأرضية" (IoGT) لتقييم عمليات القص الوسيطة. هذا يحفز الوكيل على الحفاظ على الأدلة الجوهرية طوال عملية التقليم، مما يمنع فقدان المعلومات أثناء البحث.
مكافأة مستوى النتيجة (Rcitout): تستخدم مقياس "التقاطع فوق الاتحاد" (IoU) لتقييم الاستشهاد المتوقع النهائي مقابل الحقيقة الأرضية، مما يضمن تحديد الموقع بدقة.
مكافآت إضافية: تتضمن الدالة أيضًا كفاءة الاسترجاع (nDCG)، ودقة الإجابة (المطابقة التامة)، وقيود التنسيق لضمان مسارات وكيل صالحة.
مسار التدريب يتبع التدريب عملية من مرحلتين:
البداية الباردة بالضبط الدقيق (SFT Cold-Start): يتم أولاً ضبط النموذج بدقة على بيانات اصطناعية تحتوي على مسارات وكيل خطوة بخطوة (استرجاع، قص، إجابة) تم إنشاؤها بواسطة GPT-5. يؤدي هذا إلى إنشاء سياسة أساسية وتعريف النموذج بالتسلسل الهيكلي المطلوب.
التعلم التعزيزي المعزز بالاستشهاد: يخضع النموذج الذي تم ضبطه عبر SFT لتدريب التعلم التعزيزي باستخدام GRPO. يقوم الوكيل بتوليد عمليات تشغيل متعددة، ويتم تحديث السياسة بناءً على المكافآت المعززة بالاستشهاد، مما يحسن مباشرة كلاً من دقة الاستشهاد وصحة الإجابة.
المساهمات الرئيسية
الإطار: تقديم MCite-RL، الذي يدمج سير العمل الوكيل مع التعلم التعزيزي المعزز بالاستشهاد لمعالجة فجوة الموثوقية في RAG متعدد الوسائط.
تصميم سير العمل: آلية صقل وكيل مبتكرة للاستشهاد المرئي تستخدم صقل الأدلة التكراري لمواءمة الإجابات والاستشهادات ضمن عملية استدلال مشتركة.
دالة المكافأة: تطوير دالة مكافأة متعددة المستويات تعمل صراحةً على تحسين دقة الاستشهاد (على مستويي العملية والنتيجة) جنبًا إلى جنب مع دقة الإجابة، ومعاملة الاستشهاد كهدف أساسي وليس مجرد ناتج ثانوي.
التحقق التجريبي: تقييم واسع النطاق أظهر أن الإشراف الصريح على الاستشهاد يدفع التحسينات في كل من دقة الاستشهاد وجودة الإجابة.
النتائج التجريبية قيم المؤلفون MCite-RL على ثلاثة معايير مرجعية: Wiki-VISA، وFinRAGBench-V، وMMLongBench-Doc، باستخدام نماذج خلفية من نوع Qwen2.5-VL (3B و 7B).
دقة الاستشهاد: حقق MCite-RL تحسينات كبيرة مقارنة بالنماذج المرجعية. في نموذج Qwen2.5-VL-7B، حسن مقياس التقاطع فوق الاتحاد (IoU) بمتوسط 26.16% مقارنة بـ RAG التقليدي. وتحديدًا، وصل إلى دقة استشهاد بلغت 36.05% في Wiki-VISA و 37.22% في FinRAGBench-V، متفوقًا على نماذج قوية مثل VRAG-RL والنماذج المملوكة لشركات (مثل GPT-4o و Gemini-2.0).
دقة الإجابة: أدى دمج مكافآت الاستشهاد إلى زيادة متزامنة في دقة الإجابة. بالنسبة لنموذج 7B، حقق MCite-RL دقة بنسبة 60.00% في Wiki-VISA، بزيادة قدرها 4-6% عن النماذج المرجعية القوية السابقة.
دراسات الاستبعاد (Ablation Studies): أدى إزالة مرحلة التعلم التعزيزي أو مكافآت الاستشهاد إلى تدهور كبير في الأداء، مما يؤكد أن تحسين المكافآت الاستراتيجي هو المحرك الرئيسي للنجاح. كما أشارت الدراسة إلى أن مكافآت مستوى النتيجة ضرورية لمنع عمليات القص الواسعة للغاية، بينما تضمن مكافآت مستوى العملية الحفاظ على الأدلة.
الأهمية والادعاءات يزعم البحث أن MCite-RL يوفر حلاً نظاميًا لتحدي RAG متعدد الوسائط الموثوق من خلال إثبات أن تحسين دقة الاستشهاد صراحةً على مستوى الهدف أمر بالغ الأهمية. ويرى المؤلفون أن التعلم التعزيزي المعزز بالاستشهاد لا يحسن موثوقية المخرجات فحسب، بل يعزز أيضًا جودة الإجابة من خلال إجبار النموذج على ربط استدلاله بأدلة مرئية دقيقة ومشتركة. يسلط العمل الضوء على أن RAG متعدد الوسائط الموثوق يتطلب ما هو أكثر من مجرد إجابات دقيقة؛ فهو يتطلب تحديد موقع دقيق للأدلة ومواءمة متسقة بين الإجابة والاستشهاد، وهو ما يمكن تحقيقه من خلال الصقل الوكيل التكراري والإشراف متعدد المستويات للمكافآت.
القيود يقر المؤلفون بأن عملية التدريب الحالية تفرض عبئًا حسابيًا إضافيًا، وأن الصيغة تقتصر على الاستشهادات القائمة على صناديق الإحاطة (bounding-box) في الصور الفردية، دون نمذجة صريحة لهياكل استشهاد أكثر تعبيرًا. كما أشاروا إلى أنه بينما يحسن النظام إمكانية التتبع، فإنه لا يضمن الصحة الواقعية للمحتوى المسترجع نفسه.