RVR: Retrieve-Verify-Retrieve for Comprehensive Question Answering
تقدم هذه الورقة إطار عمل "الاسترجاع-التحقق-الاسترجاع" (RVR)، وهو إطار عمل متعدد الجولات يعمل على تعزيز الاستعلامات بشكل تكراري بوثائق تم التحقق منها لتعظيم التغطية الشاملة للإجابة، مما يظهر تحسينات كبيرة في الاستدعاء مقارنة بالنماذج المرجعية الحالية عبر مجموعات بيانات متنوعة.
تخيل أنك محقق تحاول حل لغز، لكن هذا اللغز له عديد من الإجابات الصحيحة، وليس إجابة واحدة فقط. على سبيل المثال، السؤال ليس "من قتل الخادم؟" (إجابة واحدة)، بل هو "اذكر كل شخص كان في الغرفة وقت وقوع الجريمة".
إذا سألت محرك بحث سؤالاً واحداً فقط ونظرت إلى أفضل 5 نتائج، فقد تفوتك نصف المشتبه بهم. أنت بحاجة لتكون دقيقاً وشاملاً.
تقدم هذه الورقة طريقة جديدة تسمى RVR (الاسترجاع-التحقق-الاسترجاع). فكر في الأمر كعملية استقصائية ذكية مكونة من ثلاث خطوات تضمن لك العثور على كل المتورطين، وليس فقط الأكثر وضوحاً منهم.
إليك كيف يعمل الأمر، باستخدام تشبيه بسيط:
المشكلة: البحث بـ "المرة الواحدة"
محركات البحث التقليدية تشبه المسح لمرة واحدة. تطرح سؤالاً، فتعطيك قائمة من المستندات، ثم تتوقف.
العيب: إذا كان للسؤال 10 إجابات صحيحة، فقد يجد البحث القياسي أكثر 3 إجابات شعبية فقط ويتجاهل السبع الأخرى. إنه يشبه المحقق الذي يكتفي باستجواب أول ثلاثة أشخاص يراهم ويفترض أن لديهم القصة كاملة.
حل RVR: حلقة المحقق
يعمل إطار عمل RVR مثل فريق من ثلاثة متخصصين يعملون في حلقة مستمرة:
1. الكشاف الأولي (الاسترجاع - Retrieve)
الدور: الشخص الأول الذي يبحث عن الأدلة.
الإجراء: يأخذ سؤالك ويجري بحثاً قياسياً. ثم يحضر كومة من المستندات.
التشبيه: تخيل كشافاً يركض إلى غرفة مزدحمة ويمسك بأول 10 أشخاص يراهم ويبدو عليهم أنهم قد يكونون مشتبه بهم.
2. المفتش الصارم (التحقق - Verify)
الدور: خبير مراقبة الجودة.
الإجراء: ينظر هذا الشخص (وهو ذكاء اصطناعي) إلى الـ 10 أشخاص الذين أحضرهم الكشاف. ويسأل: "هل لدى هذا الشخص حقاً دليل؟ أم أنه يقف هناك فحسب ليبدو مشغولاً؟"
الفلتر: يقوم برمي الأشخاص غير ذوي الصلة ويحتفظ فقط بمن لديهم معلومات مؤكدة.
التشبيه: المفتش يفحص هويات الـ 10 أشخاص. يدرك أن 3 منهم مجرد سياح. فيحتفظ بالـ 7 مشتبه بهم الحقيقيين ويرمي السياح.
3. المتابعة الذكية (الاسترجاع مرة أخرى - Retrieve Again)
الدور: المحقق الذي يعرف ما الذي وجده بالفعل.
الإجراء: هذه هي الخطوة السحرية. بدلاً من طرح نفس السؤال على محرك البحث مرة أخرى، يقول المحقق: "حسناً، أنا أعرف بالفعل عن المشتبه بهم أ، ب، وج. الآن، اذهب وابحث عن المشتبه بهم المفقودين الذين ليسوا في قائمتي بعد."
الحيلة: يقوم بتغذية قائمة "المشتبه بهم المؤكدين" مرة أخرى في محرك البحث كـ "سياق". هذا يخبر المحرك: "لا تعطيني ما لدي بالفعل؛ ابحث لي عن البقية".
التشبيه: يعود المحقق إلى الغرفة ويقول: "لقد تحدثت إلى هؤلاء الثلاثة بالفعل. من أيضاً يختبئ في الظلال ولم أقابله بعد؟"
لماذا هذا أفضل؟
البحث القياسي: يجد "الثمار الدانية" (الإجابات السهلة) ثم يتوقف.
RVR: يستمر في العمل حتى تمتلئ السلة. إنه يبحث تحديداً عما فاته في الجولة الأولى.
النتائج
اختبر الباحثون هذا النظام على مجموعة بيانات تسمى QAMPARI، وهي مليئة بالأسئلة التي لها إجابات متعددة (مثل "اذكر جميع المخرجين للأفلام التي أنتجها إريك نيومان").
النجاح: وجد نظام RVR عدداً أكبر بكثير من الإجابات الصحيحة مقارنة بمحركات البحث القياسية أو حتى أنظمة "الوكيل الذكي" (AI Agent) المتقدمة التي تحاول إعادة كتابة أسئلتها الخاصة.
الكفاءة: لم يستغرق وقتاً طويلاً. لقد كان أسرع بكثير من "الوكلاء الأذكياء" الذين يستمرون في طرح أسئلة جديدة عشوائية، لأن RVR محدد للغاية؛ فهو يعرف بالضبط ما الذي ينقصه.
"الخلطة السرية"
تذكر الورقة أيضاً أنهم قاموا بتدريب "المحقق المتابع" (المسترجع الثاني) خصيصاً للبحث عن القطع المفقودة من اللغز، بدلاً من مجرد البحث عن أي قطعة ذات صلة. هذا التدريب يجعل النظام أكثر ذكاءً في ملء الفجوات.
باختصار
RVR يشبه الشبكة الذكية.
ألقِ الشبكة (البحث الأول).
افحص ما اصطدته (التحقق مما حصلت عليه).
ألقِ الشبكة مرة أخرى، ولكن هذه المرة، استهدف تحديداً الأسماك التي سبحت بعيداً (البحث الثاني بناءً على ما اصطدته بالفعل).
هذا يضمن أنك لا تحصل فقط على بعض الإجابات، بل تحصل على القائمة الشاملة لكل ما هو موجود.
إليك ملخص تقني مفصل لورقة البحث بعنوان "RVR: Retrieve-Verify-Retrieve for Comprehensive Question Answering".
1. بيان المشكلة
تتناول الورقة تحدي الاسترجاع الشامل في مجال الإجابة على الأسئلة مفتوحة النطاق (Open-domain QA). وخلافًا لمهام الاسترجاع القياسية التي تبحث عن إجابة "ذهبية" واحدة، فإن العديد من الاستعلامات في العالم الحقيقي تقبل مجموعة واسعة من الإجابات الصالحة (مثل: "من هم مخرجو الأفلام التي أنتجها إريك نيومان؟").
الفجوة: غالبًا ما تفشل أنظمة الاسترجاع التقليدية، وحتى أنظمة البحث "الوكيلة" (Agentic) الحديثة، في استرجاع جميع المستندات الصالحة لاستعلام واحد. فهي تميل إلى التوقف بعد العثور على أول بضعة مستندات ذات صلة، أو تركز على الاستنتاج متعدد الخطوات (سلسلة الاستعلامات) بدلاً من التغطية الشاملة لمساحة الإجابة لاستعلام واحد.
الهدف: تعظيم تغطية الإجابة (Recall) عبر استرجاع مجموعة متنوعة من المستندات التي تحتوي على جميع الإجابات الممكنة الصالحة، بدلاً من مجرد البحث عن أكثر مستند ذي صلة.
2. المنهجية: الاسترجاع-التحقق-الاسترجاع (RVR)
يقترح المؤلفون إطار عمل RVR، وهو إطار استرجاع متعدد الجولات مصمم للكشف عن الإجابات المفقودة بشكل تكراري. تتكون العملية من ثلاثة مكونات رئيسية:
أ. سير عمل الإطار
الاسترجاع الأولي (fi): يقوم مسترجع أولي بأخذ الاستعلام الأصلي q ويعيد مجموعة مرشحة من المستندات.
التحقق (g): يقوم نموذج تحقق (نموذج لغوي كبير LLM) بفحص المستندات المسترجعة لتحديد مجموعة فرعية عالية الجودة (Dv) تحتوي بالفعل على إجابات صالحة. هذا يعمل على تصفية الضجيج والمستندات غير ذات الصلة.
الاسترجاع اللاحق (fr): يتم تعزيز الاستعلام عن طريق دمج الاستعلام الأصلي مع نص المستندات التي تم التحقق منها من الجولة السابقة. يتم تغذية هذا السياق الجديد الواعي بالاستعلام (qr) إلى مسترجع لاحق.
الابتكار الرئيسي: يتم تدريب المسترجع اللاحق للبحث عن مستندات تكون تكميلية للمستندات التي تم التحقق منها بالفعل، وتستهدف تحديدًا الإجابات التي لم يتم تغطيتها بعد.
التكرار والتجميع: تتكرر هذه العملية لـ T من الجولات. المخرج النهائي هو اتحاد جميع المستندات التي تم التحقق منها ومجموعة الاسترجاع النهائية، مع إزالة التكرار والترتيب.
ب. استراتيجية التدريب
المسترجع الأولي (fi): يتم تدريبه باستخدام التعلم التبايني القياسي (Contrastive Learning) على الاستعلام والمستندات الذهبية.
المسترجع اللاحق (fr): يتم تدريبه على مجموعة بيانات اصطناعية ناتجة عن إجراء الاستدلال الخاص بـ RVR.
المدخلات: الاستعلام + السياق (مجموعة فرعية من المستندات الذهبية التي تم التحقق منها سابقًا).
الهدف: المستندات الذهبية التي لم تكن موجودة في السياق (أي الإجابات المفقودة).
الهدف التعليمي: يتعلم النموذج كيفية التفكير فيما ينقص المعلومات بناءً على السياق الحالي، بدلاً من مجرد المطابقة مع الاستعلام.
التحقق: يستخدم نماذج لغوية كبيرة جاهزة (مثل Qwen3) مع توجيهات (Prompts) للتحقق مما إذا كان المستند يحتوي على إجابة مباشرة للاستعلام. لا يتم إجراء أي ضبط دقيق (Fine-tuning) للمتحقق.
3. المساهمات الرئيسية
إطار عمل مبتكر: تقديم RVR، وهو إطار عمل يربط صراحةً جولات الاسترجاع اللاحقة بالأدلة التي تم التحقق منها من الجولات السابقة لتعظيم تغطية الإجابة.
تكييف المسترجع: يوضح أن الضبط الدقيق للمسترجعات خصيصًا لهذا "سيناريو الاستدلال التكراري" (حيث يتضمن المدخل السياق السابق) يحقق مكاسب كبيرة مقارنة بالضبط الدقيق القياسي أو النماذج الجاهزة.
التفوق على البحث الوكيل (Agentic Search): يظهر أنه بينما يعد البحث الوكي (الذي تولد فيه النماذج اللغوية الكبيرة استعلامات جديدة) فعالاً للاستنتاج متعدد الخطوات، فإنه أقل فعالية في التغطية الشاملة للاستعلام الواحد. يتفوق RVR على النماذج الوكيل المرجعية من خلال التركيز على قدرة نموذج الاسترجاع على إيجاد المستندات المفقودة بدلاً من الاعتماد على النموذج اللغوي الكبير لصياغة مصطلحات بحث جديدة.
تكامل التحقق: دمج عملية التحقق داخل حلقة الاسترجاع (لتوجيه الاسترجاع التالي) بدلاً من كونها مجرد فلتر لاحق.
4. النتائج التجريبية
تم تقييم الطريقة على QAMPARI (معيار استرجاع متعدد الإجابات) وتم تعميمها على QUEST و WebQuestionsSP.
الأداء على QAMPARI:
حقق RVR زيادة نسبية قدرها 10% وزيادة مطلقة قدرها 3% في نسبة الاستدعاء الكامل (MRecall@100) مقارنة بالنماذج المرجعية القوية، بما في ذلك المسترجعات التي خضعت للضبط الدقيق وأنظمة البحث الوكيل (Tongyi DeepResearch, SearchR1).
استخدام المسترجعات اللاحقة (fr) التي خضعت للضبط الدقيق قدم أفضل النتائج، متفوقًا حتى على "النموذج المثالي" (Oracle - المتحقق المثالي) في بعض التكوينات عند دمجه مع نماذج أساسية قوية.
التعميم:
أظهر RVR تحسينات ثابتة على مجموعات البيانات خارج النطاق (QUEST و WebQuestionsSP)، حتى عند استخدام مسترجعات جاهزة للجولة الأولى.
الكفاءة:
يعد RVR أكثر كفاءة بكثير من النماذج الوكيل المرجعية. تتطلب الأنظمة الوكيل حوالي 15 استدعاءً للبحث ومئات الثواني لكل استعلام، بينما استخدم RVR استدعاءي استرجاع فقط وحوالي 5-8 ثوانٍ (اعتمادًا على ميزانية المتحقق).
دراسات الاستئصال (Ablation Studies):
تأثير المتحقق: أدى استخدام متحقق "مثالي" (معرفة كاملة بالإجابات الذهبية) إلى تعزيز الأداء بشكل كبير، مما يشير إلى أن نماذج التحقق الأفضل يمكن أن تحسن RVR بشكل أكبر.
تعدد الجولات: استقرت مكاسب الأداء بعد الجولة الثانية مع المتحققات اللغوية الكبيرة (بسبب التكرار)، لكنها استمرت في التحسن مع المتحققات المثالية (Oracle)، مما يشير إلى وجود مساحة للتحسين في آليات التحقق.
5. الأهمية والأثر
تحول في النموذج الفكري: تنقل الورقة التركيز من "توليد استعلامات أفضل" (النهج الوكي) إلى "تكييف المسترجع مع سيناريو الاستدلال". وهي تثبت أن تدريب المسترجعات على فهم السياق وإيجاد المعلومات المفقودة هو مسار أكثر قوة للاسترجاع الشامل.
التطبيق العملي: يقدم RVR حلاً فعالًا من حيث التكلفة للتطبيقات التي تتطلب جمع معلومات شاملة (مثل البحث القانوني، التشخيص الطبي، أو الاستخبارات التنافسية) حيث يكون فقدان إجابة واحدة صالحة أمرًا بالغ الأهمية.
المصدر المفتوح: أصدر المؤلفون الكود والنماذج، مما يسهل المزيد من الأبحاث في مجال الاسترجاع التكراري والبحث المحسن للتغطية.
باختصار، يثبت RVR أن حلقة تكرارية بسيطة من الاسترجاع ← التحقق ← الاسترجاع، مدعومة بمسترجعات مدربة على إيجاد معلومات تكميلية، تتفوق بشكل كبير على طرق البحث الوكي المعقدة للمهام التي تتطلب تغطية شاملة للإجابات.