Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
تتناول هذه الورقة البحثية أوجه القصور في التقييم والتدريب الحاليين لعمليات الاسترجاع كثيفة الاستدلال في أنظمة البحث الوكيلية من خلال تقديم معيار BRIGHT-Pro متعدد الجوانب ومتن RTriever-Synth، اللذين يُمكّنان معاً من تطوير نموذج RTriever-4B الذي يتفوق بشكل كبير على المسترجعات الحالية عند تقييمه بموجب بروتوكولات وكيلية واقعية.
تخيل أنك محقق يحاول حل لغز معقد. في الأيام الخوالي، ربما كنت تطلب من أمين المكتبة ببساطة "كتباً عن المشتبه به"، وسيقوم هو بتسليمك الكتاب الأكثر شهرة الذي يحمل هذا الاسم على غلافه. لكن ألغاز اليوم أكثر صعوبة؛ فأنت لا تحتاج فقط إلى كتاب واحد، بل تحتاج إلى ملف أدلة متكامل: بيان شاهد، وتقرير جنائي، وخريطة، وجدول زمني. إذا حصلت على بيان الشاهد فقط، فلن تتمكن من حل القضية، حتى لو كان هذا الكتاب مكتوباً ببراعة تامة.
هذه الورقة البحثية تتحدث عن تطوير "أمين المكتبة" (نظام الكمبيوتر الذي يجد المعلومات) ليكون قادراً على التعامل مع هذه الألغاز المعقدة ومتعددة الخطوات.
إليك تفصيل عملهم، باستخدام تشبيهات بسيطة:
1. المشكلة: أمين المكتبة "صاحب الكتاب الواحد"
يجادل المؤلفون بأن أنظمة البحث الحالية تشبه أمناء مكتبة بارعين في إيجاد كتاب واحد ذي صلة، لكنهم سيئون جداً في بناء ملف قضية كامل.
الطريقة القديمة: إذا سألت: "لماذا يبلغ سمك الغطاء الجليدي في القارة القطبية الجنوبية بضعة كيلومترات فقط؟"، فقد يجد محرك بحث تقليدي مقالاً رائعاً واحداً عن تدفق الجليد. ولكن للإجابة على السؤال حقاً، ستحتاج أيضاً إلى مقالات عن الجاذبية، والضغط، والذوبان.
العيب: الاختبارات الحالية (المعايير المرجعية) تتحقق فقط مما إذا كان أمين المكتبة قد وجد كتاباً واحداً جيداً. إنها لا تتحقق مما إذا كان أمين المكتبة قد وجد كل أنواع الأدلة المختلفة اللازمة لحل اللغز.
الفجوة الوكيلة (Agentic Gap): تحاول "الوكلاء" البرمجية الجديدة (المساعدون الأذكياء - AI Agents) حل هذه المشكلات عبر البحث، والقراءة، ثم البحث مجدداً. ولكن لأن "الأمناء" الذين يستخدمونها سيئون في إيجاد أدلة "متكاملة"، فإن الوكلاء يضيعون وقتهم في البحث في دوائر مفرغة أو في التخمين للوصول إلى الإجابة.
الثابت (Static): "إليك قائمة من 10 كتب. أي منها جيد؟" (الطريقة القديمة).
الوكيل (Agentic): "اذهب وابحث عن الكتب بنفسك، اقرأها، ثم حل اللغز." (الطريقة الواقعية).
النتيجة: وجدوا أن أمين المكتبة الذي يبدو رائعاً في الاختبار "الثابت" غالباً ما يفشل في الاختبار "الوكيل". قد يجد الكتاب الأكثر شهرة، لكنه يفتقد للأدلة الأقل وضوحاً والضرورية لإكمال القضية.
3. التدريب الجديد: RTriever-Synth (مدرسة "المحقق المحاكي")
أدرك المؤلفون أنه لا يمكنهم مجرد اختبار الأمناء؛ بل يجب عليهم تدريبهم بشكل أفضل. لذا بنوا بيئة تدريب اصطناعية تسمى RTriever-Synth.
المنهج: بدلاً من تعليم الذكاء الاصطائي "السؤال -> إجابة واحدة صحيحة"، علموه كيفية بناء محفظة متوازنة.
أخذوا سؤالاً معقداً، وقاموا بتفكيكه إلى "جوانبه" (عناصر قائمة التحقق)، ثم ولدوا وثيقة "إيجابية" محددة لكل جانب.
كما أنشأوا "سلبيات صعبة" (Hard Negatives) — وهي وثائق تبدو مشابهة جداً للإجابة الصحيحة ولكنها تفتقر إلى قطعة حاسمة من اللغز (مثل خريطة تظهر القارة الخطأ).
الهدف: هذا يجبر الذكاء الاصطائي على تعلم: "لا تبحث فقط عن وثيقة ذات صلة؛ بل ابحث عن المزيج الصحيح من الوثائق التي تغطي كل زاوية من زوايا السؤال".
4. النتائج: محقق أكثر ذكاءً
قاموا بتدريب نموذج جديد يسمى RTriever-4B باستخدام هذا المنهج واختبروه مقابل أنظمة بحث رائدة أخرى.
المفاجأة: في الاختبارات "الثابتة" القديمة، كان RTriever-4B جيداً ولكنه لم يكن الأفضل على الإطلاق. ومع ذلك، في الاختبارات "الوكيلة" (الواقعية)، تألق ببراعة.
لماذا؟ لأنه تعلم التوقف عن البحث بمجرد حصوله على "محفظة" الأدلة الكاملة.
المسترجعون الجيدون (Good Retrievers): وجدوا الأدلة الرئيسية مبكراً، مما سمح للوكيل الذكي بحل اللغز بسرعة ودقة.
المسترجعون السيئون (Bad Retrievers): علقوا في موضوع واحد (مثل البحث فقط عن "تدفق الجليد" وتجاهل "الضغط")، مما أجبر الوكيل على التخمين أو البحث بلا نهاية.
لمسة "BM25" المفاجئة: من المثير للاهتمام أن طريقة بحث قديمة وبسيطة جداً (BM25) قدمت أداءً جيداً للغاية في الإعداد "الوكيل". لماذا؟ لأن الوكيل الذكي تعلم طرح أسئلة متابعة دقيقة جداً قامت بإصلاح نقاط الضعف في الطريقة القديمة. وهذا أمر كانت الاختبارات القديمة ستغفل عنه تماماً.
الملخص
فكر في هذه الورقة البحثية كتحول من توظيف أمين مكتبة يمسك فقط بـ الكتاب الأكثر شهرة إلى توظيف مساعد بحث يبني ملف قضية كاملاً.
BRIGHT-PRO هو الامتحان الجديد والأصعب الذي يتحقق مما إذا كان لديك الملف كاملاً، وليس مجرد صفحة واحدة.
RTriever هو المساعد الجديد المدرب خصيصاً لجمع هذا الملف الكامل.
الدرس المستفاد: لبناء وكلاء ذكاء اصطناعي يمكنهم إجراء أبحاث عميقة، يجب أن نتوقف عن الحكم على محركات البحث بناءً على مدى جودة إيجادهم لـ "ضربة" واحدة، ونبدأ في الحكم عليهم بناءً على مدى جودة تجميعهم لـ مجموعة كاملة ومتوازنة من الأدلة.
ملخص تقني: إعادة التفكير في الاسترجاع المكثف للاستدلال
بيان المشكلة
تتفوق أنظمة استرجاع المعلومات (IR) التقليدية في استرجاع الحقائق أو المعلومات أحادية الخطوة، لكنها تعاني في الاسترجاع المكثف للاستدلال، حيث تتطلب استعلامات المستخدم خطوات متعددة من الاستدلال ودمج أدلة متنوعة. وبينما تحاول أنظمة البحث الوكيلية الحديثة (مثل DeepResearch) سد هذه الفجوة من خلال التخطيط والبحث والتركيب المعلوماتي بشكل تكراري، إلا أنها تعتمد بشكل كبير على مسترجعات تفشل غالباً في إظهار الأدلة المتكاملة في خطوة واحدة. يؤدي هذا لعدم الكفاءة، مما يتسبب في تكاليف حوسبة باهظة، وزمن استجابة طويل، واستدلال تخميني من قبل الوكيل.
تواجه الأبحاث الحالية فجوتين حرجتين في عدم الاتساق:
فجوة التقييم: توفر المعايير المرجعية الحالية مثل BRIGHT مجموعات ذهبية ضيقة (غالباً ما تُشتق من صفحة ويب واحدة أو اثنتين) وتقيم المسترجعات بمعزل عن غيرها. وهي تفتقر إلى الإشراف متعدد الجوانب وتفشل في تقييم أداء المسترجع ضمن سير عمل الوكيل الديناميكي والتكراري.
فجوة التدريب: عادة ما تقرن مجموعات البيانات التدريبية الاصطناعية لاسترجاع الاستدلال بين استعلام وقطعة نصية إيجابية واحدة وسلبيات صعبة. وهذا يحسن النماذج لتصنيف وثيقة واحدة ذات صلة في مرتبة عالية بدلاً من استرجاع محفظة متوازنة من الأدلة المتكاملة اللازمة للاستدلال المعقد.
المنهجية
يقترح المؤلفون إطار عمل شاملاً يعالج كلاً من التقييم والتدريب من خلال مكونين رئيسيين: BRIGHT-PRO و RTriever.
1. BRIGHT-PRO: معيار وكيل متعدد الجوانب
يعمل BRIGHT-PRO على توسيع معيار BRIGHT الأصلي (تحديداً مجموعة StackExchange الفرعية) ليعكس بشكل أفضل الاحتياجات المكثفة للاستدلال.
المجموعات الذهبية متعددة الجوانب: يقوم الخبراء بتفكيك كل استعلام إلى مجموعة من جوانب الاستدلال (منظورات أو مشكلات فرعية متميزة). يتم تجميع القطع النصية حسب هذه الجوانب وتعيين أوزان لها (مقياس ليكرت من 1-5) بناءً على أهميتها للإجابة النهائية.
بناء البيانات: تتضمن العملية إعادة تدقيق قطع BRIGHT الأصلية، وجمع أدلة جديدة عبر البحث في الويب، وتنقيح تعريفات الجوانب بشكل تكراري. تشمل مراقبة الجودة التحقق من قبل مدقق ثانٍ وفحوصات الاتفاق بين المدققين (الارتباط المرجح لكوهين κ = 0.742).
بروتوكولات التقييم:
الاسترجاع الساكن: يقيم المسترجعات باستخدام مقاييس مدركة للجوانب مثل α-nDCG@k (مع عقوبة الحداثة α=0.5) و استدعاء الجانب الموزون (A-Recall)، والتي تكافئ تغطية جوانب استدلال متنوعة بدلاً من القطع النصية المكررة.
الاسترجاع الوكيلي: يدمج المسترجعات في حلقة وكيل تعتمد على النماذج اللغوية الكبيرة (باستخدام خلفيات GPT-5-mini و Qwen3.5). يقوم الوكيل بالبحث والتركيب الإجابي بشكل تكراري. تشمل المقاييس اكتمال الاستدلال، والجودة الإجمالية، ومكافأة الكفاءة والجودة (AER) التي تعاقب على جولات البحث الزائدة.
2. RTriever-Synth و تدريب RTriever
لمعالجة فجوة التدريب، قدم المؤلفون RTriever-Synth، وهو متن اصطناعي مصمم لتعليم المسترجعات اختيار الأدلة المتكاملة.
خط أنابيب التركيب:
إعادة كتابة الاستعلام: تتم إعادة كتابة بذور MS MARCO إلى استعلامات واقعية طويلة الأمد بأسلوب DeepResearch مع تحديد شخصيات.
الإيجابيات المفككة إلى جوانب: يقوم نموذج لغوي قوي بتوليد إجابة مرجعية، والتي يتم تفكيكها إلى جوانب استدلال غير متداخلة. يتم تجسيد كل جانب كـ قطعة نصية إيجابية متكاملة.
السلبيات الصعبة المشروطة بالإيجابيات: يولد خط الأنابيب سلبيات تشترك في الإشارات الموضوعية مع الاستعلام ولكنها تتعمد إغفال جانب الاستدلال المحدد المطلوب للقطعة الإيجابية.
تدريب النموذج: تم إنشاء RTriever-4B عن طريق ضبط LoRA لنموذج Qwen3-Embedding-4B على RTriever-Synth. يستخدم هدف التدريب خسارة InfoNCE التباينية مع قطعة إيجابية واحدة وسلبية صعبة واحدة لكل استعلام، بهدف تحسين استرجاع محافظ الأدلة المتكاملة.
المساهمات الرئيسية
معيار BRIGHT-PRO: معيار مُدقق من قبل الخبراء يتميز بأدلة ذهبية متعددة الجوانب وبروتوكولات تقييم لكل من إعدادات البحث الساكنة والوكيلية.
RTriever-Synth: متن اصطناعي مفكك إلى جوانب يولد إيجابيات متكاملة وسلبيات صعبة مشروطة بالإيجابيات لتدريب المسترجعات على بناء محافظ الأدلة.
RTriever-4B: مسترجع متخصص بـ 4 مليارات معلمة يتفوق بشكل كبير على نموذجه الأساسي وينافس المسترجعات العامة الأكبر حجماً.
الرؤى التجريبية: دراسة تفصل بين جودة المسترجع وتوافق الوكيل والمسترجع، مما يوضح أن البروتوكولات المدركة للجوانب والوكيلية تكشف عن سلوكيات الاسترجاع التي تخفيها مقاييس القطعة الواحدة القياسية.
النتائج التجريبية
أداء الاسترجاع الساكن
هيمنة الاستدلال المكثف: تشكل النماذج المدربة للاستدلال (BGE-Reasoner-8B, DIVER-4B, RTriever-4B) طبقة عليا متميزة، حيث تتفوق على المسترجعات العامة (بما في ذلك Qwen3-Embedding بـ 8 مليارات معلمة و OpenAI text-embedding-3-Large) بمقدار 4-14 نقطة في α-nDCG@25.
هدف التدريب مقابل عدد المعلمات: يتفوق RTriever-4B (4 مليارات معلمة) على جميع المسترجعات العامة ذات 7-8 مليارات معلمة، مما يشير إلى أن هدف التدريب (الأدلة المتكاملة) أكثر أهمية من حجم النموذج. وعلى العكس من ذلك، فإن ReasonIR-8B، المدرب على مسارات القطعة الواحدة الإيجابية، يحتل مرتبة أدنى، مما يسلط الض الضوء على محدودية التحسين للقطعة الواحدة.
أداء الاسترجاع الوكيلي
التباين بين الساكن والوكيلي: لا تتنبأ التصنيفات الساكنة بشكل مثالي بالأداء الوكيلي. على سبيل المثال، BM25، الذي يؤدي أداءً ضعيفاً في الحالة الساكنة، يصبح منافساً في الإعداد الوكيلي لأن الاستعلامات اللاحقة المولدة بواسطة النماذج اللامية تقلل من عدم تطابق المفردات، مما يسمح للمطابقة المعجمية بإظهار أدلة مفيدة.
الكفاءة والاكتمال: في البروتوكولات التكيفية، يتصدر BGE-Reasoner-8B في كل من الكفاءة (أقل عدد من الجولات) والجودة. ويحتل RTriever-4B المرتبة الثانية في متوسط AER، مما يظهر تقارباً قوياً.
التوافق مع الوكيل: تتأثر التصنيفات منخفضة المستوى بشدة بالتوافق بين المسترجع والوكيل. يمكن لتغيير الخلفيات الوكيلية (مثلاً من GPT-5-mini إلى Qwen3.5) أن يغير بشكل كبير الأداء النسبي لمسترجعات مثل DIVER-4B-1020، بينما تظل النماذج من الفئة العليا مستقرة.
التحليل النوعي
تكشف دراسات الحالة لمسارات RTriever-4B عن خمسة أنماط متكررة:
كفاءة الجولة المبكرة: تنجح عمليات التشغيل في استرجاع معظم الأدلة الذهبية في أول 1-2 جولة، مما يسمح بالإنهاء الفوري.
الحرمان من الأدلة: يجبر الفشل في استرجاع القطع الذهبية النموذج اللامي على التخمين، مما يؤدي إلى إجابات تبدو منطقية ولكنها خاطئة.
تحيز التكرار: ينغلق المسترجع على عنقود مجاور للموضوع، ويعيد إظهار نفس المستندات رغم إعادة صياغة الاستعلام.
النفق الرؤيوي للجانب: يستفيض الوكيل في جانب واحد ويتجاهل الجوانب الأخرى، حتى لو بدت استعلامات البحث جديدة.
القفز بين الفرضيات: يسترجع الوكيل الإجابة مبكراً ولكنه يستمر في البحث لاختبار تسميات بديلة، مما يتسبب في تكاليف نشر غير ضرورية.
الأهمية والادعاءات
تجادل الورقة بأن الاسترجاع المكثف للاستدلال يتطلب تحولاً من التحسين لصلة القطعة الواحدة إلى التحسين لـ محافظ الأدلة الكاملة. ويدعي المؤلفون أن:
المقاييس القياسية (مثل NDCG@k) تفشل في التقاط فروق تغطية الاستدلال، والتي تكشف عنها بروتوكولات التقييم المدركة للجوانب والوكيلية.
جودة الاسترجاع الساكن ليست مؤشراً موثوقاً للفائدة داخل حلقات البحث الوكيلية.
تدريب المسترجعات على الإيجابيات المتكاملة والسلبيات الصعبة المشروطة بالإيجابيات هو استراتيجية قابلة للتطبيق لتحسين الاسترجاع المكثف للاستدلال، كما يتضح من مكاسب الأداء لـ RTriever-4B.
يعتمد التقدم المستقبلي في هذا المجال على التطورات المشتركة في التقييم (الانتقال لما وراء المجموعات الذهبية الساكنة) والتدريب (الانتقال لما وراء أهداف القطعة الواحدة) لدعم سير عمل البحث التكراري.
يظل المؤلفون متواضعين بشأن القيود، مشيرين إلى أن BRIGHT-PRO يغطي حالياً سبعة مجالات خبيرة ويعتمد على التدوين البشري المكلف، مما يشير إلى أن العمل المستقبلي يمكن أن يستكشف مجالات أوسع ومسارات تدوين شبه آلية.