← أحدث الأبحاث
💻 computer science

When Should Multi-Round RAG Stop? Structured Stopping Judgments and Retrieval Reduction in Search-R1

تقدم هذه الورقة طريقة تُكيف إطار عمل حكم "الكفاية والفجوة" المهيكل على مسار Search-R1 مجمد، مما نجح في تقليل استدعاءات الاسترجاع بنسبة 3.70% مع انخفاض طفيف قدره 0.625 نقطة مئوية فقط في دقة المطابقة التامة على HotpotQA، مع الإشارة صراحةً إلى أن هذا لا يضمن تحسين الدقة الإجمالية أو خفض تكلفة الاستدلال الكلية.

المؤلفون الأصليون: Weimeng Luo

نُشر 2026-08-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Weimeng Luo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل روبوتًا مساعدًا ذكيًا يحاول حل لغز محير. للحصول على الإجابة، يمكن للروبوت أن يطلب المساعدة من أمين مكتبة. هذا الأمين هو عبارة عن قاعدة بيانات ضخمة من الحقائق. لدى الروبوت خيار: أن يطلب كتابًا واحدًا، يقرأه، ثم يخمن؛ أو يطلب كتابًا ثانيًا، وثالثًا، ويستمر في ذلك حتى يشعر بالثقة بنسبة 100%. يُسمى هذا "التوليد المعزز بالاسترجاع"، أو RAG اختصارًا. الأمر يشبه طالبًا يؤدي اختبارًا ويُسمح له باستخدام كتاب مدرسي، لكن على الطالب أن يقرر بالضبط متى يتوقف عن القراءة ليكتب إجابته.

المشكلة الكبرى هي معرفة متى يتوقف. إذا توقف الطالب مبكرًا جدًا، فقد يفوت حقيقة حاسمة ويخطئ في الإجابة. وإذا استمر في القراءة بعد أن حصل بالفعل على الإجابة، فإنه يهدر الوقت والطاقة والصبر. في عالم الذكاء الاصطناعي، تعني "الوقت" و"الطاقة" قدرة الحاسوب والمال. لذا، يحاول العلماء تعليم مساعدي الذكاء الاصطناعي "شعورًا حدسيًا" لمعرفة متى يملكون ما يكفي من المعلومات للتوقف. الهدف هو إيجاد النقطة المثالية: التوقف في الوقت المناسب تمامًا لتوفير الموارد دون التضحية بصحة الإجابة.


قصة الورقة البحثية: تعليم الروبوت متى يتوقف

تعالج هذه الورقة مشكلة "متى تتوقف" باستخدام نظام ذكاء اصطناعي محدد يسمى Search-R1. فكر في Search-R1 كأنه محقق ذكي للغاية، ولكنه مندفع قليلاً؛ لديه عادة طلب المزيد من الأدلة (استرجاع المستندات) حتى بعد أن وجد الحل بالفعل. أراد الباحثون معرفة ما إذا كان بإمكانهم تعليم هذا المحقق التوقف في وقت مبكر دون أن يصبح أقل ذكاءً.

للقيام بذلك، لم يغيروا عقل المحقق أو المكتبة، بل أضافوا شخصية جديدة: القاضي (The Judge). هذا القاضي هو نموذج ذكاء اصطناعي أصغر ومتخصص (نموذج Qwen3.5-2B)، ومهمته الوحيدة هي مراقبة عمل المحقق والقول: "توقف! لديك ما يكفي!" أو "استمر، لقد فاتك شيء ما".

التجربة: اختبار صارم
أعد الباحثون تجربة دقيقة للغاية باستخدام 1,000 سؤال صعب. وقسموا هذه الأسئلة إلى مجموعات لضمان عدم قيام القاضي بمجرد حفظ الإجابات.

  1. التدريب: علموا القاضي على 900 سؤال، باستخدام 3,009 حالة محددة (لقطات لتقدم المحقق) مستمدة من تلك الأسئلة لإظهار أمثلة له حول متى كان لدى المحقق معلومات كافية ومتى لم تكن لديه.
  2. الاختبار: قاموا بقفل إعدادات القاضي واختبروه على الـ 800 سؤال المتبقية (مجموعة "التأكيد"، وتحديدًا الفهارس من 200 إلى 999) لمعرفة مدى أدائه في حالات جديدة غير مسبوقة.

النتائج: توفير الوقت، ولكن مع تحفظ
كانت النتائج مزيجًا من الأخبار الجيدة والتحذير الضروري.

  • الأخبار الجيدة: نجحت السياسة الجديدة! باستخدام القاضي لتحديد وقت التوقف، حقق النظام 77 عملية بحث أقل من نظام Search-R1 الأصلي. وهذا يمثل انخفاضًا بنسبة 3.70% في عمليات البحث. تمكن المحقق من التوقف مبكرًا وتوفير الموارد.
  • فحص الدقة: هل جعل التوقف المبكر المحقق يخطئ؟ الإجابة هي "قليلًا، ولكن ليس كثيرًا". حصل النظام الأصلي على الإجابة الصحيحة بنسبة 44.88% تقريبًا، بينما حصل النظام الجديد مع القاضي على الإجابة الصحيحة بنسبة 44.25%. هذا انخفاض قدره 0.625 نقطة مئوية.
  • الحكم: وضع الباحثون قاعدة قبل البدء: سيقبلون النظام الجديد فقط إذا لم تنخفض الدقة بأكثر من نقطتين مئويتين. وبما أن الانخفاض كان 0.625 فقط، فقد اجتاز النظام الاختبار. لقد نجح في تقليل عدد عمليات البحث مع الحفاظ على الدقة "محفوظة بشكل عام" (بمعنى أنها ظلت ضمن المنطقة الآمنة).

ما تستبعده الورقة صراحةً
من الضروري فهم ما لا تدعيه هذه الورقة، لأن المؤلف حريص جدًا على عدم المبالغة في نتائجها:

  • إنها ليست "قاعدة توقف آمنة": تنص الورقة صراحةً على أن هذه ليست "قاعدة توقف آمنة". فمن بين 69 مرة أخبر فيها القاضي المحقق بالتوقف مبكرًا، كانت 27 من تلك التوقفات "غير آمنة". وهذا يعني أنه في تلك الحالات الـ 27، توقف المحقق قبل أن يمتلك بالفعل معلومات كافية، رغم أن الإجابة النهائية كانت صحيحة أحيانًا بمحض الصدفة. النظام ليس خاليًا من المخاطر.
  • إنها ليست "انتصارًا للتكلفة الإجمالية": لا تدعي الورقة أن النظام أرخص من حيث التكلفة الإجمالية. فالقاضي نفسه يستهلك قدرة حاسوبية للتفكير. لم يقيس الباحثون ما إذا كان الوقت الذي تم توفيره من خلال تقليل البحث كافيًا لسداد الوقت الذي قضاه القاضي في التفكير. لقد قاسوا فقط انخفاض عدد عمليات البحث.
  • إنها ليست "تحسنًا في الدقة": لم يحصل النظام الجديد على إجابات أفضل؛ بل حصل فقط على إجابات صحيحة أقل قليلًا مع استخدام عمليات بحث أقل.

الخلاصة
تظهر هذه الورقة أنه يمكننا تعليم الذكاء الاصطناعي التوقف عن البحث في وقت مبكر، مما يوفر حوالي 3.7% من جهود البحث الخاصة به. ومع ذلك، يأتي هذا مع مقايضة: يرتكب النظام أخطاءً أكثر عندما يقرر التوقف. أثبت الباحثون أن هذه المقايضة مقبولة إذا كنت مستعدًا لتحمل انخفاض طفيف في الدقة (أقل من نقطتين). لكنهم حذروا أيضًا من أن هذا ليس حلاً مثاليًا وخاليًا من المخاطر. "القاضي" جيد في توفير الوقت، لكنه ليس مثاليًا في معرفة متى يكون المحقق مستعدًا حقًا للتوقف. إنها خطوة للأمام في جعل الذكاء الاصطناعي أكثر كفاءة، لكنها ليست الإجابة النهائية للمشكلة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →