← أحدث الأبحاث
💬 NLP

When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

تقدم الورقة البحثية إطار عمل ReaLM-Retrieve، الذي يعمل على تحسين توقيت الاسترجاع لنماذج الاستدلال الكبيرة من خلال اكتشاف فجوات المعرفة على مستوى خطوة الاستدلال، مما يحسن دقة الإجابة وكفاءة الاسترجاع بشكل كبير مع تقليل استدعاءات الاسترجاع غير الضرورية مقارنة بالنهج القياسي ونهج الفترات الزمنية الثابتة.

المؤلفون الأصليون: Dongxin Guo, Jikun Wu, Siu Ming Yiu

نُشر 2026-04-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dongxin Guo, Jikun Wu, Siu Ming Yiu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث "When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

المشكلة الكبرى: عدم التوافق في "زيارة المكتبة"

تخيل أنك محقق بارع (نموذج استدلال ضخم - Large Reasoning Model) تحاول حل لغز معقد. لديك دفتر ملاحظات تكتب فيه أفكارك خطوة بخطيبوة. أحياناً، تتعثر لأنك لا تعرف حقيقة معينة، مثل اسم شاهد أو تاريخ حدث ما.

الطريقة القديمة (RAG القياسي):
تعمل معظم الأنظمة الحالية مثل أمين مكتبة يسلمك مجموعة من الكتب قبل أن تبدأ حتى في الكتابة في دفتر ملاحظاتك. تقرأ الكتب، ثم تحاول حل اللغز بأكمله.

  • العيب: إذا تعثرت في منتصف عملية التفكير التي تستغرق 20 صفحة لأنك نسيت تفصيلاً ما، فلا يمكنك العودة وطلب كتاب جديد. أنت عالق بالمعلومات التي أُعطيت لك في البداية، حتى لو لم تكن كافية للخطوات اللاحقة.

الطوة الجديدة (ReaLM-Retrieve):
تقدم هذه الورقة نظاماً يسمى ReaLM-Retrieve. بدلاً من الحصول على جميع الكتب دفعة واحدة، يُسمح للمحقق بالذهول إلى المكتبة في منتصف كتابة ملاحظاته، ولكن فقط عندما يحتاج إليها حقاً.

كيف يعمل: الأدوات السحرية الثلاث

بنى الباحثون نظاماً يتكون من ثلاثة أجزاء رئيسية لجعل "رحلة المكتبة أثناء التفكير" هذه تعمل بشكل مثالي.

1. "فحص الثقة" (عدم اليقين على مستوى الخطوة)

تخيل أن المحقق يتوقف بعد كل فقرة في دفتر ملاحظاته. يسأل نفسه: "هل أنا أعرف هذا حقاً، أم أنني مجرد أخمن؟"

  • الطرق القديمة كانت تتحقق من هذا عند كل كلمة (متكرر جداً) أو كل جملة (جامد جداً).
  • ReaLM-Retrieve يتحقق عند الخطوة المنطقية. يسأل: "هل انتهيت للتو من فكرة كاملة؟ هل أشعر بعدم اليقين بشأن القفزة المنطقية التالية؟"
  • إذا شعر المحقق بـ "فجوة معرفية" (عدم يقين)، يقوم النظام بتحديد ذلك. إنه يشبه "ضوء تنبيه المحرك" الذي يعمل فقط عندما تحتاج السيارة للوقود فعلياً، وليس لمجرد أن المحرك يعمل.

2. "المدير الذكي" (سياسة التدخل المتعلمة)

مجرد شعور المحقق بعدم اليقين لا يعني أنه يجب عليه الركض إلى المكتبة في كل مرة. أحياناً يكون مجرد تفكير عميق، وليس نقصاً في الحقائق.

  • يعمل هذا النظام مثل مدير ذكي يجلس بجانب المحقق.
  • ينظر المدير إلى "فحص الثقة" وتاريخ القضية. ويقرر: "حسناً، نحن نحتاج حقاً للبحث عن تلك الحقيقة المحددة الآن،" أو "لا، استمر في التفكير، ستصل للحل بنفسك."
  • كما يساعد في كتابة السؤال المثالي لأمين المكتبة (استعلام البحث) حتى يحصل المحقق على الصفحة الصحيحة تماماً، وليس كتاباً كاملاً من المعلومات غير ذات الصلة.

3. "التوصيل السريع" (التكامل الفعال)

الذهاب إلى المكتبة يستغرق وقتاً. إذا توقف المحقق لمدة 5 دقائق في كل مرة يحتاج فيها إلى حقيقة، فستصبح العملية بطيئة.

  • بنى الباحثون خدمة توصيل عالية السرعة.
  • بدلاً من تسليم المحقق كتاباً كاملاً، يعطونه فقط الفقرة المحددة التي يحتاجها (ضغط المعلومات).
  • يستخدمون أيضاً خدعة "توقعية": إذا كان من المرجح أن يحتاج المحقق إلى معلومة عن "باريس" لاحقاً، فإن النظام يجلب تلك المعلومة بينما لا يزال المحقق يكتب الجملة الحالية. إذا احتاج إليها، ستكون موجودة فوراً.
  • النتيجة: النظام أسرع بـ 3.2 مرة في الحصول على المعلومات من الطرق القديمة.

النتائج: أذكى، أسرع، وأقل تكلفة

اختبر الفريق هذا النظام على ثلاث ألعاب ألغاز صعبة (MuSiQue، HotpotQA، و 2WikiMultiHopQA) تتطلب ربط الكثير من النقاط للوصول إلى الإجابة.

  • إجابات أفضل: حصل النظام على الإجابة الصحيحة أكثر بنسبة 10% من طريقة "الحصول على جميع الكتب دفعة واحدة" القياسية.
  • رحلات أقل: قام بـ رحلات أقل بنسبة 47% إلى المكتبة. بدلاً من التحقق من المكتبة كل بضع جمل (مثل طريقة IRCoT القديمة)، ذهب فقط عندما كان ذلك ضرورياً للغاية.
  • النقطة المثالية: في الألغاز الأكثر صعوبة (التي تتطلب 4 خطوات من المنطق)، كان الأسلوب الجديد أفضل بشكل ملحوظ. لقد أثبت أن الرحلات الأقل والموقوتة جيداً إلى المكتبة أفضل من الرحلات المتكررة والعشوائية.

مثال من الواقع من الورقة البحثية

تقدم الورقة مثالاً لسؤال: "من أخرج الفيلم الذي فاز بجائزة أفضل فيلم في العام الذي سقط فيه جدار برلين؟"

  • تفكير المحقق:

    1. "سقط جدار برلين في عام 1989." (واثق، لا حاجة لزيارة المكتبة).
    2. "فيلم أفضل فيلم لعام 1989 هو Driving Miss Daisy." (واثق، لا زيارة للمكتبة).
    3. "من أخرجه؟" (هنا، يشعر المحقق بفجوة. يقول النظام: اذهب إلى المكتبة).
    4. يجلب النظام اسم المخرج فوراً.
    5. يكمل المحقق الإجابة.
  • الطريقة القديمة: كانت ستجلب اسم المخرج في البداية تماماً، رغم أن المحقق لم يكن بحاجة إليه حتى الخطوة 3، مما يهدر الوقت وقد يربك المحقق بالكثير من المعلومات مبكراً جداً.

الملخص

يعلم ReaLM-Retrieve نماذج الذكاء الاصطناعي التوقف وطلب المساعدة بالضبط عندما يتعثرون، بدلاً من طلب المساعدة قبل البدء أو طلب المساعدة بشكل متكرر جداً. إنه يشبه امتلاك مساعد ذكي يعرف بالضبط متى يفتح الموسوعة، مما يوفر الوقت ويحقق نتائج أفضل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →