← أحدث الأبحاث
💬 NLP

DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling

تقترح هذه الورقة البحثية DecoupleSearch، وهو إطار عمل مبتكر يعزز تقنية RAG الوكيلية (Agentic RAG) من خلال فصل عمليتي التخطيط والبحث عبر نماذج قيمة مزدوجة وبحث شعاعي هرمي لمعالجة تحديات الإشراف على الخطوات وتعقيد فضاء المرشحين.

المؤلفون الأصليون: Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز صعب للغاية، مثل "من هو والد زوجة غولتشيتك هاتون؟". لديك مساعد ذكي جداً (الذكاء الاصطناعي) يعرف الكثير، لكنه أحياناً يختلق معلومات أو يتعثر. لمساعدته، تمنحه بطاقة مكتبة ليتمكن من البحث عن الحقائق. هذا ما يسمى التوليد المعزز بالاسترجاع (RAG).

ومع ذلك، تشير الورقة البحثية إلى أن مجرد امتلاك بطاقة مكتبة ليس كافياً؛ بل يجب على المساعد أن يعرف كيف يستخدمها. وهنا يأتي دور Agentic RAG: حيث يتصرف المساعد كالمحقق، فيخطط لتحقيقه ويبحث عن الأدلة خطوة بخطوة.

المشكلة هي أن هذا المحقق غالباً ما يضل الطريق. قد يضع مسار تحقيق سيئاً، أو قد يبحث عن الأدلة الخاطئة. تقترح الورقة البحثية، DecoupleSearch، طريقة جديدة لتدريب هذا المحقق حتى لا يضل طريقه.

إليك كيف يعمل الأمر، باستخدام تشبيهات بسيطة:

1. المشكلة: المحقق الذي يعتمد على مبدأ "الكل أو لا شيء"

في الأنظمة القديمة، كان المحقق يضع خطة واحدة، ويبحث مرة واحدة، ويأمل في الحصول على أفضل نتيجة. إذا كانت الخطة غير دقيقة قليلاً أو إذا كانت عملية البحث قد أسفرت عن كتاب ممل، فستكون الإجابة بأكملها خاطئة. كان الأمر يشبه محاولة العثة إبرة في كومة قش عبر النظر في بقعة واحدة فقط.

2. الحل: نظام "المدرب المزدوج"

ابتكر المؤلفون نظاماً يسمى DecoupleSearch. تخيل أنك توظف مدربين متخصصين لهذا المحقق:

  • مدرب التخطيط: يركز هذا المدرب فقط على الخطة. "هل هذه استراتيجية جيدة لحل اللغز؟"
  • مدرب البحث: يركز هذا المدرب فقط على الأدلة. "هل هذا الكتاب مفيد حقاً لخطة عملنا الحالية؟"

من خلال فصل هذين الدورين، يمكن للنظام إصلاح خطة سيئة دون القلق بشأن عملية البحث، والعكس صحيح.

3. التدريب: "بطولة التدريب" (MCTS)

كيف تعلم هؤلاء المدربين؟ لا يمكنك مجرد إظهار نموذج الإجابة لهم لأن الخطوات البينية معقدة.
بدلاً من ذلك، تستخدم الورقة البحثية طريقة تسمى البحث في شجرة مونت كارلو (MCTS). تخيل لعبة فيديو يلعب فيها الذكاء الاصطناي نفس المستوى آلاف المرات.

  • يجرب مسارات (خطط) وعمليات بحث مختلفة.
  • أحياناً يفوز (يحصل على الإجابة الصحيحة)، وأحياناً يخسر.
  • في نهاية كل لعبة، ينظر إلى كل خطوة قام بها. "تلك الخطوة أدت إلى فوز، لذا كانت جيدة. تلك الخطوة أدت إلى طريق مسدود، لذا كانت سيئة."
  • يعطي "درجة" لكل خطوة بمفردها. وهذا ينشئ خريطة ضخمة لما ينجح وما لا ينجح.

4. الاستدلال: عملية "تقليم الشجرة"

عندما يجيب الذكاء الاصطناعي على سؤال لمستخدم حقيقي، فإنه لا يخمن فحسب. بل يستخدم تقنية تسمى البحث الشعاعي الهرمي (Hierarchical Beam Search).
تخيل أنك تتسلق شجرة للعثور على ثمرة معينة.

  • التفرع: عند كل فرع، لا يختار الذكوز الاصطناعي مساراً واحداً فقط. بل ينمي عدة فروع جديدة (خطط) ويبحث عن عدة أدلة مختلفة.
  • التقليم: هنا يأتي دور مدرب التخطيط ومدرب البحث. ينظر هؤلاء المدربون إلى جميع الفروع الجديدة.
    • يقول مدرب التخطيط: "هذا الفرع يبدو واعداً، لكن ذاك يبدو طريقاً مسدوداً. اقطع الطريق المسدود."
    • يقول مدرب البحث: "هذا الكتاب الذي وجدناه عديم الفائدة. تخلص منه. احتفظ بهذا الكتاب."
  • النتيجة: يحتفظ الذكاء الاصطناعي فقط بأفضل الفروع ويقص الباقي. ويكرر ذلك حتى يصل إلى قمة الشجرة (الإجابة النهائية).

لماذا ينجح هذا الأسلوب؟

اختبرت الورقة البحثية هذا النظام على العديد من الأسئلة الصعبة (مثل ألغاز التاريخ متعددة الخطوات). ووجدوا ما يلي:

  1. التخطيط الجيد هو المفتاح: إذا كان لدى المحقق خطة سيئة، فلن تفيد أي عملية بحث مهما كانت. "مدرب التخطيط" أمر بالغ الأهمية.
  2. النماذج الصغيرة يمكن أن تكون ذكية: حتى نموذج ذكاء اصطناعي أصغر (مثل نموذج بـ 7 مليارات معلمة) يمكنه الأداء بمستوى يضاهي نموذجاً أكبر بكثير وأكثر تكلفة إذا استخدم تقنية "التقليم" هذه. إنه يشبه فريقاً صغيراً مدرباً جيداً يهزم فريقاً عملاقاً غير مدرب.
  3. يتفوق على المنافسين: تفوق النظام على الطرق الأخرى التي لم تفصل بين التخطيط والبحث أو لم تستخدم تدريب "بطولة التدريب".

الملخص

DecoupleSearch يشبه إعطاء محقق الذكاء الاصطناعي الخاص بك مدربين خبراء ومحاكياً للتدريب. بدلاً من التخمين الأعمى، يجرب الذكاء الاصطناعي مسارات عديدة، ويتعلم من أخطائه في المحاكي، وعند حل المشكلة الحقيقية، يقوم بقص الأفكار السيئة بشراسة ويحتفظ فقط بالأفضل. يؤدي هذا إلى إجابات أكثر دقة، خاصة للأسئلة المعقدة التي تتطلب بحثاً عميقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →