COSEARCH: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search
تقترح الورقة البحثية CoSearch، وهو إطار عمل يقوم بتدريب وكيل استدلال متعدد الخطوات ونموذج ترتيب مستندات توليدي بشكل مشترك عبر تحسين السياسة النسبي المجموعي (GRPO) باستخدام التجميع الدلالي والمكافآت المركبة، مما يثبت أن تحسين كلا المكونين معاً يتفوق بشكل كبير على النهج الحالية التي تعامل الاسترجاع كأداة ثابتة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول حل لغز غامض للغاية، مثل "من هو أول شخص تسلق جبل إيفرست ثم سبح في القناة الإنجليزية؟". لديك محقق بارع (الوكيل الذكي - AI Agent) يتميز بالذكاء في التفكير، وربط النقاط، وصياغة النظريات. ومع ذلك، فإن المحقق لا يعرف كل شيء؛ فهو يحتاج إلى استدعاء أمين مكتبة (محرك البحث) ليجد له الكتب المناسبة للقراءة.
المشكلة: المحقق ذكي، لكن أمين المكتبة غافل
في معظم أنظمة الذكاء الاصطناي الحالي، يتم تدريب المحقق ليصبح أكثر ذكاءً في طرح الأسئلة وحل الألغاز. لكن أمين المكتبة عالق في روتين ثابت؛ فهو "أداة ثابتة" — يستخدم دائماً نفس الطريقة القديمة والجامدة للبحث عن الكتب.
- التشبيه: تخيل أن المحقق يسأل: "أرني كتباً عن متسلقي الجبال في القرن التاسع عشر". يقوم أمين المكتبة، الذي يبدو بطيئاً بعض الشيء، بتسليمه كتاباً عن متسلقي الجبال المعاصرين أو كتاباً عن السباحة. عندها يضطر المحقق للتخمين بناءً على معلومات سيئة، أو يضطر للسؤال مراراً وتكراراً، مما يهدر الوقت.
- التجربة: اختبر الباحثون ما سيحدث لو منحوا المحقق الكتب المثالية (الـ Oracle) بشكل سحري. قفز أداء المحقق بنسبة تقارب 27%. أثبت هذا أن العائق لم يكن عقل المحقق، بل كان قدرة أمين المكتبة على إيجاد الأشياء الصحيحة.
الحل: COSEARCH (التدريب المشترك للفريق)
يقدم البحث COSEARCH، وهي طريقة جديدة لتدريب الذكاء الاصطناعي. بدلاً من مجرد تدريب المحقق وترك أمين المكتبة وحيداً، يقومون بتدريب كلاهما معاً في نفس الوقت.
فكر في الأمر كشراكة رقص:
- الطريقة القديمة: تعلم الراقص (الذكاء الاصطناعي) كيف يرقص بإتقان، لكنك تبقي الموسيقى (نتائج البحث) ثابتة وغير قابلة للتغيير. إذا كانت الموسيقى خارج الإيقاع، سيبدو الراقص سيئاً.
- طريقة COSEARCH: تعلم الراقص ومهندس الصوت (أمين المكتبة/المصنف) كيف يتدربان معاً. بينما يصبح الراقص أفضل، يتعلم مهندس الصوت تشغيل الأغنية المثالية لتلك الحركة المحددة. ومع تحسن مهندس الصوت في اختيار الأغاني، يمكن للراقص أداء حركات أكثر تعقيداً.
كيف فعلوا ذلك (الخدع السحرية)
التدريب معاً أمر صعب لأن المحقق يطرح أسئلة مختلفة في كل خطوة. كيف تعلم مهندس الصوت أي أغنية كانت "جيدة" إذا غير المحقق طلبه في منتصف الطريق؟
استخدم المؤلفون خدعتين ذكيتين:
خدعة "تجميع التشابه" (التجميع الدلالي):
تخيل أن المحقق يطرح 100 سؤال مختلف أثناء التدريب. بعضها "من تسلق إيفرست؟" والبعض الآخر "من كان أول من صعد إيفرست؟". كلاهما يعني الشيء نفسه ولكن بصياغات مختلفة.
بدلاً من معاملة كل سؤال كأنه فريد، يقوم COSEARCH بتجميع الأسئلة المتشابهة معاً. يقول النظام: "حسناً، هذه الأسئلة العشرة تدور حول نفس الموضوع تقريباً. دعونا نرى كيف كان أداء أمين المكتبة تجاه هذه المجموعة من الأسئلة". هذا يسمح لهم بتدريب أمين المكتبة بكفاءة دون الحاجة إلى ملايين جولات التدريب الإضافية.بطاقة "التعليقات المزدوجة" (المكافأة المركبة):
كيف تخبر مهندس الصوت أنه قام بعمل جيد؟
- تعليقات قصيرة المدى: "هل وضعت الكتاب الأكثر صلة على الرف العلوي؟" (هذه هي مكافأة الصلة).
- تعليقات طويلة المدى: "هل حل المحقق اللغز باستخدام الكتب التي قدمتها لهم؟" (هذه هي مكافأة المسار).
يقوم COSEARCH بدمج هذين النوعين. إذا وضع أمين المكتبة الكتاب الصحيح على الرف، يحصل على نقطة. وإذا ساعد ذلك الكتاب المحقق في حل القضية، يحصل على نقطة إضافية. هذا يعلم أمين المكتبة ليس فقط إيجاد أي كتاب ذي صلة، بل إيجاد الكتاب الذي يساعد حقاً في حل المشكلة.
النتائج
عندما اختبروا هذا التعاون الجديد:
- حل الذكاء الاصطناعي عدداً أكبر بكثير من الأسئلة بشكل صحيح مقارنة بالسابق.
- احتاج "المحقق" إلى رحلات أقل إلى المكتبة للعثور على الإجابة (كان أكثر كفاءة).
- حتى مع استخدام محقق أصغر وأقل قوة (نموذج بـ 3 مليارات معلمة)، قدم النظام الجديد أداءً مذهلاً لأن أمين المكتبة كان بارعاً جداً في المساعدة.
الخلاصة الكبرى
لفترة طويلة، اعتقد باحثو الذكاء الاصطناعي: "إذا جعلنا الذكاء الاصطناعي أكثر ذكاءً فقط، فسيحل كل شيء". يقول هذا البحث: "لا! يجب عليك أيضاً جعل الأدوات التي يستخدمها الذكاء الاصطناعي أكثر ذكاءً."
من خلال تعليم عقل الاستنتاج وأداة البحث كيف يتعلمان من بعضهما البعض في وقت واحد، نحصل على نظام أفضل بكثير في إيجاد الحقيقة، وحل المشكلات المعقدة، والتصرف كـ "وكيل" حقيقي بدلاً من مجرد روبوت دردشة مزود بشريط بحث. إنه الفرق بين محقق لديه مكتبة فوضوية وغير منظمة، ومحقق لديه مساعد بحث فائق الذكاء ومتكيف.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.