APEX-Searcher: Augmenting LLMs' Search Capabilities through Agentic Planning and Execution
تقدم الورقة البحثية APEX-Searcher، وهو إطار عمل وكيل جديد ثنائي المراحل يعزز قدرات البحث لنماذج اللغات الكبيرة في المهام المعقدة متعددة الخطوات من خلال فصل العملية إلى تخطيط استراتيجي مُحسَّن عبر التعلم التعزيزي وتنفيذ قوي مُنقَّح عبر الضبط الدقيق الخاضع للإشراف، وذلك للتغلب على قيود التدريب النهائي المباشر مثل مسارات الاسترجاع الغامضة والمكافآت الشحيحة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق تحاول حل لغز غامض للغاية. اللغز هو سؤال معقد مثل: "هل مخرج فيلم 'The Exorcist' ومخرج فيلم 'Ed Wood' من نفس البلد؟"
إذا سألت ذكاءً اصطناعيًا عاديًا (ذكاءً "ساذجًا") هذا السؤال، فقد يخمن بناءً على ما حفظه أثناء تدريبه. ولكن إذا لم يعرف الإجابة، فقد يقوم بمجرد اختلاق إجابة من عنده ("هلوسة") أو يستسلم.
إذا استخدمت ذكاءً اصطناعيًا للبحث (يُسمى RAG)، فإنه يعمل كمحقق يمسك بكتاب واحد من المكتبة، يقرأه، ثم يحاول الإجابة. وإذا لم تكن الإجابة موجودة في هذا الكتاب الواحد، فسيفشل المحقق، حتى لو كانت الإبابة مخبأة في ثلاثة كتب أخرى تحتاج إلى قراءتها بترتيب معين.
APEX-Searcher يشبه ترقية هذا المحقق إلى محقق بارع لديه كبير استراتيجيين وفريق من الباحثين.
إليك كيف يعمل، مقسمًا إلى خطوات بسيطة:
1. المشكلة: خطأ "المحاولة الواحدة"
معظم أجهزة الذكاء الاصطناعي للبحث تشبه الأشخاص الذين يحاولون أكل بيتزا كاملة في قضمة واحدة. إنهم يحاولون إيجاد الإجابة لسؤال معقد في بحث واحد. إذا كانت الإجابة تتطلب ربط النقاط بين قطع مختلفة من المعلومات (مثل معرفة جنسية الشخص (أ)، ثم جنسية الشخص (ب)، ثم مقارنتهما)، فإن البحث الواحد عادة ما يفشل.
2. الحل: APEX-Searcher
يغير APEX-Searcher قواعد اللعبة عن طريق تقسيم المهمة إلى دورين متميزين: المخطط والمستكشف.
المرحلة الأولى: كبير الاستراتيجيين (التخطيط الوكيل - Agentic Planning)
قبل أن يبدأ المحقق بالركض في المكتبة، يجلس كبير الاستراتيجيين (وكيل التخطيط) مع خريطة.
- ماذا يفعل: ينظر إلى السؤال الكبير والمخيف ويقسمه إلى قائمة مرجعية من الخطوات الصغيرة والسهلة.
- التشبيه: بدلاً من السؤال: "من هما هذان الرجلان ومن أين أتيا؟"، يقول الاستراتيجي:
- أولاً، ابحث عن هوية سكوت ديريكسون ومن أين هو.
- بعد ذلك، ابحث عن هوية إد وود ومن أين هو.
- أخيرًا، قارن بين البلدين.
- كيف يتعلم: تستخدم الورقة طريقة تدريب خاصة تسمى التعلم التعزيزي (RL). فكر في هذا الأمر كأنه لعبة فيديو حيث يحصل الاستراتيجي على "نقاط" (مكافآت) فقط إذا قام بتقسيم المشكلة بشكل مثالي. إذا وضع خطة سيئة، فإنه يحصل على صفر من النقاط. بمرور الوقت، يتعلم أن يكون أفضل مخطط في العالم.
المرحلة الثانية: المستكشف (الاستكشاف الوكيل - Agentic Exploration)
بمجرد أن ينتهي كبير الاستراتيجيين من وضع القائمة المرجعية، يبدأ المستكشف (وكيل التنفيذ) في العمل.
- ماذا يفعل: يتولى مهام القائمة المرجعية عنصرًا تلو الآخر. يبحث عن الإجابة للخطوة 1، ثم يدونها، ثم يستخدم تلك الإجابة للمساعدة في البحث عن الخطوة 2، وهكذا.
- التشبيه: تخيل أن المستكشف هو أمين مكتبة منظم جدًا.
- الخطوة 1: "أحتاج إلى جنسية سكوت." -> يبحث في المكتبة. -> يجد "أمريكي". -> يدونها في دفتر ملاحظاته.
- الخطوة 2: "الآن أحتاج إلى جنسية إد." -> يبحث في المكتبة. -> يجد "أمريكي". -> يدونها في الدفتر.
- الخطوة 3: "هل هما متشابهان؟" -> ينظر في الدفتر. -> نعم! كلاهما أمريكيان.
- كيف يتعلم: يتم تدريب المستكشف باستخدام الضبط الدقيق الخاضع للإشراف (SFT). هذا يشبه إعطاء المستكشف كتابًا مدرسيًا يحتوي على "أمثلة مثالية" توضح له بالضبط كيفية البحث، ومتى يتوقف عن البحث عندما يمتلك معلومات كافية، وكيف يجمع الإجابات معًا.
2. لماذا هذا أفضل؟
- الطريقة القديمة: "سأبحث عن كل شيء دفعة واحدة وآمل أن يحالفني الحظ." (غالبًا ما تفشل في الأسئلة الصعبة).
- طريقة APEX-Searcher: "لدي خطة. سأحل المشكلة خطوة بخطوة، مستخدمًا الإجابة من الخطوة الأولى لمساعدتي في حل الخطوة الثانية."
النتائج
اختبرت الورقة هذا النظام على العديد من الأسئلة الصعبة "متعددة القفزات" (الأسئلة التي تتطلب ربط معلومات متعددة).
- النتيجة: أصبح APEX-Searcher أذكى بكثير من الطرق الأخرى. لقد توقف عن التخمين وبدأ في الحل.
- لحظة الإدراك: أظهرت التجارب أن امتلاك خطة (الاستراتيجي) لا يقل أهمية عن امتلاك باحث جيد (المستكشف). إذا كان لديك باحث جيد بدون خطة، فسيضيع. وإذا كان لديك خطة ولكن باحث سيء، فلن يتمكن من العثور على الأدلة. أنت بحاجة إلى كليهما.
ملخص باختصار
تخيل أنك تحاول بناء قلعة "ليجو" معقدة.
- الذكاء الاصطناዊ التقليدي يحاول الإمساك بمجموعة من الطوب والأمل في أن تتناسب مع بعضها البعض.
- APEX-Searcher يشبه وجود مهندس معماري يرسم مخططًا أولاً (التخطيط)، ثم بناء يتبع المخطط خطوة بخطوة، ويتحقق من التعليمات بعد كل قطعة يضعها (الاستكشاف).
من خلال فصل التفكير (التخطيط) عن التنفيذ (البحث)، يساعد APEX-Searcher الذكاء الاصطناعي على حل المشكلات التي كانت تعتبر سابقًا معقدة للغاية بالنسبة لهم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.