← أحدث الأبحاث
🤖 machine learning

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

تقترح الورقة البحثية إطار عمل APEX، وهو إطار لاستكشاف السياسات المستقلة يستخدم خريطة استراتيجية وآلية اكتشاف التفرع للتغلب على انهيار الاستكشاف في وكلاء النماذج اللغوية الكبيرة (LLM) ذاتية التطور، مما يمكنهم من اكتشاف استراتيجيات متفوقة من خلال الذاكرة والتفكير دون تحديث أوزان النموذج.

المؤلفون الأصليون: Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث APEX، مقسمة إلى مفاهحات بسيطة مع تشبيهات من الحياة اليومية.

المشكلة: فخ "منطقة الراحة"

تخيل أنك تلعب لعبة فيديو معقدة (مثل مغامرة نصية حيث تكتب أوامر لاستكشاف عالم ما). لديك مساعد ذكاء اصطناعي ذكي يساعدك.

في البداية، يحاول الذكاء الاصطناعي تجربة أشياء مختلفة: فتح الأبواب، التقاط العناصر، التحدث إلى الشخصيات غير اللاعبة (NPCs). ولكن بعد فترة، يجد مساراً يمنحه درجة جيدة. فيشعر بالراحة. يدرك قائلاً: "مهلاً، إذا مشيت فقط في هذا الممر المحدد والتقطت هذا المفتاح الواحد، سأحصل على نقاط في كل مرة".

لذا، يتوقف عن تجربة أي شيء جديد. يعلق في حلقة مفرغة، ويكرر نفس الروتين الآمن مراراً وتكراراً.

  • المشكلة: الذكاء الاصطناعي يؤدي بشكل جيد في المتوسط، لكنه توقف عن البحث عن "غرفة الكنز السرية" التي تمنحه ضعف النقاط لأنها مخبأة خلف باب لم يفكر أبداً في تجربته.
  • مصطلح الورقة البحثية: يُسمى هذا انهيار الاستكشاف (Exploration Collapse). يتوقف العميل عن الاستكشاف ويكتفي باستغلال ما يعرفه بالفعل، مما يجعله يفوت استراتيجيات أفضل.

الحل: APEX ("خريطة المستكشف")

يقترح المؤلفون نظاماً يسمى APEX (الاستكشاف الذاتي للسياسات - Autonomous Policy Exploration). بدلاً من ترك الذكاء الاصطناعي يتجول عشوائياً أو يحفظ أخطاء الماضي، يمنح APEX الذكاء الاصطناعي خريطة استراتيجية.

فكر في هذه الخريطة ليس كرسم لمبنى، بل كـ قائمة تحقق للأهداف مرتبطة بقواعد.

  • المعالم (Milestones): هي أهداف محددة، مثل "ابحث عن المفتاح" أو "افتح الصندوق".
  • التبعية (Dependencies): الخريطة تعرف أنك لا تستطيع "فتح الصندوق" حتى "تجد المفتاح".

تعمل هذه الخريطة كدماغ مشترك للذكاء الاصطناعي، حيث تتبع بدقة ما جربه وما لم يجربه بعد.

كيف يعمل APEX: نظام المحرك المزدوج

يستخدم APEX آليتين رئيسيتين لمنع الذكاء الاصطناعي من التعثر، تعملان معاً مثل المرشد السياحي والمحقق.

1. المحقق: "اكتشاف التفرعات" (Fork Discovery)

تخيل أنك تسير في متحف. ترى باباً موارباً قليلاً، لكنك تمر بجانبه لأنك تركز على اللوحة التي أمامك.

  • ماذا يحدث: يرى الذكاء الاصطناعي الباب، لكنه لا يفتحه.
  • وظيفة اكتشاف التفرعات: بعد انتهاء اللعبة، ينظر "المحقق" إلى إعادة العرض. ويقول: "مهلاً، لقد رأينا ذلك الباب! كانت لدينا الفرصة لفتحه، لكننا لم نفعل ذلك أبداً. لنضف 'فتح الباب' إلى قائمتنا كهدف جديد".
  • النتيجة: تنمو الخريطة. فهي تجد بنشاط الاتجاهات التي تجاهلها الذكاء الاصطناعي وتضيفها إلى الخطة، مما يضمن عدم تفويت الفرص المخفية.

2. المرشد السياحي: "اختيار السياسة" (Policy Selection)

الآن بعد أن أصبح لدى الخريطة قائمة بالأهداف، يحتاج الذكاء الاصطناعي إلى تحديد الهدف التالي الذي سيتعامل معه.

  • المشكلة: إذا اختار الذكاء الاصطناعي فقط الهدف الذي يعرف أنه يمنحه أكبر قدر من النقاط، فلن يجرب الأهداف الجديدة والمخاطرة أبداً.
  • وظيفة اختيار السياسة: يعمل هذا كمرشد سياحي ذكي يوازن بين الأمان والمغامرة. يستخدم خدعة رياضية (تسمى أخذ عينات تومسون - Thompson Sampling) ليقرر: "لقد جربنا هدف 'المفتاح' 10 مرات وهو يعمل. لكننا جربنا هدف 'الباب' مرة واحدة فقط. لنذهب لتجربة الباب مجدداً لأننا لا نعرف بعد ما إذا كان كنزاً مخفياً!".
  • النتيجة: يُجبر الذكاء الاصطناعي على زيارة الأجزاء "غير المستكشفة" من الخريطة، مما يضمن عدم وقوعه في الروتين.

دورة التحسين

كل بضع ألعاب، يأخذ النظام استراحة لتحديث خريطته:

  1. التنقيح (Refine): يقوم بإصلاح الأخطاء. (مثال: "ظننا أننا بحاجة إلى سيف لفتح الباب، لكننا في الواقع احتجنا فقط إلى مفتاح").
  2. الانتشار (Propagate): يقوم بتحديث الإحصائيات. (مثال: "هدف 'البحث عن المفتاح' مهم جداً لأنه يؤدي إلى الكنز الكبير").
  3. الاكتشاف (Discover): يجد "المحقق" أبواباً جديدة لإضافتها إلى الخريطة.

لماذا ينجح (النتائج)

اختبر الباحثون هذا على نوعين من "الألعاب":

  1. المغامرات النصية (Jericho): قصص معقدة حيث تكتب أوامر.
  2. التفاعل مع الويب (WebArena): مهام واقعية مثل تصفح المواقع لشراء أشياء أو البحث عن معلومات.

النتائج:

  • الطرق القديمة (مثل Reflexion): كانت هذه الوكلاء تتعثر في مناطق راحتها. حصلوا على درجة متوسطة جيدة، لكنهم نادراً ما وجدوا الحل الأمثل.
  • APEX: نظرًا لأنه يتتبع صراحةً ما لم يجربه، فقد وجد باستمرار استراتيجيات أفضل. لم يحصل فقط على متوسط أعلى، بل وجد "الكنز السري" الذي فات الآخرين.

تشبيه ملخص

تخيل أنك تحاول إيجاد أفضل طريق للذهاب إلى العمل.

  • الطريقة القديمة: تسلك نفس الطريق كل يوم لأنه سريع عادةً. لن تتحقق أبداً مما إذا كان قد تم افتتاح طريق مختصر جديد.
  • طريقة APEX: لديك دفتر ملاحظات (الخريطة الاستراتيجية).
    • اكتشاف التفرعات هو أنت تنظر إلى الخريطة وتقول: "رأيت طريقاً جديداً بالأمس، لكنني لم أسلكه. سأدون ذلك لأجربه غداً".
    • اختيار السياسة هو أنت تقرر: "لقد سلكت الطريق الرئيسي 20 مرة. لنحاول الطريق الجديد اليوم لنرى ما إذا كان أسرع".

من خلال الاحتفاظ بقائمة منظمة لما جربوه وما لم يجربوه، يمنع APEX الذكاء الاصطناعي من التكاسل ويضمن استمراره في اكتشاف طرق أفضل لحل المشكلات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →