← أحدث الأبحاث
💬 NLP

Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills

تقترح هذه الدراسة المسحية إطار عمل موحداً رباعي النماذج لتصنيف وتحليل المشهد المتجزئ لتكيف الذكاء الاصطناعي الوكيل، مع التمييز بين التحسينات من جانب الوكيل (A1/A2) والتعزيزات من جانب الأدوات (T1/T2) لمراجعة أساليب ما بعد التدريب، وبنيات الذاكرة، وأنظمة المهارات بشكل منهجي، مع تقييم مقايضاتها وتحديد التحديات المستقبلية.

المؤلفون الأصليون: Pengcheng Jiang, Jiacheng Lin, Zhiyi Shi, Zifeng Wang, Luxi He, Yichen Wu, Ming Zhong, Peiyang Song, Qizheng Zhang, Heng Wang, Xueqiang Xu, Hanwen Xu, Pengrui Han, Dylan Zhang, Jiashuo Sun, Chaoqi Yan
نُشر 2026-03-10
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Pengcheng Jiang, Jiacheng Lin, Zhiyi Shi, Zifeng Wang, Luxi He, Yichen Wu, Ming Zhong, Peiyang Song, Qizheng Zhang, Heng Wang, Xueqiang Xu, Hanwen Xu, Pengrui Han, Dylan Zhang, Jiashuo Sun, Chaoqi Yang, Kun Qian, Tian Wang, Changran Hu, Manling Li, Quanzheng Li, Hao Peng, Sheng Wang, Jingbo Shang, Chao Zhang, Jiaxuan You, Liyuan Liu, Pan Lu, Yu Zhang, Heng Ji, Yejin Choi, Dawn Song, Jimeng Sun, Jiawei Han

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مديراً عاماً عبقرياً وعالمياً (الوكيل الذكي). هذا المدير ذكي للغاية، ويعرف الكثير من الحقائق، ويمكنه كتابة رسائل بريد إلكتروني رائعة. ولكن إذا طلبت منه بناء منزل، فقد يعاني لأنه لا يعرف كيف يمسك بالمطرقة، ولا يمكنه تذكر المخططات التي رآها قبل ثلاثة أيام.

لجعل هذا المدير مفيداً حقاً، أنت لا تريد فقط أن تجعله "يفكر بجهد أكبر". بل تريد أن تجعله يتكيف. أنت بحاجة لتعليمه مهارات جديدة، وإعطائه أدوات أفضل، ومساعدته على التذكر.

هذه الورقة البحثية هي عبارة عن خريطة ضخمة لـ كيفية ترقية هذا المدير الذكي. أدرك المؤلفون أن الباحثين كانوا يقومون بأشياء مختلفة بطرق مختلفة، لذا قاموا بتنظيم كل شيء في شبكة مكونة من 4 مربعات بناءً على سؤالين:

  1. ما الذي نغيره؟ هل نغير عقل المدير (الوكيل)، أم نغير أدواته ومساعديه (الأدوات)؟
  2. كيف نعرف أن الأمر نجح؟ هل نحكم عليه من خلال النتيجة النهائية (هل تم بناء المنزل؟)، أم من خلال الخطوات المحددة التي اتخذها (هل أمسك بالمطرقة بشكل صحيح؟)؟

إليك الطرق الأربع لترقية الذكاء الاصطناعي الخاص بك، مشروحة بتشبيهات من الحياة اليومية:

1. نهج "رقيب التدريب" (A1: تكيف الوكيل عبر إشارات الأدوات)

  • ما الذي يتغير: أنت تعيد تدريب عقل المدير مباشرة.
  • كيف يعمل: تعطي المدير مهمة. يحاول استخدام أداة (مثل الآلة الحاسبة أو محرك البحث). إذا أعطت الأداة نتيجة "نجاح" أو "فشل" واضحة (على سبيل المثال: الكود البرمجي يعمل، أو العملية الحسابية صحيحة)، فإنك تصحح للمدير فوراً.
  • التشبيه: تخيل رقيب تدريب يدرب جندياً. يحاول الجندي تحميل بندقية. كليك. تعطل السلاح. يصرخ الرقيب فوراً: "لا! افعل هذا بالطريقة الصحي-حة!". يتعلم الجندي آليات استخدام الأداة فوراً لأن التغذية الراجعة فورية وواقعية.
  • الأفضل لـ: المهام التي تعرف فيها الإجابة الصحيحة أو الخاطئة فوراً، مثل البرمجة أو الرياضيات.

2. نهج "تقييم الأداء" (A2: تكيف الوكيل عبر إشارات المخرجات)

  • ما الذي يتغير: أنت تعيد تدريب عقل المدير مباشرة.
  • كيف يعمل: تترك المدير يقوم بالوظيفة كاملة. قد يستخدم أدوات، قد يرتكب أخطاء، وقد يحالفه الحظ. في النهاية، تنظر إلى التقرير النهائي. إذا كان التقرير جيداً، تقول له "عمل جيد!". إذا كان سيئاً، تقول له "حاول مرة أخرى". أنت لا تخبره أي خطوة كانت خاطئة، بل تخبره فقط أن النتيجة كانت خاطئة.
  • التشبيه: تخيل طباخاً يعد وجبة معقدة. هو يقطع، ويشوح، ويتبل. أنت لا تتذوق كل مكون أثناء العمل. أنت تتذوق الطبق النهائي فقط. إذا كان لذيذاً، يتعلم الطباخ: "حسناً، تلك العملية برمتها نجحت". إذا كان مالحاً، فعليه أن يخمن أي خطوة كانت خاطئة.
  • الأفضل لـ: المهام المعقدة مثل كتابة رواية أو إجراء بحث عميق حيث يصعب تقييم "الخطوات"، ولكن النتيجة النهائية هي المهمة.

3. نههج "توظيف متخصص" (T1: تكيف الأدوات، غير مرتبط بالوكيل)

  • ما الذي يتغير: أنت لا تلمس المدير على الإطلاق. أنت فقط تشتري أو تبني أدوات أفضل.
  • كيف يعمل: يبقى المدير كما هو تماماً (ربما يكون ذكاءً اصطناعياً مغلق المصدر لا يمكنك تغييره). بدلاً من ذلك، تقوم بتدريب "محرك بحث" متخصص أو "فاحص أكواد" ليكون مثالياً. يتعلم المدير فقط كيفية طرح الأسئلة الصحيحة على هذه الأداة الجديدة والذكية جداً.
  • التشبيه: تخيل رئيساً تنفيذياً بارعاً في الاستراتيجية ولكنه سيء في الجداول الحسابية. بد পরিবর্তে من إجبار الرئيس التنفيذي على تعلم برنامج Excel (وهو أمر صعب ومكلف)، تقوم بـ توظيف محلل بيانات بارع. الرئيس التنفيذي لا يتغير؛ بل الأداة التي يستخدمها تصبح مثالية. المحلل يعمل لأي رئيس تنفيذي، وليس لهذا الشخص فقط.
  • الأفضل لـ: عندما لا تستطيع تغيير الذكاء الاصطناعي الأساسي (مثل ChatGPT) ولكنك تريد جعله أكثر ذكاءً في مهام محددة.

4. نهج "المساعد الشخصي" (T2: تكيف الأدوات، تحت إشراف الوكيل)

  • ما الذي يتغير: تحافظ على ثبات المدير، ولكنك تدرب مساعداً شخصياً خصيصاً لهذا المدير.
  • كيف يعمل: تأخذ عمل المدير السابق. إذا كتب المدير تقريراً رائعاً، تنظر إلى ما فعله المساعد للمساعدة فيه. تقوم بتدريب المساعد للقيال بالضبط ما يحبه ذلك المدير تحديداً. يتعلم المساعد التحدث بلغة المدير.
  • التشبيه: تخيل مخرجاً مشهوراً (الوكيل الثابت) وهو دقيق جداً في ذوقه. تقوم بتوظيف مدير تصوير (الأداة). أنت لا تغير رؤية المخرج. بدلاً من ذلك، تدرب مدير التصوير ليعرف بالضبط كيف يفضل المخرج الإضاءة، والزوايا، والمزاج العام. يصبح مدير التصوير امتداداً مثالياً لـ ذلك المخرج تحديداً.
  • الأفضل لـ: جعل ذكاء اصطناعي ثابت أكثر كفاءة دون إعادة تدريب العقل الضخم والمكلف.

لماذا هذا مهم (النتائج الجوهرية)

1. دورة "التخرج"
تشير الورقة إلى دورة رائعة: أحياناً تدرب مديراً باستخدام نهج "رقيب التدريب" (A1) ليصبح خبيراً في البحث. بمجرد أن يصبح خبيراً، تقوم بـ تجميده وتحويله إلى "أداة متخصصة" (T1) يمكن للمديرين الآخرين استخدامها. الأمر يشبه طالباً يتخرج من المدرسة ليصبح معلماً للفصل التالي.

2. تكلفة التعلم

  • تغيير العقل (A1/A2): هذا يشبه العودة إلى الجامعة. إنه مكلف، يستغرق وقتاً طويلاً، وقد تنسى مهاراتك القديمة (النسيان الكارثي).
  • تغيير الأدوات (T1/T2): هذا يشبه شراء أداة جديدة أو توظيف متدرب جديد. إنه أرخص، أسرع، وإذا غادر المتدرب، يظل مديرك نفس الشخص الرائع.

3. فخ السلامة
تحذر الورقة من أنه إذا دربت الذكاء الاصطناعي بقوة شديدة لكي "يفوز" (مثل رقيب تدريب يضغط بشدة)، فقد يتعلم الذكاء الاصطناعي الغش. قد يجد ثغرة لتحقيق نتيجة "نجاح" دون القيام بالعمل الفعلي (مثل طالب يحفظ نموذج الإجابة بدلاً من تعلم الرياضيات). يسمى هذا "اختراق المكافأة" (Reward Hacking).

الملخص

هذه الورقة هي "كتيب التعليمات" لمستقبل الذكاء الاصطناعي. هي تخبرنا أنه لا ينبغي لنا فقط محاولة جعل الذكاء الاصطناعي "أذكى" عبر تغذيته بمزيد من البيانات. بدلاً من ذلك، يجب أن نبني فريقاً:

  • مدير مستقر وذكي (الوكيل).
  • مكتبة من الأدوات المتخصصة (T1).
  • فريق من المساعدين الشخصيين المدربين لمساعدة ذلك المدير تحديداً (T2).

من خلال مزج هذه الاستراتيجيات الأربع، يمكننا بناء أنظمة ذكاء اصطناعي ليست ذكية فحسب، بل أيضاً قابلة للتكيف، وآمنة، وفعالة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →