← أحدث الأبحاث
🤖 AI

SkillMaster: Toward Autonomous Skill Mastery in LLM Agents

يُعد SkillMaster إطار عمل تدريبي مبتكر يُمكّن وكلاء النماذج اللغوية الكبيرة من إنشاء المهارات وصقلها واختيارها بشكل ذاتي من خلال المراجعة القائمة على المسارات، وتقييم المنفعة القائم على السيناريوهات المقابلة للواقع، وخوارزمية تعلم تعزيزي ذات ميزة مزدوجة، مما يحقق تحسينات كبيرة في الأداء وقدرات التحسين الذاتي في المهام المعقدة دون توجيه خارجي.

المؤلفون الأصليون: Min Yang, Jinghua Piao, Xu Xia, Xiaochong Lan, Jiaju Chen, Yongshun Gong, Yong Li

نُشر 2026-05-12
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Min Yang, Jinghua Piao, Xu Xia, Xiaochong Lan, Jiaju Chen, Yongshun Gong, Yong Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة SKILLMASTER البحثية، مقسمة إلى مفاهيم بسيطة باستخدام تشبيهات من الحياة اليومية.

الفكرة الكبرى: من أمين مكتبة إلى خبير عصامي

تخيل أنك تعلم روبوتًا (عميل ذكاء اصطناعي) كيفية القيام بالأعمال المنزلية، مثل تنظيف المنزل أو التسوق عبر الإنترنت.

الطريقة القديمة (التقنيات الحالية):
تخيل الروبوت كطالب لديه أمين مكتبة خارجي صارم جدًا.

  • يحاول الروبوت تنفيذ مهمة ما.
  • إذا فشل، يقوم أمين المكتبة (برنامج حاسوبي خارجي) بالنظر فيما حدث، ويكتب "قاعدة" أو "مهارة" جديدة على ورقة ويضعها في كتاب.
  • الروبوت لا يعرف كيف يكتب هذه القواعد؛ هو فقط يتعين عليه البحث عنها في الكتاب عندما يحتاجها.
  • المشكلة: الروبوت سلبي. لا يمكنه تقرير ما إذا كانت القاعدة جيدة أم سيئة، ولا يمكنه إصلاح قاعدة خاطئة قليلاً. هو فقط يتبع تعليمات أمين المكتبة.

الطريقة الجديدة (SKILLMASTER):
يحول SKILLMASTER الروبوت إلى خبير عصامي يدير دفتر ملاحظاته الخاص.

  • يحاول الروبوت تنفيذ مهمة ما.
  • بعد ذلك، ينظر إلى أدائه ويسأل نفسه: "هل أبليت بلاءً حسنًا؟ هل فاتني خطوة ما؟ هل هناك طريقة أفضل للقيام بهذا؟"
  • ثم يستخدم أداة خاصة لكتابة قاعدة جديدة، أو إصلاح قاعدة قديمة، أو الإبقاء على القواعد الحالية في دفتر ملاحظاته الخاص.
  • والأهم من ذلك، أنه يتعلم كيفية كتابة هذه القواعد من خلال رؤية ما إذا كانت ستساعده بالفعل على الأداء بشكل أفضل في المرة القادمة.

كيف يعمل: الخدع السحرية الثلاث

تقدم الورقة ثلاث حيل محددة لجعل هذا التعلم الذاتي ممكنًا.

1. "مراجعة ما بعد المباراة" (مراجعة المهارة بناءً على المسار)

التشبيه: تخيل لاعب كرة سلة يشاهد تسجيلًا لمباراته فور انتهائها.

  • الطريقة القدة: يشاهد المدرب الشريط ويقول للاعب: "في المرة القينة، سدد من الجانب الأيسر".
  • طريقة SKILLMASTER: يشاهد اللاعب الشريط، ويدرك: "لقد استمررت في الخطأ لأنني لم أكن أتفقد الزاوية أولاً"، ثم يكتب تلك الملاحظة في سجل خططه الخاص.
  • في الورقة البحثية: بعد أن ينهي الذكاء الاصطناعي مهمة ما (مثل العثور على حبة طماطم في الثلاجة)، يراجع قصة ما حدث بالكامل. ثم يستخدم "استدعاء أداة" (مثل قلم رقمي) ليقرر: اقتراح مهارة جديدة، تحديث مهارة قديمة، أو الإبقاء على الأمور كما هي.

2. "تجربة القيادة" (مكافأة المنفعة المقابلة للواقع)

التشبيه: تخيل أنك اخترعت طريقة جديدة لربط حذائك. كيف تعرف أنها أفضل حقًا؟ أنت لا تخمن فحسب؛ بل تجربها على زوج آخر من الأحذية لترى ما إذا كانت ستعمل.

  • المشكلة: إذا قام الروبوت بتغيير كتاب قواعده، فكيف يعرف أن التغيير جيد؟ مجرد نجاحه مرة واحدة لا يعني أن القاعدة الجديدة مثالية.
  • طريقة SKILLMASTER: عندما يقترح الروبوت تغييرًا في مهاراته، يقوم النظام بإجراء "تجربة قيادة". يأخذ مهمة مختلفة ولكن مشابهة (مهمة اختبارية) ويحاول تنفيذها باستخدام القواعد القديمة مقابل القواعد الجديدة.
    • إذا جعلت القواعد الجديدة الروبوت ينهي المهمة بشكل أسرع أو ينجح حيث كان يفشل سابقًا، يحصل الروبوت على مكافأة "عمل جيد".
    • إذا جعلت القواعد الجديدة الأمور أسوأ، يحصل على عقوبة.
  • النتيجة: يتعلم الروبوت ألا يحتفظ إلا بالتغييرات التي تحسن أداءه فعليًا في المهام المشابهة مستقبلاً.

3. "العقل ثنائي المسار" (DualAdv-GRPO)

التشبيه: تخيل سائقًا هو أيضًا ميكانيكي.

  • المسار أ (القيادة): "أحتاج إلى تدوير المقود لليسار لتجنب حفرة". (هذا يحتاج إلى رد فعل فوري).
  • المسار ب (الميكانيكي): "يجب أن أشد هذا البرغي لكي تعمل السيارة بشكل أفضل الأسبوع المقبل". (هذا يحتاج إلى رد فعل طويل الأمد).
  • المشكلة: إذا خلطت هذين الهدفين معًا، سيصاب الدماغ بالارتباك. "هل يجب أن أدير المقود لليسار أم أشد البرغي؟"
  • طريقة SKILLMASTER: يقوم النظام بفصل هذين النوعين من الأفكار. فهو يحسب "درجة" أفعال القيادة بشكل منفصل عن "درجة" كتابة قواعد جديدة. ثم يدمجهما بعناًية بحيث يتعلم الروبوت القيادة و تعلم كيفية التعلم، دون أن يفسد أحدهما الآخر.

ماذا حدث في التجارب؟

اختبر الباحثون هذا على عالمين مشهورين "لألعاب الفيديو" الخاصة بالذكاء الاصطناعي:

  1. ALFWorld: منزل محاكى حيث يتعين على الروبوت نقل الأشياء (مثل "ضع الطماطم الباردة في الثلاجة").
  2. WebShop: متجر إلكتروني محاكى حيث يتعين على الروبوت العثور على عناصر محددة وشرائها (مثل "اشترِ قميصًا أزرق بسعر أقل من 20 دولارًا").

النتائج:

  • نتائج أفضل: تفوق SKILLMASTER على جميع الطرق الأخرى، بما في ذلك تلك التي تستخدم نماذج "معلمة" قوية ومُدربة مسبقًا. لقد حسن معدلات النجاح بنسبة تتراوح بين 8.8% إلى 9.3%.
  • التحسين الذاتي: لم يكن الروبوت محظوظًا فحسب؛ بل تعلم بالفعل رصد أخطائه. على سبيل المثال، إذا استمر في البحث في الأدراج الخاطئة عن الطعام، فقد كتب قاعدة جديدة: "لا تبحث في المناطق ذات الاحتمالية المنخفضة أولاً".
  • استيعاب المهارات: بشكل مثير للاهتمام، بعد التدريب، لم يعد الروبوت بحاجة حتى إلى البحث في "دفتر ملاحظاته" كثيرًا. لقد تعلم المهارات جيدًا لدرجة أنها أصبحت جزءًا من عملية تفكيره الطبيعية، مثل الإنسان الذي يتعلم ركوب الدراجة ولا يحتاج بعد ذلك للتفكير في التوازن.

الملخص

SKILLMASTER هو إطار عمل يتوقف عن معاملة مهارات الذكاء الاصطناعي كملفات ثابتة يديرها كمبيوتر خارجي. بدلاً من ذلك، يمنح الذكاء الاصطناعي القدرة على كتابة وتعديل واختبار قواعده الخاصة بناءً على تجاربه الخاصة. إنه الفرق بين طالب يُسلم إليه كتاب مدرسي، وطالب يكتب كتابه المدرسي الخاص، ويختبر فصوله، ويحتفظ فقط بالفصول التي تساعده على الحصول على درجة "امتياز".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →