SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution
تُعد SkillRise إطار عمل موحداً للتعلم التعزيزي يُمكّن وكلاء النماذج اللغوية الكبيرة من تطوير وإعادة استخدام مهارات قابلة للنقل عبر مهام متميزة من خلال تنظيمها في تسلسلات تدريجية واستخدام سياسة واحدة لحل المهام وتنظيم وثيقة مهارات متطورة في آن واحد، مما يحقق أداءً وكفاءة فائقين مقارنة بالنهج الحالية متعددة المراحل أو المستقلة لكل مهمة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتاً كيف يلعب لعبة فيديو. في الأيام الخوالي، إذا فشل الروبوت في المستوى الأول، كان ينسى كل شيء، ويبدأ المستوى الثاني من الصفر، ويأمل في الأفضل. كان الأمر يشبه محاولة تعلم ركوب الدراجة عن طريق السقوط، ثم النهوض ومحاولة ركوب دراجة مختلفة فوراً دون تذكر كيف سقطت. هكذا كانت تعمل العديد من برامج الكمبيوتر التي تسمى "الوكلاء الذكيين" (AI agents): كانت تتعامل مع كل تحدٍ جديد كحدث جديد ومنعزل، مما يهدر كل الدروس التي تعلمتها في المرات السابقة.
ولكن ماذا لو استطاع الروبوت الاحتفاظ بـ "ورقة غش" أو "مذكرات" تصبح أكثر ذكاءً في كل مرة يلعب فيها؟ هذا هو جوهر مجال يسمى "التعلم التعزيزي" (Reinforcement Learning)، حيث يتعلم الذكاء الاصطناعي من خلال التجربة، والحصول على مكافآت عند النجاح، والتعلم من الأخطاء. مؤخراً، حاول العلماء تعليم هذه الوكلاء ليس فقط حل لغز واحد، بل تعلم "مهارات" عامة تساعدهم في حل العديد من الألغاز المختلفة. السؤال الكبير هو: كيف تعلم ذكاءً اصطناعياً أن يدون دروسه الخاصة بطريقة تساعده حقاً لاحقاً، دون أن يرتبك بالتفاصيل المحددة للغز الأول؟
إليك SkillRise، وهي طريقة جديدة تعمل كمعلم فائق الذكاء للوكلاء الذكيين. بدلاً من جعل الوكيل ينسى ماضيه، تقوم SkillRise بتنظيم المهام في تسلسل "رفع المستوى"، بالانتقال من السهل إلى الصعب. وبينما يلعب الوكيل، فإنه يقوم بشيئين في آن واحد: يحاول حل المستوى الحالي، ويعمل أيضاً كـ "منسق" لتحديث مذكرات مهاراته الخاصة. فكر في الأمر مثل شخصية في لعبة فيديو، بعد هزيمة زعيم ما، لا ينتقل فقط إلى المستوى التالي، بل يكتب فوراً مدخلاً جديداً في مذكراته: "مهلاً، تذكر كيف أن ذلك الزعيم كان يهاجم فقط عندما كنت على اليسار؟ في المرة القالية، ابقَ على اليمين".
إن سحر SkillRise يكمن في كيفية مكافأة الذكاء الاصطناعي. فهي تمنحه نقاطاً لحل المهمة الحالية، ولكنها تمنحه أيضاً نقاطاً بناءً على مدى جودة مساعدة "مدخل المذكرات" للوكيل في حل المهام المستقبلية. هذا يشجع الذكاء الاصطناعي على تدوين قواعد عامة (مثل "ابقَ على اليمين") بدلاً من التفاصيل المحددة (مثل "الزعيم كان اسمه بوب"). اختبر الباحثون ذلك في ثلاثة "عوالم" مختلفة: منزل حيث يتعين على الوكيل التنظيف والتنظيم (ALFWorld)، ومتجر إلكتروني حيث يتعين عليه شراء عناصر محددة (WebShop)، ومختبر علمي حيث يجري تجارب (ScienceWorld).
كانت النتائج مبهرة. لم تكتفِ SkillRise بالتحسن في المهام المحددة التي تدربت عليها فحسب، بل تعلمت "طريقة للتعلم". فعندما أعطى الباحثون للوكيل سلاسل أطول من المهام ذات الصلة للممارسة، أصبح الوكيل أفضل، مما يشير إلى أنه كان يعيد استخدام مهاراته حقاً بدلاً من مجرد حفظ الإجابات. وفي الواقع، تفوقت على غيرها من الأساليب الرائدة بفارق كبير، حيث حسنت معدلات النجاح بما يصل إلى 8.5 نقطة مئوية. ولعل الأمر الأكثر إثارة للدهشة هو أنه على الرغم من تدريبها على مهام مختلفة، إلا أنها كانت لا تزال أفضل في إعادة تنفيذ المهمة نفسها مراراً وتكراراً من الأساليب المصممة خصيصاً لذلك. كما فعلت كل هذا بشكل أسرع وبقدر أقل من قوة الحوسبة مقارنة بالطرق القديمة التي تتطلب عمليات معقدة متعددة الخطوات لإدارة الذاكرة.
باختصار، تشير SkillRise إلى أنه إذا أردت أن يصبح الذكاء الاصطناعي أكثر ذكاءً، فلا تكتفِ بجعله يتدرب فحسب؛ بل علمه أن يحتفظ بدفتر ملاحظات مستمر ومتطور لحكمته الخاصة. ومن خلال الفصل بين فعل "التنفيذ" وفعل "تدوين ما تعلمناه"، ومن خلال مكافأة الوكيل على مدى فائدة ما كتبه للتحديات المستقبلية، يمكننا بناء وكلاء لا يحلون المشكلات فحسب، بل يطورون استراتيجياتهم الخاصة ليصبحوا حلالي مشكلات أفضل بمرور الوقت.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.