SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
تقدم هذه الورقة البحثية SkillLearnBench، وهو أول معيار لتقييم أساليب التعلم المستمر في التوليد التلقائي للمهارات لوكلاء النماذج اللغوية الكبيرة (LLM agents)، كاشفةً أنه بينما تُحسن هذه الأساليب الأداء في المهام المنظمة، لا يوجد نهج واحد يهيمن باستمرار عبر جميع السيناريوهات أو يتوسع بشكل موثوق مع النماذج الأقوى.