💬 NLP
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
يُعد MemSearcher إطار عمل لوكيل يعتمد على النماذج اللغوية الكبيرة، يستخدم آلية ذاكرة مدمجة وخوارزمية تدريب GRPO متعددة السياقات ومبتكرة لتحقيق تعلم تعزيزي فعال وشامل من البداية إلى النهاية لمهام البحث متعددة الجولات، متفوقاً بذلك على النماذج المرجعية التقليدية القائمة على دمج السجل التاريخي مع الحفاظ على استقرار أطوال السياق.
Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han2026-05-11