MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
يُعد MemSearcher إطار عمل لوكيل يعتمد على النماذج اللغوية الكبيرة، يستخدم آلية ذاكرة مدمجة وخوارزمية تدريب GRPO متعددة السياقات ومبتكرة لتحقيق تعلم تعزيزي فعال وشامل من البداية إلى النهاية لمهام البحث متعددة الجولات، متفوقاً بذلك على النماذج المرجعية التقليدية القائمة على دمج السجل التاريخي مع الحفاظ على استقرار أطوال السياق.