From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning
본 논문은 이질적인 사용자 선호도를 효과적으로 처리하고 다양한 계획 및 도구 사용 시나리오에서 에이전트 성능을 향상시키기 위해 개인화된 선호도 분리 보상 모델, 선호도 정렬 기술 진화 그래프 메모리 (PSGM) 를 통합한 개인화된 에이전트 강화 학습을 위한 통합 프레임워크를 제안합니다.