Towards Reliable, Generalizable, and Specific In-Context Knowledge Editing via Multi-Objective Reinforcement Learning
تقترح هذه الورقة البحثية خوارزمية "تحرير المعرفة في السياق متعدد الأهداف" (MO-IKE)، وهي خوارزمية تعلم تعزيزي متعدد الأهداف تصيغ بناء المطالبات كعملية ماركوف لاتخاذ القرار المقيد لتحسين الموثوقية والعمومية والخصوصية في آن واحد، مما يحقق أداءً فائقاً في تحديث معرفة النماذج اللغوية الكبيرة مقارنة بالطرق السابقة.