Mitigating Exploration Bias in RL for Multi-Instruction Following
تتناول هذه الورقة البحثية انحياز الاستكشاف نحو التعليمات السهلة في اتباع التعليمات المتعددة القائم على التعلم التعزيزي، وذلك عبر اقتراح إطار عمل ثنائي المراحل يجمع بين التمهيد السلوكي لتنشيط التعليمات الصعبة والمكافآت المدركة للندرة لإعطائها الأولوية، مما يحسن أداء النموذج بشكل كبير عبر المعايير القابلة للتحقق.