Extreme Region Policy Distillation
تعالج سياسة تقطير المنطقة القصوى (ERPD) المقايضة بين كفاءة العينات والأداء التقاربي في التعلم المعزز للنماذج اللغوية الكبيرة من خلال فصل التحسين القائم على السياسة غير المتصلة والعدواني عن قيود منطقة الثقة المحافظة، وذلك عبر استخراج أقصى إشارات التدريب من البيانات الثابتة أولاً ثم تقطيرها في سياسة أساسية لتحقيق أداء فائق مع تقليل تباعد كيه إل (KL divergence) بشكل كبير.