ReAD: Reinforcement-Guided Capability Distillation for Large Language Models
يُعد ReAD إطار عمل لتقطير القدرات الموجه بالتعزيز، يعالج الترابط بين قدرات النموذج من خلال تخصيص ميزانية ثابتة من الرموز (tokens) ديناميكيًا لتحسين المنفعة في المهام اللاحقة مع تقليل الآثار الجانبية الضارة والجهد الضائع.