Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
تقدم هذه الورقة SAERL، وهو إطار عمل لهندسة البيانات يستفيد من المشفّرات التلقائية المتناثرة (Sparse Autoencoders) لاستخراج إشارات النموذج الجوهرية المتعلقة بتنوع البيانات وصعوبتها وجودتها، مما يؤدي إلى تحسين التعلم التعزيزي لما بعد التدريب للنماذج اللغوية الكبيرة (LLM) بدقة وكفاءة أفضل.