Scaling Inherently Interpretable Language Models
تتحدى هذه الورقة المفهوم القائل بأن القابلية للتفسير تمثل مقايضة على حساب القدرة، وذلك من خلال إثبات أن دمج قيود القابلية للتفسير في مسار التدريب يسمح لنماذج مثل Steerling-8B بالتوسع بفعالية، لتصبح أكثر شفافية وتوافقاً مع المفاهيم البشرية مع الحفاظ على أداء تنافسي.