Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring
تقدم هذه الورقة البحثية TELLME، وهي طريقة مبتكرة تعزز الشفافية الجوهرية وقابلية المراقبة للنماذج اللغوية الكبيرة من خلال تحسين عمليات التفكير الكامنة لديها، مما يتيح تحديداً أكثر فعالية للسلوكيات غير المناسبة ويُظهر مكاسب أداء متسقة عبر مختلف البنى ومهام إزالة السموم.