Attention-Guided Layer Selection for Contrastive Decoding in Large Language Models
تقترح هذه الورقة ثلاث استراتيجيات لاختيار الطبقات بتوجيه من الانتباه (Attention-JSD، وAttention-Entropy-Max، وAttention-Entropy-Min) تستفيد من آليات الانتباه الذاتي الداخلية لتحسين واقعية النماذج اللغوية الكبيرة، مما يظهر مكاسب أداء ثابتة مقارنة بطريقة DoLa الأصلية في اختبارات TruthfulQA.