Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits
تتحدى هذه الورقة البحثية الحدس القائل بأن خرائط الانتباه الحادة تشير إلى الموثوقية في نماذج الرؤية واللغة، حيث تُثبت من خلال التحليل الآلي أن بنية الانتباه هي متنبئ شبه معدوم بالصحة، بينما توفر هندسة الحالة الخفية ودوائر الطبقات المتأخرة المتفرقة مؤشرات أكثر دقة بكثير على موثوقية النموذج.