Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration
تُظهر هذه الورقة أن معايرة ثقة النماذج اللغوية الكبيرة حساسة للغاية لبروتوكولات القياس — وتحديداً سياق التكييف، وقراءة احتمالية الرمز (token)، واختيار الإجابة — مما يكشف أن الثقة المُعبّر عنها لفظياً غالباً ما تعكس معقولية الإجابة بدلاً من صحتها، وتحث على اعتماد قوائم مراجعة معيارية للتقارير من أجل تقييم موثوق.