From token probabilities to calibrated confidence: An empirical study of mathematical question answering
تتقصى هذه الدراسة التجريبية طرق معايرة الثقة في النماذج اللغوية الكبيرة للإجابة على الأسئلة الرياضية، وتجد أنه بينما توفر احتمالات الرموز (tokens) في المرة الواحدة إشارة محدودة، فإن تجميعها وتوظيف استراتيجيات متعددة المرات مثل التحقق الذاتي أو إسقاط مونت كارلو (Monte Carlo Dropout)، متبوعة بتقنيات المعايرة البعدية، يمكن أن يحسن بشكل كبير من التوافق بين الثقة المقدرة والدقة الفعلية.