Condence, Calibration, and Abstention in Small Open-Weight Language Models on Psychiatric Knowledge Questions: A Cross-Domain Replication
Diese Pilotstudie zeigt, dass kleine, Open-Weight-Sprachmodelle, die auf psychiatrische Wissensfragen angewendet werden, eine schlechte Konfidenzkalibrierung sowie domänenspezifische Genauigkeitsrankings aufweisen und dass das Auffordern dieser Modelle, der Antwort zu entziehen, die Leistung verschlechtert anstatt sie zu verbessern, wenn sie mit rigorosen gepaarten Statistiken evaluiert werden.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.