Condence, Calibration, and Abstention in Small Open-Weight Language Models on Psychiatric Knowledge Questions: A Cross-Domain Replication
Este estudio piloto demuestra que los modelos de lenguaje pequeños de pesos abiertos aplicados a preguntas de conocimiento psiquiátrico exhiben una mala calibración de confianza, clasificaciones de precisión dependientes del dominio, y que el instarlos a abstenerse de responder a menudo degrada en lugar de mejorar el rendimiento cuando se evalúa con estadísticas emparejadas rigurosas.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.