Condence, Calibration, and Abstention in Small Open-Weight Language Models on Psychiatric Knowledge Questions: A Cross-Domain Replication
Cette étude pilote démontre que les petits modèles de langage à poids ouverts appliqués à des questions de connaissances psychiatriques présentent un mauvais étalonnage de la confiance, des classements de précision dépendants du domaine, et que le fait de les inciter à s'abstenir de répondre dégrade souvent plutôt qu'il n'améliore la performance lorsqu'ils sont évalués avec des statistiques appariées rigoureuses.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.