💻 computer science
Condence, Calibration, and Abstention in Small Open-Weight Language Models on Psychiatric Knowledge Questions: A Cross-Domain Replication
このパイロット研究は、精神医学の知識問題に適用された小型のオープンウェイト言語モデルが、不十分な信頼度較正およびドメイン依存の精度ランキングを示し、さらに厳密なペア統計を用いて評価した場合、回答を控えるよう促すプロンプトが性能を向上させるどころかむしろ低下させることを実証している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。