💻 computer science
Condence, Calibration, and Abstention in Small Open-Weight Language Models on Psychiatric Knowledge Questions: A Cross-Domain Replication
이 파일럿 연구는 정신의학 지식 질문에 적용된 소규모 오픈 웨이트 언어 모델들이 불량한 신뢰도 보정(confidence calibration)과 도메인 의존적인 정확도 순위를 보이며, 엄격한 쌍체 통계(paired statistics)로 평가했을 때 답변을 유보하도록 유도하는 프롬프팅이 성능을 개선하기보다 오히려 저하시킨다는 점을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.