Performance evaluation and benchmarking across 16 large language models on a comprehensive real-world emergency department triage data set
本研究通过对真实世界的急诊科分诊数据进行 16 个大语言模型的基准测试发现,尽管结构化提示可以使模型在严重程度分类上与人类护士达成实质性的一致,但大多数模型仍表现出准确性有限、科室分配不佳、系统性过度自信以及非确定性行为,这表明在经过进一步验证和改进之前,它们尚不具备临床应用的条件。