← 最新论文
💻 computer science

RheumBench: A Specialist-Validated Rubric-Based Benchmark for Evaluating Large Language Models in Rheumatology

RheumBench 是首个经过专科验证、基于评分标准的风湿病学基准测试,它评估了十个大语言模型(LLM)及检索增强生成(RAG)系统,揭示了当前模型存在显著的性能差距、系统性过度自信以及潜在的严重遗漏错误,从而强调了在临床决策支持中进行人工监督的紧迫需求。

原作者: Fabian Lechner, Jonathan Bamberger, Phillip Kremer, Jutta Richter, Matthias Schneider, Uta Kiltz, Sebastian Kuhn, Lucie Flek, Philipp Klemm, Axel J Hueber, Martin Krusche, Hannah Labinsky, Johannes Kn
发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Fabian Lechner, Jonathan Bamberger, Phillip Kremer, Jutta Richter, Matthias Schneider, Uta Kiltz, Sebastian Kuhn, Lucie Flek, Philipp Klemm, Axel J Hueber, Martin Krusche, Hannah Labinsky, Johannes Knitza

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代诊所中,医生越来越多地转向人工智能,以帮助处理复杂的症状、权衡治疗方案并做出艰难的决策。这些被称为大语言模型的工具是强大的计算机程序,它们在海量文本上进行训练,使其能够理解并生成类人语言。它们可以阅读病历、回答有关疾病的问题,并建议下一步的患者护理措施。虽然这些系统带来了更快、更便捷的支持前景,但它们也带有显著风险。如果一个计算机程序给出了一个自信但错误的答案,可能会导致患者接受错误的治疗或错过关键的诊断。风湿免疫科(处理关节、肌肉和免疫系统疾病的领域)具有极高的复杂性,涉及数百种外观相似的不同疾病。由于风险极高,专家需要一种可靠的方法来测试这些数字助手在信任它们处理真实患者之前,是否真的安全且准确。

为了解决这一需求,来自德国数所大学和医疗中心的科研团队创建了一个新的测试场,名为 RheumBench。这是第一个专门设计的评估系统,旨在衡量人工智能在风湿免疫学领域的表现。研究人员不仅仅要求计算机回答多项选择题;相反,他们构建了一个基于现实临床场景的严谨框架。他们收集了一百个详细的病例,包括七十个旨在识别正确疾病的诊断谜题,以及三十个需要关于治疗、咨询和随访建议的管理情境。针对每一个病例,一个由获得执业资格的风湿科医生组成的专家小组创建了一份详细的评分指南,或称“量规”。该指南列出了一个优秀的医生应该采取的具体行动,例如订购特定的检查或开具某种药物,同时也列出了应当避免的行为。指南中的每一项得分都根据重要性进行了加权,某些正确的行动会获得高分,而某些不当或危险的行为则会扣分。

随后,研究人员使用这一百个病例对十种不同的人工智能系统进行了测试。该组包括三种目前最先进的通用型计算机模型、一种开源模型,以及六个专为医学用途设计的系统(其中包括两个正式认证为医疗器械的系统,以及一个专门为风湿免疫学构建的系统)。计算机被要求对这些病例提供答案,其响应结果根据专家创建的量规进行评估。为了处理大规模的评分工作,研究人员使用了另外三个先进的计算机模型作为评委,通过对照评分指南来检查每个答案。这一过程产生了超过五万次单独的评估,随后这些评估结果被与人类风湿科医生的判断进行对比,以确保计算机评委的准确性。结果显示,人类专家与计算机评委之间存在高度的一致性,从而验证了该方法的有效性。

研究结果揭示了一个性能差异巨大的图景。那些并非专门为医学设计的最先进通用型计算机模型,其表现实际上优于那些专为临床用途设计的系统。表现最好的系统得分仅为 54.0%,这意味着它遵循专家指南的比例仅略高于一半。相比之下,专门为风湿免疫学构建的系统得分最低,仅为 17.8%。即使是那些被监管为医疗产品的认证医疗器械,也未能持续超越通用模型。这表明,拥有专门的研究方向或官方医疗认证并不自动保证人工智能系统会提供更好或更安全的建议。研究还发现,提问的方式会产生巨大影响。当研究人员使用更详细、更周全的提示词时,大多数系统的表现都有所提升,其中一个模型甚至达到了 72.9% 的得分。然而,即便有了这些改进,也没有任何一个系统达到可以脱离人类监督而独立运行的完美水平。

安全性是整个测试过程中的一个主要关注点。研究人员寻找可能导致严重伤害的错误。他们发现,在所有受试系统中都出现了潜在的严重错误,包括那些认证过的医疗产品。最常见的错误类型是“遗漏”,即计算机未能提出必要的行动,例如订购关键检查或将患者转诊给专科医生。虽然这些系统通常能够避免直接造成伤害的行为,但它们在需要采取行动时的失能是一个显著风险。此外,计算机表现出一种令人不安的过度自信模式。它们经常对自己的答案报告极高的确定度,甚至在实际表现远低于此的情况下,仍声称确定度超过 90%。这种“自我感觉”与“实际正确率”之间的差距在所有系统中普遍存在,这表明用户不能依赖计算机自身的置信度评级来判断其建议的质量。

研究结论认为,尽管人工智能在支持风湿免疫科医生方面具有潜力,但目前的系统尚未准备好取代人类判断。通用模型往往比专门的医疗工具表现更好,这一事实挑战了“医疗认证或细分领域训练会自动带来更高安全性或准确性”的假设。研究人员强调,人类的监督仍然至关重要,特别是由于这些系统可能会犯严重的错误,并且往往意识不到自己错了。RheumBench 框架将通过增加更多病例和场景来持续更新,以追踪改进情况,并确保未来版本的工具对患者更加安全。在此之前,计算机的角色应被视为需要经过专业医生仔细检查的辅助工具,而非自主决策者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →