← 最新论文
💻 computer science

Evaluating Clinical Symptom Extraction and Reasoning in Local Large Language Models: A Proof-of-Concept Study of Symptom-Specific Performance in Cardiology

这项概念验证研究评估了在本地部署的大型语言模型(Gemma3 和 Qwen3.5)在日语心脏科出院小结上的表现,结果显示,虽然整体症状提取准确率较高,但不同具体症状之间的表现存在差异,且这些模型往往通过客观临床发现而非患者明确的主诉来推断心悸或乏力等症状。

原作者: Shun Kitamura, Eisuke Amiya, Yoshihiro Izawa, Risa Kishikawa, Takenobu Shimada, Junichi Ishida, Satoshi Kodera, Norihiko Takeda

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Shun Kitamura, Eisuke Amiya, Yoshihiro Izawa, Risa Kishikawa, Takenobu Shimada, Junichi Ishida, Satoshi Kodera, Norihiko Takeda

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

医院每天都会产生大量的书面记录,从最初对患者疼痛的描述到最后关于康复的记录。这些信息中的大部分都锁在自由流动的段落文本中,使得快速分类、搜索或分析变得困难。几十年来,医生和研究人员一直依赖人工努力来阅读这些笔记并提取特定细节,这是一个缓慢且乏味的过程,且容易出现人为错误。最近,一种被称为大语言模型的全新类型的计算机程序出现了,成为一个潜在的解决方案。这些系统在庞大的文本库上进行训练,能够很好地理解人类语言,从而可以阅读医疗笔记并识别特定的事实,例如患者是否提到感到呼吸短促或胸痛。由于这些工具可以在医院自己的安全计算机内完全运行,而无需将隐私数据发送到外部世界,因此它们提供了一种很有前景的方式,可以将杂乱的手写或打字笔记转化为干净、有序的数据,用于改善患者护理。

东京大学的一个研究小组致力于测试这两个本地计算机程序在心力衰竭这一特定且高风险领域执行此任务的效果如何。他们专注于正在接受心脏移植评估的晚期心力衰竭患者,这类患者的症状复杂且多样。研究人员选择了来自他们自己医院的十份真实患者记录,时间跨度为2017年至2023年。这些记录是用日语编写的,包含了每位患者住院的完整过程,包括他们的主诉、医生在检查中的发现以及他们的病情随时间的变化。研究小组要求计算机程序查看这十个故事,并识别出移植所需的八种特定症状的存在与否,例如心悸、极度疲劳和晕厥。为了确保计算机的答案准确,五位资深心脏专家独立审查了这十个故事,并针对每种症状达成了一个“标准答案”(ground truth),从而建立了一个可靠的标准来衡量机器。

研究人员在不同的指令集下测试了计算机程序,以观察请求措辞的变化如何影响结果。在一种情景中,程序被告知要扫描整个病史以寻找任何关于症状的提及。在另一种情景中,程序被明确告知要忽略可能在患者既往病史中提到的任何症状,而应只关注本次住院期间发生的情况。他们还测试了要求程序“大声思考”并在给出答案前解释其推理过程是否会提高准确性。研究发现,两个计算机程序在执行该任务时总体上表现得相当出色,在大多数情况下都能正确识别症状的存在或缺失。然而,表现并非完美,且错误并非随机发生。计算机在两种特定症状上表现得最吃力:一是心悸(即感觉心脏跳动过快或剧烈跳动),二是易疲劳性(或指一种压倒性的疲劳感)。

当研究人员检查计算机犯下的错误时,他们发现机器在思考过程中存在明显的模式。对于心悸这一症状,程序经常仅仅因为医疗记录显示有异常心律或心率过快,就判定患者正经历心悸,即使患者从未在文字中写下或口述过感觉到心脏跳动过快。计算机是从客观医学数据而非直接的患者主诉中推断出了该症状。同样,对于易疲劳性,程序经常因为患者患有心力衰竭(一种已知会导致疲劳的疾病)而得出患者很累的结论,即使具体的记录中完全没有提到疲劳。计算机是在用医学逻辑填补空白,而不是严格遵循文本内容。这种倾向非常强烈,以至于在某些情况下,计算机正确识别出患者有心律不齐,却仍错误地声称患者感到心悸;而在其他具有相同医学发现的情况下,它又正确地表示患者并没有这种感觉,这表明其推理存在不一致性。

研究还揭示了指令的措辞方式具有显著影响。当研究人员告诉其中一个程序忽略既往病史并仅关注当前的住院情况时,该程序在寻找症状时变得更加谨慎,但也漏掉了许多实际存在的症状。它由于过于严格地要求忽略任何非当前语境中明确记载的内容,以至于未能捕捉到那些显然属于患者当前状况的症状。这表明,虽然这些计算机程序功能强大,但它们并不像人类那样单纯地阅读文字;它们会根据学到的医学关联和模式来解读文本。它们可以基于其他事实推断出某种症状的存在,这虽然有用,但在推断错误时也会导致误差。研究人员指出,这些发现是基于较少的病例得出的,且程序根据特定指令的表现各不相同,这表明该技术仍在不断演进中。

最终,这项工作表明,虽然本地计算机程序可以实现医疗信息的自动化提取,但它们尚未取代人类读者的细致判断。机器能够理解医疗笔记的语境,但有时它们会让自身关于疾病运作方式的知识凌驾于页面上实际记载的内容之上。为了使这些工具在医院环境中真正发挥作用,开发者需要了解程序是如何进行诊断推理的,以及如何引导它们依赖明确的患者主诉而非医学假设。该研究是一项概念验证,证明了这些系统可以在医院的安全网络内运行并处理复杂的医疗文本,但也强调了进行仔细监督的必要性,以确保自动化的症状提取保持准确和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →