← 最新论文
💬 NLP

Evaluating the Pre-Consultation Ability of LLMs using Diagnostic Guidelines

本文介绍了 EPAG,这是一个用于根据诊断指南评估大语言模型预咨询能力的基准框架和数据集,其结果表明,经过微调的小型开源模型可以超越前沿模型,且增加患者病史并不总能提高诊断准确性。

原作者: Jean Seo, Gibaeg Kim, Kihun Shin, Seungseop Lim, Hyunkyung Lee, Wooseok Han, Jongwon Lee, Eunho Yang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Jean Seo, Gibaeg Kim, Kihun Shin, Seungseop Lim, Hyunkyung Lee, Wooseok Han, Jongwon Lee, Eunho Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一位新助手,帮助医生在患者踏入诊室之前就查明其病因。这位助手是人工智能,具体而言是一个大语言模型(LLM)。核心问题是:这位 AI 是否擅长提出正确的问题,以获取完整的病史?

本文介绍了一项名为EPAG的新“测试”,旨在回答上述问题。可以将 EPAG 视为针对这些 AI 助手的严格训练营和评分系统。

以下是其工作原理的分解,采用简单的类比说明:

1. 设置:“角色扮演”游戏

在真实的诊所中,医生会向患者提问,以构建“现病史”(HPI)——即关于疼痛部位及发生时间的完整故事。

  • 演员:研究人员创作了一出数字戏剧。一个 AI 扮演患者(拥有特定、预先写好的医疗故事),另一个 AI 扮演医生(接受测试的对象)。
  • 剧本:“医生”AI 最初仅掌握患者的年龄、性别和主诉(例如“我胸痛”)。随后,它必须向“患者”AI 提出问题并提供多项选择题,以深入挖掘细节。
  • 目标:医生 AI 需要收集足够的线索来解开谜团。

2. 评分:两种评估 AI 的方式

研究人员并未仅仅询问"AI 是否猜对了疾病?”,而是从两个截然不同的角度对 AI 进行评分:

  • 等级 A:“清单”评分(直接评估)
    想象一名侦探拥有一份解决案件所需的特定线索清单(即“诊断指南”)。在 AI 完成访谈后,一个独立的 AI(“组织者”)将对话拆解为微小的、独立的事实。另一个 AI(“比较器”)进行检查:医生 AI 是否询问了清单上的这条特定线索?

    • 如果 AI 提出了正确的问题并获得了正确的答案,它就能得分。
    • 如果它遗漏了关键线索,则会扣分。
    • 某些线索的价值高于其他线索(例如发现确凿证据与发现无关紧要的线索),因此存在“加权”评分。
  • 等级 B:“诊断”评分(间接评估)
    访谈结束后,笔记会被交给第三个 AI(“诊断专家”)。该 AI 查看笔记并尝试推测疾病。如果笔记质量高,诊断专家就能猜对;如果笔记杂乱无章或遗漏了关键细节,猜测可能会出错。

3. 重大发现

研究人员测试了 11 种不同的 AI 模型,范围从庞大、昂贵的“超级大脑”到较小的开源模型。以下是他们的发现:

  • 更大并不总是更好:你可能会认为最昂贵、最庞大的 AI 会每次都获胜。事实并非如此。在这场“提问”的特定游戏中,一个在特定数据集上经过微调(专项训练)的较小开源模型(Qwen2.5-32B)实际上击败了那些庞大且昂贵的模型。
    • 类比:这就像一位专门修理特定车型的汽车技师,击败了一位对世界上所有车型都略知一二的通才。
  • 更多的问题并不意味着更好的答案:研究人员发现,仅仅提出更多的问题并不会自动带来更好的诊断。
    • 类比:如果你试图在干草堆里找一根针,询问关于干草颜色的 100 个问题可能无助于你找到那根针。有时,提出太多不相关的问题反而会混淆诊断。
  • 语言改变风格:当 AI 使用英语时,它倾向于针对单一症状提出深入、重复的问题(例如深入探究头痛);而当它使用韩语时,则采取更广泛的网罗策略,询问关于许多不同身体部位的问题。有趣的是,“广撒网”的方法在“清单”评分上得分更高,而“深挖”的方法在推测最终疾病方面略胜一筹。

4. 这意味着什么(根据论文所述)

论文结论指出,为了使 AI 在真实诊所的预咨询中发挥作用,我们不应仅仅将资金投入到最大的模型上。相反,我们应该:

  1. 针对性训练:为较小的模型提供关于如何提出医疗问题的高质量、特定训练数据。
  2. 重质不重量:关键在于提出正确的问题,而非许多问题。
  3. 使用合适的语言:所使用的语言会改变 AI 的思维方式及其提问方式。

重要提示:论文明确指出,该测试涵盖基于文本的对话。它不包括需要 X 光、磁共振成像(MRI)或物理触诊的疾病。因此,这些结果仅适用于医学中的“问诊”环节,而非整个医疗过程。

简而言之,EPAG 是一把新的标尺,用于衡量 AI 在电话或聊天中扮演一位好奇且详尽的医生的能力,证明了一个经过良好训练的小型模型有时能胜过庞大但未受训练的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →