Few shot chain-of-thought driven reasoning to prompt LLMs for open ended medical question answering
本文介绍了 MEDQA-OPEN,这是一个包含临床医生审核推理过程的新型开放式医学数据集,并提出了 CLINICR,这是一个通过模拟临床诊断过程并结合奖励模型进行响应验证,从而优于现有方法的思维链提示框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个非常聪明、但有时过于刻板的机器人如何像医生一样行医。这篇论文是关于一种新的与该机器人沟通的方法,旨在从它那里获得最好的医疗建议。
以下是研究人员所做工作的拆解,分为几个简单部分:
1. 问题所在:“多项选择题”陷阱
研究人员从一个标准的医学测试数据集(类似于医生参加的 USMLE 考试)开始。这些测试是多项选择题 (MCQs)。
- 类比: 想象一场测验,你必须从四个选项(A、B、C 或 D)组成的菜单中选出正确答案。
- 问题: 在现实生活中,患者走进诊所说:“我觉得不舒服。”医生并没有一个四选一的菜单供其选择。他们必须从零开始推断出了什么问题。过去测试 AI 医学问题的方式,就像是问它从冰淇淋口味列表中选一个,而不是根据症状来诊断胃痛。
2. 新数据集:“MEDQA-OPEN”
为了解决这个问题,团队创建了一个名为 MEDQA-OPEN 的新数据集。
- 他们做了什么: 他们拿走了那些多项选择题中的选项(A、B、C、D)。他们把它们变成了开放式问题。
- 目标: 现在,AI 不再是挑选一个选项,而是要生成答案本身,就像真正的医生那样。他们还增加了一个特殊的“推理”部分,即 AI 必须解释它是如何一步步得出答案的。
3. 旧方法 vs. 新方法(“排除法” vs. “临床医生”)
研究人员测试了两种不同的提示(与 AI 对话)方式。
方法 A:“排除法” (MCQ-ELIMINATIVE)
- 运作方式: 这种方法给 AI 一个选项列表,并对它说:“看选项 A,是对的吗?不对?好吧,看 B。是对的吗?不对?好吧,看 C……” 这就像是在玩“猜猜他是谁”的游戏,通过不断排除名字直到剩下一个为止。
- 缺陷: 在真实的诊所里,你没有一个可以用来排除嫌疑人的名单。你必须从头开始构建诊断。研究发现,这种方法在处理多项选择测试时表现尚可,但当 AI 必须在没有菜单的情况下自由思考时,就会失败。
方法 B:“临床医生” (CLINICR)
- 运作方式: 这是本文的核心发明。它模仿了人类医生的思维方式。它要求 AI 逐件分析患者的故事。
- 第 1 步: “患者发烧了。” -> AI 思考: “可能是感染。”
- 第 2 步: “患者还有皮疹。” -> AI 思考: “好吧,也许是某种特定类型的感染。”
- 第 3 步: “患者血小板减少。” -> AI 思考: “这进一步缩小了范围。”
- 类比: “临床医生”方法不是在名单上划掉名字,而是像盖房子一样,一块砖一块砖地构建。你从基础(症状)开始,添加墙壁(检查),直到房子(诊断)完工。
- 结果: 论文表明,CLINICR 在回答开放式医学问题方面比“排除法”表现得好得多,尤其是对于较小的 AI 模型。它强迫 AI “展示其推导过程”,而不仅仅是猜测。
4. “正向-反向”策略
有时,即使是最聪明的 AI 也会卡住或给出奇怪的答案。研究人员设计了一个名为 “正向-反向法” (Forward-Backward Approach) 的安全网。
- 正向: 首先,他们使用“临床医生”方法询问 AI,让它构思出一份可能的答案清单。这就像医生说:“可能是流感,可能是肺炎,也可能是过敏。”
- 反向: 然后,他们将这些可能性交给第二个 AI(或一个“验证器”),让它选出其中最合适的一个。
- 类比: 把这想象成一名侦探。首先,侦探写下所有可能的嫌疑人名单(正向)。然后,一名资深侦探审查这份名单,并选出最有可能犯罪的那个人(反向)。
5. “奖励模型”(聪明的裁判)
他们并没有仅仅要求 AI 从列表中挑选最佳答案(如上述“反向”步骤),而是训练了一个特殊的“裁判” AI。
- 运作方式: 他们向裁判展示了数千个“优秀的推理 + 正确答案”以及“糟糕的推理 + 错误答案”的案例。
- 职责: 当主 AI 生成诊断结果时,裁判会进行检查。如果推理逻辑严密,裁判会给高分;如果推理站不住脚,裁判会给低分。
- 结果: 使用这个裁判来挑选最佳答案的效果与“正向-反向”方法一样好,但它是一种更自动化的确保质量的方式。
6. 核心结论
论文得出结论:
- 真实性至关重要: 当被要求像真正的医生一样思考(逐步构建诊断)而不是像考生一样思考(通过排除多项选择选项)时,AI 的表现要好得多。
- 推理是关键: 强迫 AI 解释其步骤(思维链)使其更加准确,尤其是在没有预设选项可以依赖的情况下。
- 验证有助于提高可靠性: 使用“裁判”来检查 AI 的工作可以确保最终答案是值得信赖的。
简而言之: 研究人员教会了 AI 停止玩“多项选择题”,开始扮演“医生”,通过一种模拟人类临床推理的逐步思考过程。这使得 AI 在回答开放式医学问题时表现得更加出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。