← 最新论文
💬 NLP

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

该论文介绍了 MedUPS,这是一个对齐框架及相应的数据集(MedUPSQA),它通过利用强化学习训练大语言模型来预测中间临床决策,从而提升了对罕见医学病例的诊断辅助能力,进而使下一步预测准确率超越了基座模型及规模更大的前沿模型。

原作者: Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个巨大且复杂的谜团,但你并不是被直接递上最终答案,而是必须通过线索一步步将其拼凑起来。这正是现实世界中的医生工作方式。他们不会得到一份包含完整病史、所有检查结果和最终诊断的整齐包裹。相反,患者带着一个症状走进诊室,医生下达一项检查指令,得到一个结果,然后必须做出决定:下一步该做什么? 是预约核磁共振(MRI)?是联系专科医生?还是尝试另一种药物?这个过程是一个“下一步”的旅程,每一次决策都是在只有部分信息且前行路径往往模糊不清的情况下做出的。

在人工智能领域,我们创造了“大语言模型”(LLMs)——能够像人类一样阅读和写作的超智能计算机大脑。科学家们一直在训练这些 AI 扮演医生的角色,但我们用来评估它们的大多数测试都像是高风险的期末考试。AI 被给予一个包含所有线索的完整故事,并被要求猜出最终诊断。虽然这有助于检查 AI 是否知道答案,但它无法告诉我们,当故事仍在展开时,AI 是否具备像医生一样思考的能力。这就像是在评价一名侦探时,只看他在最后是否破案,却不检查他在收集证据的过程中是否做出了正确的选择。这篇题为 MedUPS 的论文提出了一个至关重要的问题:我们能否教会这些 AI “医生”在谜团尚未揭晓的中途,如何做出正确的“下一步”动作?

新的游戏计划:学会走路,再尝试奔跑

MedUPS 的研究人员意识到,为了帮助医生应对罕见且棘手的病例,他们需要停止将医疗案例视为静态的考试题目,而应将其视为一个随时间展开的故事。他们构建了一个名为 MedUPS 的新训练系统,这就像是 AI 的电子游戏,目标不是直接跳到终点线,而是在每一个关卡都做出最好的移动。

为此,他们创建了一个庞大的库,名为 MedUPSQA。他们提取了超过 5,500 份真实的医疗病例报告——即关于患有罕见疾病患者的故事——并将它们按时间顺序切分成“块”。想象一下电影胶片被剪成一帧帧画面。对于每一帧,他们都会询问 AI:“基于你目前所见到的信息,逻辑上最合理的下一步是什么?”答案不是最终诊断,而是一个具体的行动,比如“进行血液检查”或“转诊给心脏科医生”。他们生成了超过 21,000 个这样的“下一步”决策点。

巧妙之处在于他们如何教导 AI。他们并没有只是向 AI 展示正确答案并说“记住这个”(这被称为监督式微调),而是使用了一种称为强化学习的方法。你可以把它想象成一位站在 AI 玩家身边的教练。AI 对下一步做出猜测,而教练(一个充当评委的外部 AI)会根据该猜测的好坏给出评分。如果 AI 做出了明智的举动,它会获得奖励;如果做出了错误的举动,它则会受到惩罚。经过数千次的尝试,AI 学会了如何在模糊的医疗路径中航行,变得擅长预测下一个逻辑步骤,而无需预先告知最终诊断。

他们的发现:小脑瓜,大动作

结果令人惊讶且令人兴奋。团队在三种不同的 AI 模型上测试了他们的新训练方法,这些模型的规模从较小的(80 亿参数)到较大的(270 亿参数)不等。他们发现,教导 AI 关注“下一步”带来了巨大的差异。

对于他们测试的最大模型——一个拥有 270 亿参数的 AI 模型 Qwen3.6-27B,预测正确下一步的准确率从 55.2% 跳升至 66.7%。这是一个巨大的进步。更有趣的是,较小的模型也表现出了同样显著的提升,甚至相对于其初始水平而言提升更多。90 亿参数的模型从 47.2% 提升到了 57.8%,而 80 亿参数的医疗模型则从 37.8% 提升到了 44.4%

这里有一个挑战常规 AI 规则的转折点:大并不一定意味着更好。 在这种特定的进行中途医疗决策的任务中,一个经过良好训练的小型 AI 实际上比那些通常被认为是最聪明的巨型“前沿”模型表现得更好。研究人员发现,一个经过他们这种新方法训练的 270 亿参数模型,可以超越许多规模大得多的闭源模型。这表明,对于复杂的现实医疗推理,训练 AI 的方式(关注过程而非仅仅是目的地)可能比单纯扩大 AI 的规模更为重要。

局限性:它不是魔杖

尽管结果令人鼓舞,但作者们很谨慎,并未声称他们已经“解决”了医疗诊断问题。他们指出,他们的系统依赖于一个 AI “评委”来对答案进行评分,虽然他们通过测试不同的评委来确保公平性,但仍存在评分结果取决于评委是谁的可能性。他们还强调,这些是“下一步”预测,而非最终疗法。AI 正在学习建议下一步的检查或专科医生,而不是取代医生。

此外,当他们仔细观察 AI 犯下的错误时,发现许多“错误”其实并非推理错误。有时 AI 提出了一个完全合乎逻辑的步骤,但病例报告中的真实医生却采取了略微不同的做法。这表明在混乱的现实世界中,并不总是存在唯一的“正确”答案,而 AI 正在学习如何应对这种灰色地带。

为什么这很重要

MedUPS 的核心启示是,我们可能不需要构建无限巨大的 AI 模型来获得卓越的医疗辅助。相反,我们可能只需要教会它们像人类一样思考:循序渐进,应对不确定性,并利用我们此时此刻掌握的信息做出最佳决策。通过专注于患者旅程的“中途”,这种方法为创建能够真正帮助医生应对最困难和最罕见病例的 AI 工具提供了一条新路径,将一场静态的考试变成了一场动态的、有益的对话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →