ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering
ConRub-Med 是一个用于开放式医学问答的强化学习框架,它利用基于共识的模型生成评分标准以及一种专门的三态评分系统,在减少对高成本专家验证依赖的同时,实现了在多个基准测试上的最先进性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何成为一名医生。你不会仅仅要求它对一个医学问题进行猜测并寄希望于它能获得一颗金星;你会希望它能解释其背后的原因,检查它是否遗漏了任何症状,并确保它没有不小心告诉患者服用一种危险的药物。这就是**强化学习(Reinforcement Learning, RL)**的世界——这是一种人工智能训练方式,计算机通过尝试、获取反馈并调整行为以获得更高分数来进行学习。
在数学或编程等学科中,这很容易。如果机器人解出了一个方程,答案要么是对,要么是错,计算机可以立即进行检查。但医学是复杂的。患者的回答可能大部分是正确的,但可能遗漏了一个微小但至关重要的细节,或者虽然有帮助,但包含了一个可怕的错误。在这种情况下,并没有一个简单的“是/否”按钮可用。为了解决这个问题,科学家们使用了评分量表(Rubrics)——你可以把它们想象成由专家编写的详细检查清单。评分量表不再只是说“做得好”,而是将一个答案分解成微小的部分:“你识别出疾病了吗?是的。你提到了正确的药物吗?是的。你警告了副作用吗?没有。”挑战在于,编写这些清单需要人类医生花费大量时间,而且如果你使用计算机来编写它们,它可能会出错。
这就是 ConRub-Med 这篇论文所要解决的问题。研究人员想要构建一种更聪明的方法来训练医疗 AI,而无需人类医生去为每一次练习测试进行评分。他们创建了一个系统,该系统就像是一个由三个不同专家机器人组成的评审团,它们编写自己的检查清单,还有一个第四个机器人充当严格的编辑,以寻找它们共同认可的部分。
问题所在:当“足够好”并不够好时
想象一下你在参加考试,你的得分是 70%。但如果两个学生都得了 70% 怎么办?一个学生是因为掌握了事实但遗漏了一个安全警告而得到 70%;另一个学生则是猜对了答案,但包含了一个危险的、虚构的事实。如果老师仅仅给他们两人都打“70 分”,那么向这个 AI 学习的过程就无法分辨哪个学生更好。它甚至可能会学会模仿那个危险的学生,因为两者的得分是一样的。
在医疗 AI 的世界里,这是一个大问题。如果 AI 学习到,一个危险的、幻觉出来的答案与一个安全准确的答案一样好,它就可能给真实的人提供错误的建议。旧有的训练模型的方法通常将“信息缺失”(忘记了一个步骤)和“错误信息”(编造了一个谎言)视为同等对待:都视为零分。但在医学中,编造一个谎言比忘记一个步骤要严重得多。
解决方案:机器人团队与严格的编辑
来自清华大学和蚂蚁集团的研究团队开发了一种名为 ConRub-Med 的新训练流程。以下是它的工作步骤:
1. 共识委员会(三个头总比一个好)
他们没有要求一个机器人来编写评分量表(rubric),而是要求三个不同的、功能强大的 AI 模型编写各自的“优秀回答”标准清单。然后,第四个独立的机器人充当裁判。这个裁判只保留那三个原始机器人达成一致的规则。如果一个机器人认为某个特定细节很重要,但另外两个机器人没有提到,裁判就会剔除这条规则。这确保了最终的清单是基于强大的、共识性的协议,而不是单个模型的随机特性。
2. 三点计分法(不仅仅是正确或错误)
一旦制定了清单,系统就需要对答案进行评分。旧的方法是二元的:“你提到这个了吗?是 (+1) 或 否 (0)。”新系统使用三态评分法:
- 正确: 你答对了 (+1 分)。
- 缺失: 你忘记提到了 (0 分)。
- 错误: 你说了错误或危险的内容 (-1 分)。
这是一个巨大的转变。在旧系统中,一个忘记步骤的学生和一个关于步骤撒谎的学生都会得到零分。而在新系统中,撒谎者会得到负分。这教会了 AI,编造事实是一个严重的错误,而不只是一个中性的错误。
3. 决胜局(当分数相同时)
有时,即使有了新的评分机制,两个不同的答案仍可能得到完全相同的总分。如果 AI 看到两个得分相同的答案,它会感到困惑,不知道该向哪一个学习。为了解决这个问题,研究人员增加了一个“决胜局(Tie-Breaker)”步骤。当两个答案平局时,一个特殊的评判者会进行并排对比,分别以两种顺序进行比较(答案 A 对 答案 B,以及 答案 B 对 答案 A)。如果评判者认为答案 A 在两种情况下都更好,系统就会给答案 A 一个“加分”,给答案 B 一个“惩罚”。这为 AI 提供了明确的方向,即使在数学计算上它们是相等的。
研究发现
团队在大量的医学问题集上测试了这种新方法。他们创建了一个包含 5,166 个提示词(问题) 的数据集,并用它来训练他们的 AI 模型。
- 更好的清单: 当两名人类医学专家查看由这种新型“共识”方法创建的清单时,他们评价这些清单在临床相关性方面(99.3%)远高于仅由一个机器人创建的清单(约 86%)。
- 顶尖表现: 使用 ConRub-Med 训练的 AI 在处理医学问题方面表现出色。它在测试的九个主要医学基准测试中,位列前六名。
- 硬核测试: 在一个名为 HealthBench-Hard 的特别困难的测试中,新模型得分 38.98。这高于其他使用更多数据的方法(例如,一个使用了 28,000 个样本但仅得 37.30 分的方法)。
为什么这很重要
论文指出,通过结合一个“专家团队”来编写规则、一个“严格的编辑”来过滤规则,以及一个“惩罚谎言”的“三点计分卡”,我们可以教导医疗 AI 变得更安全、更准确。研究人员发现,仅仅统计“正确”答案是不够的;你必须主动抑制“错误”答案,并找到区分两个看似相同的答案的方法。
虽然结果令人鼓舞,但作者谨慎地指出,这仍然是一个研究工具。他们是在基准测试中进行了测试,并由人类专家审查了规则,但他们强调,该系统目前尚未准备好用于诊断真实的患者。它是一种训练 AI 的强大新方法,但确保其在现实世界中安全的最后一步仍需更多工作。核心结论是,在复杂的医学世界里,“足够好”的得分是不够的——你需要一个能够分辨“失误”与“谎言”的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。