← 最新论文
💬 NLP

MedicalAgentsBench for Complex Medical Reasoning: Comparing Internalized Reasoning Models versus Externalized Agent-based Frameworks

本文介绍了 MedicalAgentsBench,这是一个包含 862 个复杂临床问题的精选基准测试,旨在证明将内化推理模型与外部化智能体框架相结合,比单独使用其中任何一种方法具有更优越的性能和成本效率。

原作者: Yanjun Shao, Xiangru Tang, Jiwoong Sohn, Jiapeng Chen, Yuxuan Liao, Jiayi Zhang, Jinyu Xiang, Fang Wu, Yilun Zhao, Chenglin Wu, Wenqi Shi, Arman Cohan, Mark Gerstein

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanjun Shao, Xiangru Tang, Jiwoong Sohn, Jiapeng Chen, Yuxuan Liao, Jiayi Zhang, Jinyu Xiang, Fang Wu, Yilun Zhao, Chenglin Wu, Wenqi Shi, Arman Cohan, Mark Gerstein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解决一个非常棘手的医学谜题,就像一名侦探正在努力查明病人为何生病一样。你有两种主要的方式来利用人工智能(AI)来帮助你解决这个案例。

这篇名为 "MedicalAgentsBench" 的论文,就像是研究人员为了测试这两种 AI 方法中哪种在复杂医学推理中表现更好而设计的一场超级困难的“大型考试”。

以下是他们测试的两种方法的拆解,使用了简单的类比:

两种方法

1. “超级天才”(内在推理)
这就像是聘请了一位极其聪明、受过良好训练的医生,他研读了数百万本医学书籍,并已经将思考问题的过程练成了本能。

  • 运作方式: 当你提出一个问题时,这个 AI 模型会在自己的“大脑”内部进行深度思考后再给出答案。它不需要外界帮助,只需进行内部逻辑处理。
  • 论文的发现: 这些“超级天才”模型(如 o3-mini 和 DeepSeek-R1)非常擅长独立解决难题。它们就像一位能够独自破案的才华横溢的侦探。

2. “专家圆桌会议”(外部化智能体框架)
这就像是聘请了一个由不同专家组成的团队(心脏科医生、外科医生、药剂师等),让他们围坐在一张桌子旁讨论这个病例。

  • 运作方式: 与其让一个 AI 独自思考,不如将问题分解,让多个 AI “智能体”(agents)相互交流、辩论、检查彼此的工作并对答案进行投票。
  • 论文的发现: 这种团队协作的方法也非常有效。它就像是获得第二意见或第三意见,从而捕捉到第一个人可能遗漏的错误。

核心问题

研究人员想知道:这两种方法是竞争对手(即你必须二选一),还是队友(即你可以将两者结合使用)?

结果:“力量组合”

该论文的主要发现是:它们是队友,而非对手。

  • 团队协作法胜出: 最好的结果来自于将“超级天才”模型放入“圆桌会议”中与其他智能体共同协作。
  • 类比: 想象你有一位才华横溢的侦探(超级天才)。如果你让他独自工作,他很出色。但如果你把这位天才侦探放在一个由专家组成的团队中,让他们核实他的工作、辩论线索并发现错误,他就会变得无懈可击
  • 得分: 这种“超级天才”模型加上“智能体团队”的组合,在困难测试中达到了最高的准确率(35.1%)。这显著优于仅使用天才个体或仅使用普通医生团队的表现。

“困难考试”(MedicalAgentsBench)

为了确保测试的公平性,研究人员并没有使用简单的题目。

  • 问题所在: 大多数现有的医学测试就像高中水平的测验。即使是普通的 AI 也能达到 90% 的正确率,因此无法区分谁是真的聪明。
  • 解决方案: 研究人员构建了一个新的测试——MedicalAgentsBench。他们从八个不同的医学数据集中提取问题,并进行了筛选,最终选出了 862 个最难的问题,即使是目前最优秀的 AI 模型也难以应对(正确率低于 50%)。
  • “污染”检查: 他们还通过一种特殊工具检查了 AI 是否只是“背诵”了训练数据中的答案(就像学生通过背诵答案解析来作弊一样)。他们要确认 AI 是在进行真正的推理,还是仅仅在重复它见过的内容。

成本 vs. 性能(“钱包”检查)

论文还考察了运行这些模型的“成本”(即需要消耗多少资金和计算能力)。

  • 权衡: 使用智能体团队的成本更高,因为你需要多次运行 AI 以实现它们之间的对话。
  • 最佳平衡点: 研究人员找到了一个“帕累托前沿”(Pareto Frontier,一种表示最佳性价比的专业说法)。
    • 如果你的预算很小,你可以使用一个廉价的模型配合一个简单的“工作流优化器”(轻量级的团队助手)。
    • 如果你想要最好的结果,最好的选择是使用强大的“超级天才”模型,并在其之上增加智能体团队。这种组合能以投入的资金换取最高的准确率。

一句话总结

该论文证明,对于最困难的医学问题,最好的策略不是在“聪明的单体 AI”或“AI 团队”之间做选择,而是将两者结合:利用具备强大推理能力的 AI,并让它与智能体团队协作来核实其工作,从而实现最准确的医疗决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →