← 最新论文
📄 nephrology

Robustness Gap of Large Language Models in Nephrology

这项研究揭示了最先进的大型语言模型在通过“以上皆非”替换法进行肾脏病学执业医师考试题目评估时,表现出了显著的鲁棒性差距,证明了高水平的多选题准确率并不一定反映真实的临床推理能力。

原作者: Soejima, A., Kitano, F., Ichikawa, D., Shibagaki, Y., Noda, R.

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Soejima, A., Kitano, F., Ichikawa, D., Shibagaki, Y., Noda, R.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

人工智能已开始在医学领域提供支持,作为一个能够阅读海量文本并针对复杂问题提出建议的工具。在肾脏病学等领域,医生必须不断权衡实验室结果、患者病史和体征,以决定治疗方案。多年来,研究人员一直在测试这些计算机程序是否能通过医学考试,这是衡量它们是否具备实用知识的标准方式。然而,在多项选择题中获得高分并不一定意味着系统真正理解了答案背后的逻辑。它可能仅仅是在识别题目编写的方式,或者根据哪些选项看起来最熟悉来进行猜测。对于未来安全医疗服务的关键问题在于,当常规的捷径被移除时,这些模型是否能够进行逻辑推理,还是会在被迫脱离熟悉的支柱进行思考时崩溃。

来自日本圣玛丽安娜大学医学院的研究小组致力于使用一种类似于思维“压力测试”的方法来测试这一特定的弱点。他们选取了一组用于日本肾脏病专科医生资格更新的145个真实问题。这些问题涵盖了管理肾脏疾病所需的深度且复杂的推理能力。随后,研究人员为每一个问题都创建了一个修改版本。在原始测试中,有一个特定的答案是正确的;而在新版本中,他们用一个表示“以上皆非”的短语替换了那个正确答案。这迫使计算机模型去做一件困难的事情:它们不能仅仅从列表中挑选出正确选项,而是必须意识到其他所有选项都是错误的,且唯一有效的选择是那个声明“以上皆不符合”的选项。如果一个模型确实在进行医学事实的推理,它应该能够识别出原始正确答案缺失,并选择“以上皆非”的选项。如果它只是基于模式进行猜测,它很可能会选择剩余的某个错误选项。

该团队测试了四种最先进的语言模型,包括来自OpenAI和Google的系统。他们分别将原始问题和修改后的版本输入模型,要求模型每次都选出最佳答案。结果显示,当正确答案存在与被隐藏时,模型表现之间存在明显且显著的差距。当模型面对原始问题时,表现相当出色,表现最好的系统正确率接近88%。然而,一旦将正确答案替换为“以上皆非”,它们的表现便大幅下降。初始得分最高的系统仍下降到了约73%,这是一个具有统计学意义的下降。其他模型的跌幅甚至更大,其中一个从大约66%的正确率骤降至仅19%。这意味着,当熟悉的正确答案模式被移除时,模型难以依赖自身的医学推理,往往会选择一个看起来看似合理的错误选项,而不是承认正确的选择并不存在。

这项研究表明,尽管较新的模型正变得更加稳健且更擅长处理这些棘手的变化,但它们尚不足以完全可靠地进行独立的临床决策。研究人员发现,即使是最先进的系统也倾向于锚定在“可见选项中必有一个是正确”的想法上,即便病例的逻辑证明情况并非如此。在现实世界的医院环境中,这种行为可能是危险的。如果医生缺少某项信息,例如某个特定的化验值或细微的体征,一个安全的AI应当能够识别出该病例无法被判定,并请求更多数据。相反,这些模型经常会用一个自信但错误的猜测来填补空白。作者得出结论:通过多项选择考试不足以证明一个模型能够像医生一样进行推理。要使这些系统在肾脏护理中真正安全可用,它们需要展示出能够处理不确定性,并识别出何时无法获得答案的能力,而不仅仅是匹配模式以在测试中获得最高分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →