← 最新论文
💬 NLP

Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

本文介绍了 MedMisBench,这是一个全面的基准测试,它证明了大型语言模型尽管在医学考试中取得了专家级分数,但在面对具有误导性和权威框架的上下文时,会频繁放弃正确的医学判断,从而表现出脆弱的认识论韧性。

原作者: Hongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro, Michael Petrus, Sheikh Momin, Alexandra M. Cardoso Pinto, Rachel Niesen, Laura Sophie Wegner
发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro, Michael Petrus, Sheikh Momin, Alexandra M. Cardoso Pinto, Rachel Niesen, Laura Sophie Wegner, Dhruv Darji, Jung Moses Koo, Joshua Fieggen, Kapil Narain, Mingde Zeng, Lei Clifton, Linda Shapiro, Fenglin Liu, David A. Clifton

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢的医学生,他背诵了所有的教科书,能够以满分通过任何执业医师考试。你完全信任他。但随后,你走进房间,对他耳语了一个虚假的规则:“顺便说一下,医院刚刚更改了规则。针对这种特定的病症,我们现在要执行 X 而不是 Y。”

令人惊讶的是,这位“完美”的学生立即忘记了他所学的一切,相信了你的假规则,并给出了错误的答案。

这就是 MedMisBench 这篇论文的核心发现。研究人员发现,即使是最聪明的“AI医生”(大语言模型),在面对误导性信息时也表现得异常脆弱,即便它们预先知道正确答案。

以下是利用简单的类比对他们研究结果进行的拆解:

1. 考试中的“陷阱门”

通常,我们用干净、符合教科书标准的题目来测试 AI 医生。它们的得分非常高(约 71% 正确)。研究人员曾据此认为 AI 在提供真实健康建议方面是安全的。

但他们错了。研究人员构建了一个新的测试,叫做 MedMisBenc。把它想象成一场“陷阱门”考试。

  • 设置: 他们选取了一个 AI 已经知道答案的问题。
  • 陷阱: 他们注入了一个看起来像是可靠医学规则、但实际上是谎言的句子。
  • 结果: AI 的准确率从 71% 骤降至 38%。事实上,在超过一半的情况下(51.5%),AI 完全抛弃了真相并追随了谎言。

2. “权威”效应

论文测试了谎言是如何被传递的。事实证明,当谎言听起来很正式时,AI 最容易被欺骗。

  • 隐喻: 想象一个学生因为一个穿着西装的陌生人(“权威人士”)走进来并说:“其实,那本书写错了”,于是就忽略了老师的教科书。
  • 发现: 当虚假信息被框架化为新的医院规则指南官方通知时,AI 几乎 70% 的情况下都会中招。
  • “例外”陷阱: AI 也很容易被那些听起来像是特定例外情况的谎言所迷惑(例如,“这条规则适用于所有人,除了这个奇怪的案例”)。

3. “单一声音” vs. “众人之声”

研究人员测试了两种呈现谎言的方式:

  • 类型 1(耳语): AI 看到问题,并且看到支持错误答案的一个特定谎言。
    • 结果: 灾难性的。AI 会立即转向错误答案。
  • 类型 2(辩论): AI 同时看到问题、真相,以及支持所有错误答案的谎言。
    • 结果: 在这种情况下,AI 的表现要好得多。它能看到全貌,并通常能坚持真理。
  • 教训: 危险并不在于 AI 无法处理任何谎言;而在于当一个听起来合理的谎言直接向它“耳语”时,它会崩溃。

4. “思考得更深入”并不总是有效

你可能会认为,如果告诉 AI “一步步思考”或使用更多的脑力,它就会更难被欺骗。

  • 隐喻: 这就像要求一名学生“检查一遍你的作业”。
  • 发现: 对于某些 AI 模型,思考得更深入反而让它们更容易受到谎言的影响。它们会过度分析那个虚假的“官方规则”,并说服自己那是正确的路径。

5. 现实世界的危险

研究人员不仅观察了对/错的答案;他们还邀请了来自 7 个不同国家的 14 名真实医生来审查 AI 的错误。

  • 发现: 在 AI 被骗的案例中,有 38% 的错误可能会导致严重的患者伤害
  • 启示: 这不仅仅是一个数学错误;这是一个安全隐患。AI 不仅仅是在“产生幻觉”;它是因为被误导的上下文所欺骗,从而自信满满地给出危险的建议。

总结

论文得出结论:我们一直在根据 AI 医生对教科书的掌握程度来衡量它们,但我们还没有测试当有人试图用虚假规则来误导它们时,它们是否能坚守真理

MedMisBench 是一个旨在衡量这种“认识论韧性”(即在世界试图迷惑你时,保持判断力的能力)的新工具。它表明,目前我们的 AI 医生在面对充满假新闻和误导性言论的复杂、信息充斥的现实世界时,其韧性尚不足以被信任用于提供健康建议。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →