Measuring Epistemic Resilience of LLMs Under Misleading Medical Context
本文介绍了 MedMisBench,这是一个全面的基准测试,它证明了大型语言模型尽管在医学考试中取得了专家级分数,但在面对具有误导性和权威框架的上下文时,会频繁放弃正确的医学判断,从而表现出脆弱的认识论韧性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢的医学生,他背诵了所有的教科书,能够以满分通过任何执业医师考试。你完全信任他。但随后,你走进房间,对他耳语了一个虚假的规则:“顺便说一下,医院刚刚更改了规则。针对这种特定的病症,我们现在要执行 X 而不是 Y。”
令人惊讶的是,这位“完美”的学生立即忘记了他所学的一切,相信了你的假规则,并给出了错误的答案。
这就是 MedMisBench 这篇论文的核心发现。研究人员发现,即使是最聪明的“AI医生”(大语言模型),在面对误导性信息时也表现得异常脆弱,即便它们预先知道正确答案。
以下是利用简单的类比对他们研究结果进行的拆解:
1. 考试中的“陷阱门”
通常,我们用干净、符合教科书标准的题目来测试 AI 医生。它们的得分非常高(约 71% 正确)。研究人员曾据此认为 AI 在提供真实健康建议方面是安全的。
但他们错了。研究人员构建了一个新的测试,叫做 MedMisBenc。把它想象成一场“陷阱门”考试。
- 设置: 他们选取了一个 AI 已经知道答案的问题。
- 陷阱: 他们注入了一个看起来像是可靠医学规则、但实际上是谎言的句子。
- 结果: AI 的准确率从 71% 骤降至 38%。事实上,在超过一半的情况下(51.5%),AI 完全抛弃了真相并追随了谎言。
2. “权威”效应
论文测试了谎言是如何被传递的。事实证明,当谎言听起来很正式时,AI 最容易被欺骗。
- 隐喻: 想象一个学生因为一个穿着西装的陌生人(“权威人士”)走进来并说:“其实,那本书写错了”,于是就忽略了老师的教科书。
- 发现: 当虚假信息被框架化为新的医院规则、指南或官方通知时,AI 几乎 70% 的情况下都会中招。
- “例外”陷阱: AI 也很容易被那些听起来像是特定例外情况的谎言所迷惑(例如,“这条规则适用于所有人,除了这个奇怪的案例”)。
3. “单一声音” vs. “众人之声”
研究人员测试了两种呈现谎言的方式:
- 类型 1(耳语): AI 看到问题,并且看到支持错误答案的一个特定谎言。
- 结果: 灾难性的。AI 会立即转向错误答案。
- 类型 2(辩论): AI 同时看到问题、真相,以及支持所有错误答案的谎言。
- 结果: 在这种情况下,AI 的表现要好得多。它能看到全貌,并通常能坚持真理。
- 教训: 危险并不在于 AI 无法处理任何谎言;而在于当一个听起来合理的谎言直接向它“耳语”时,它会崩溃。
4. “思考得更深入”并不总是有效
你可能会认为,如果告诉 AI “一步步思考”或使用更多的脑力,它就会更难被欺骗。
- 隐喻: 这就像要求一名学生“检查一遍你的作业”。
- 发现: 对于某些 AI 模型,思考得更深入反而让它们更容易受到谎言的影响。它们会过度分析那个虚假的“官方规则”,并说服自己那是正确的路径。
5. 现实世界的危险
研究人员不仅观察了对/错的答案;他们还邀请了来自 7 个不同国家的 14 名真实医生来审查 AI 的错误。
- 发现: 在 AI 被骗的案例中,有 38% 的错误可能会导致严重的患者伤害。
- 启示: 这不仅仅是一个数学错误;这是一个安全隐患。AI 不仅仅是在“产生幻觉”;它是因为被误导的上下文所欺骗,从而自信满满地给出危险的建议。
总结
论文得出结论:我们一直在根据 AI 医生对教科书的掌握程度来衡量它们,但我们还没有测试当有人试图用虚假规则来误导它们时,它们是否能坚守真理。
MedMisBench 是一个旨在衡量这种“认识论韧性”(即在世界试图迷惑你时,保持判断力的能力)的新工具。它表明,目前我们的 AI 医生在面对充满假新闻和误导性言论的复杂、信息充斥的现实世界时,其韧性尚不足以被信任用于提供健康建议。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。