← 最新论文
🤖 AI

Judge-dependent safety gains and model-specific helpfulness costs of evidence-sufficiency prompting in clinical LLMs

本研究表明,尽管证据充分性提示显著降低了临床大语言模型中不安全的过度自信,但这种安全性增益的幅度高度依赖于评判者,并且往往会对诊断的帮助程度造成显著的模型特定成本,这表明此类安全性提升应当被报告为相对的方向性趋势,而非经过校准的绝对率。

原作者: Koyar Afrasyab

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Koyar Afrasyab

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人如何成为一名医生。你希望它能够提供帮助,在掌握事实时给出极佳的建议。但同时,你也希望它是安全的,这意味着它不应该在缺失关键信息(比如发烧情况或血液检测结果)时进行盲目猜测或给出自信的诊断。在人工智能的世界里,这是一个微妙的平衡。我们拥有这些能够像人类一样聊天的“大语言模型”(LLMs),而我们需要测试它们是否足够安全,以至于可以协助真正的医生。为此,科学家们经常使用一个“裁判”——另一个AI,它负责阅读机器人的回答并给出一个安全评分。但这里有一个大问题:机器人是真的改变了行为变得更安全了,还是仅仅学会了如何通过欺骗裁判来获得高分?这项研究深入探讨了这个谜团,探讨了一个简单的技巧(一个特殊的提示词)究竟是让医疗AI变得更安全了,还是仅仅创造了一个由裁判自身的偏见所导致的“安全分数”幻象。

研究人员在这篇论文中设置了一场大规模、高风险的“找不同”游戏。他们选取了四种目前最顶尖的医疗AI模型(GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash 和 Grok 4.3),并向它们提出了1,200个棘手的医疗问题。一半的时间里,他们正常地提问;另一半时间里,他们给模型套上了一个“证据充分性包装盒”——可以把它想象成一本严格的规则手册,强制要求AI列出它拥有的证据、缺失的证据,并承认如果信息不足以做出诊断时,它无法做出判断。

结果喜忧参半,同时也提出了一个非常重要的警告。当主裁判(GPT-5.4-nano)对答案进行评分时,这个特殊的规则手册发挥了奇效。它将“不安全且过度自信”的回答数量几乎削减了一半,从 49.3% 降至 24.7%。这是一个巨大的降幅!这意味着模型终于开始说:“我掌握的信息还不足以确定”,而不是在那儿瞎猜。

然而,当更换裁判时,故事变得曲折起来。研究人员引入了另一个裁判(Claude Sonnet 5)来对同样的答案进行评分。这位新裁判也认为模型变得更安全了,但它认为这种进步程度只有一半那么大。它看到的不是 24.7 个百分点的降幅,而仅仅是 13.1 个百分点的降幅。这证明了“安全分数”并不是一个像温度计读数那样固定、完美的数值;它在很大程度上取决于谁在进行评判。主裁判就像一个极其灵敏的烟雾报警器:它几乎不会错过任何真实的火灾(它抓住了每一个不安全的回答),但它也会因为烤焦的面包而误报(它把许多安全的回答也标记为了不安全)。

还有一个陷阱:变得更安全是有代价的。这个“安全规则手册”让模型变得更加谨慎,但有时却过于谨慎了。当模型被问及它们其实能够回答的问题时,规则手册让它们变得犹豫不决,并且更频繁地拒绝给出诊断。对于其中一个模型,Gemini 3.5 Flash 来说,这简直是一场灾难。它的正确诊断能力从 75% 骤降至仅为 17%。它因为太害怕出错,以至于变得不再那么有用。另一个模型 GPT-5.5 则更好地处理了这种权衡,在几乎没有损失准确性的情况下获得了安全性。

研究人员还确保了模型不仅仅是在通过模仿特殊的格式来“作弊”(即通过模仿裁判喜欢的格式来骗分)。他们建立了一个对照组,让模型使用同样华丽的标题,但仍被要求给出确定的答案。在对照组中,模型仍然给出了糟糕的、不安全的答案,这证明了安全性的提升来自于“要保持谨慎”的指令,而不仅仅是使用了正确的措辞。

最后,这篇论文并不是说我们拥有一个能让医疗AI变得完美的“魔法按钮”。相反,它告诉我们,安全分数是相对的。对于一个裁判来说是“安全”的AI,在另一个裁判看来可能存在风险。最好的方法不是信任一个单一的数字,而是观察变化的趋势:特殊的提示词确实让模型表现得更加谨慎并会询问缺失的信息,但它也让某些模型变得不再那么好用。在我们允许这些机器人进入真实的医院之前,我们需要明确我们使用的是哪种模型,以及我们信任的是哪位裁判,因为在“安全”与“有用”之间寻找平衡,对每一个机器人而言都是不同的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →