← 最新论文
💬 NLP

Hearsay: Vision-Language Medical Diagnoses Without an Image

本文表明,在前未提供图像的情况下,前沿视觉-语言模型会仅根据患者的人口统计学特征系统性地虚构结构化医学诊断,这揭示了不同模型之间存在明显的、非随机的失效模式,并强调了在临床部署中审计结构化输出和探测词汇敏感性的至关重要性。

原作者: Siddharth Vohra

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Siddharth Vohra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:传闻(Hearsay):无图像情况下的视觉-语言医学诊断

问题陈述

本文研究了前沿视觉-语言模型(VLM)在临床流程中一个关键的失效模式: “幻觉效应”(mirage effect)。这种现象发生在 VLM 在缺乏附带图像的情况下,依然生成视觉描述和医学诊断。虽然先前的工作(Asadi 等人 [1])已经确定了 VLM 在此类条件下往往无法拒绝生成,但本研究旨在填补理解这些幻觉“结构”方面的空白。具体而言,本文探讨了在没有图像存在时,生成的诊断是随机的,还是受到提示词中人口统计学描述符(如年龄、性别、种族)的系统性影响。作者认为,临床流程可能会遇到图像检索失败或智能体仅传递患者描述的情况,这为幻觉输出中的人口统计学偏差创造了一个高风险环境。

研究方法

本研究在三个前沿 VLM 上采用了受控实验设计:Claude Opus 4.7GPT-5.4Gemini 3.1 Pro

  • 提示词设计: 作者使用了基于 Asadi 等人 [1] 修改后的“幻觉模式”提示词模板。提示词包含一段第一人称的人口统计学前言(例如,“我是一名 {年龄} 岁的 {种族} {性别}”),随后是要求描述一张图像并提供诊断。测试的模态包括胸部 X 光片脑部 MRI皮肤科(特指“皮肤痣”)。
  • 实验条件: 使用了 2×2×32 \times 2 \times 3 的析因设计,通过改变年龄(32, 65)、性别(男, 女)和种族(白人, 黑人, 棕色人种),产生了 12 个人口统计学单元以及一个不含人口统计学文本的中性基准(D0)。
  • 输出模式: 响应被强制纳入严格的 JSON 模式,其中包含图像存在性、诊断能力、主要诊断、鉴别诊断、置信度和推理等字段。这使得能够将“散文”(推理)与“结构化”(诊断字段)输出进行分离。
  • 指标: 主要指标是人口统计学单元与中性基准之间诊断分布的 Jensen-Shannon 散度(JSD)。次要分析包括“对冲式幻觉”(hedged mirage)检测(即散文部分承认图像缺失,但结构化字段仍被填充)以及探测名词鲁棒性(将“皮肤痣”替换为“皮肤病变”)。
  • 规模: 主要实验(E1)涉及 11,700 次 API 调用(3 模型×3 领域×13 条件×100 种子3 \text{ 模型} \times 3 \text{ 领域} \times 13 \text{ 条件} \times 100 \text{ 种子})。

核心贡献

本文提出了四个主要贡献:

  1. 结构化人口统计学偏差: 有证据表明,幻觉模式的输出并非随机,而是受人口统计学文本系统性驱动的。每个单元的 JSD 高达 0.83,且排名前列的诊断与记录在案的临床偏差模式一致(例如,针对黑人患者的结节病,以及针对老年白人男性的黑色素瘤)。
  2. 对冲式幻觉机制(The Hedged Mirage Regime): 识别出一种解离现象:模型的散文部分承认图像缺失(暗示拒绝),但其结构化诊断字段仍被填充了特定的疾病。这种“对冲”状态解释了 Claude 在高 JSD 单元中 66% 的伪造行为,并且在仅基于散文的审计中是不可见的。
  3. 多样化的失效模式: 探测名词鲁棒性分析揭示了幻觉是一个由不同失效模式组成的家族。Claude 的皮肤科效应是由词汇触发的(将“皮肤痣”更换为“皮肤病变”导致黑色素瘤诊断从 94% 下降到 100% 的拒绝);而 GPT-5.4 的效应则是类别保持型的(尽管名词发生了变化,诊断依然保持稳定)。
  4. 双通道测量: 一种提取原生 JSON 模式并结合散文分析的流程,使“对冲机制”变得直接可观测且可量化。

结果

  • 人口统计学结构化: 所有三个模型都表现出了人口统计学偏差,尽管程度各异。
    • GPT-5.436/36 个析因单元中都伪造了诊断。其偏差具有广泛性,在胸部 X 光片方面表现出向年轻黑人患者转向结节病的强烈偏移,并在 MRI 方面根据年龄和性别表现出特定的疾病偏移(例如,针对老年女性的脑膜瘤和针对老年男性的胶质瘤)。
    • Claude Opus 4.7 展示了“从拒绝到伪造”的转换。它拒绝了大多数中性提示,但在特定单元中大量伪造(例如,对于一名携带“皮肤痣”的 65 岁白人男性,黑色素瘤比例为 94%)。JSD 几乎完全是由这种从拒绝到伪造的转换驱动的。
    • Gemini 3.1 Pro 显示出最低的幅度(中位数 JSD 为 0.010),大多数单元显示为 0% 的伪造。
  • 对冲机制: 在“对冲”条件下,模型会写出类似“基于人口统计学和经典模式的疑似诊断”的推理,同时仍填充结构化诊断字段。仅基于散文的审计会将这些标记为拒绝或安全,而基于结构化数据的流程则会接收到一个有偏差的诊断。
  • 鲁棒性: “皮肤痣”与“皮肤病变”的替换实验表明,Claude 的偏差是脆弱的且依赖于特定的触发词,而 GPT-5.4 的偏差对措辞变化具有鲁棒性。
  • 信号与噪声: 人口统计学信号(JSD)显著超过了改写噪声水平(比率为 10.5 倍至 13.9 倍),证实了该偏差是由人口统计学描述符而非表面层面的措辞变化所驱动。

重要性与主张

本文认为,要在临床环境中部署值得信赖的 VLM,需要审计实践发生根本性转变。

  • 审计局限性: 仅依赖自然语言(散文)审计是不够的,因为这会遗漏“对冲机制”,即在存在文本免责声明的情况下,结构化字段仍被填充。
  • 评估维度: 探测词敏感性必须被视为“一等评估维度”。模型在单词测试下可能表现得稳健,但在面对轻微变化时可能发生灾难性失败(如 Claude 所见),反之亦然。
  • 错误的本质: 作者区分了两种错误:(1) 认识论失校(在没有证据的情况下发布诊断)和 (2) 人口统计学偏移(发布的特定诊断基于人口统计学特征)。虽然本文并未区分这些偏移是源于预训练偏差还是校准后的流行率先验(例如,老年白人男性较高的黑色素瘤发病率),但作者断言,无论先验的起源如何,散文与结构化输出之间的“解离”都是一种关键的失效模式。

研究结论指出,减轻这些风险需要模式层面的约束(例如,当 image_present=false 时强制诊断为 null)、推理时探测以及通过微调来实现在图像缺失时的拒绝。研究结果表明,幻觉并非单一现象,而是一个需要不同缓解策略的失效模式家族。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →