← 最新论文
💬 NLP

Dynamic Decision Learning: Test-Time Evolution for Abnormality Grounding in Rare Diseases

本文介绍了动态决策学习(DDL),这是一个通过跨语言与视觉空间迭代优化决策,从而增强冻结的大型视觉 - 语言模型对罕见疾病异常进行稳健定位的框架,该方法无需监督微调即可显著提升定位精度与置信度校准能力。

原作者: Jun Li, Mingxuan Liu, Jiazhen Pan, Che Liu, Wenjia Bai, Cosmin I. Bercea, Julia A. Schnabel

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jun Li, Mingxuan Liu, Jiazhen Pan, Che Liu, Wenjia Bai, Cosmin I. Bercea, Julia A. Schnabel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对论文《动态决策学习》的解释。

问题所在:“一眼定论”的医生

想象你有一位非常聪明、博览群书的医学生(即大型视觉 - 语言模型,LVLM),他研读了数百万本教科书。他非常擅长识别常见病症,比如骨折或标准肿瘤。

然而,当你给他看一种他从未见过的罕见、怪异疾病时,他就会变得不稳定。如果你用稍微不同的措辞问他同一个问题,或者只是将 X 光片倾斜一点点,他的回答就会完全改变。有时他会指出正确的位置,但其他时候他可能什么都指不出来,或者编造一个根本不存在的疾病(即“幻觉”)。

这篇论文认为,对于罕见疾病而言,依赖这种人工智能的“单次快速一瞥”是危险的。这就像让一个从未去过某座城市的游客,仅凭一张地图来导航;如果地图有点模糊,或者路标令人困惑,他们就会迷路。

解决方案:动态决策学习 (DDL)

作者提出了一种使用这些人工智能模型的新方法,而无需重新训练它们(对于罕见疾病而言,由于数据不足,重新训练是不可能的)。他们不是改变人工智能的“大脑”,而是改变人工智能在测试期间如何思考。

他们将此称为动态决策学习 (DDL)。这就像把一场“一次性”考试变成一次“团队会议”。

1. 语言教练 (DAPE)

首先,系统充当人工智能指令的教练。

  • 类比:想象你试图让一个非常字面化的机器人在森林里找到一种特定的蘑菇。如果你说“找到蘑菇”,它可能会错过。如果你说“寻找左边那个棕色、圆形的东西”,它可能会找到。
  • 工作原理:系统尝试几十种不同的提问方式(提示词)。它在一个小练习集上测试这些方式,观察哪些效果最好,然后使用一个“元教练”(另一个人工智能)将获胜问题的最佳部分组合成一条完美的指令。这就像在烹饪主菜之前,先不断改良食谱直到完美。

2. 视觉会议 (V-PUP & RHC)

一旦人工智能拥有了完美的提问,它就不会只看一次图像。它会以不同的方式多次查看图像。

  • 类比:想象一名侦探在看犯罪现场的照片。如果只看一次,他可能会错过线索。但如果他旋转照片、放大、翻转,然后再看一次,真正的线索会保持在同一位置,而“幽灵”(幻觉或错误)则会消失。
  • 工作原理
    • 扰动:系统获取医学图像,并生成 7 个略有不同的版本(旋转、翻转、放大)。
    • 共识:它要求人工智能在所有 7 个版本中找出异常。
    • 过滤器:如果人工智能在所有 7 个版本中都指向同一个位置,那么该位置很可能是真实的。如果它只在其中一个版本中指向某个位置,那很可能是一个错误(幻觉)。随后,系统使用一个数学“媒人”(匈牙利算法)来对齐所有这些不同的视角,并确定最终位置。

结果:“置信度评分”

该系统最棒的地方在于,它不仅给你一个答案,还给你一个可靠性评分

  • 类比:这就像天气预报。标准的人工智能可能会说:“明天会下雨。”而这个新系统会说:“明天会下雨,我有 95% 的把握,因为我从各个角度检查了云层,它们都一致。”
  • 如果人工智能不确定(视角不一致),评分就会很低,医生就知道需要再次检查。如果所有视角都一致,评分就会很高。

论文发现

研究人员在包含常见肿瘤和 281 种不同罕见疾病的脑部扫描中测试了这种方法。

  • 罕见疾病:对于罕见疾病,这种方法将人工智能精确定位问题位置的能力提高了多达105%
  • 优于训练:令人惊讶的是,这种“更努力思考”的方法比用新数据重新训练人工智能(这通常是标准解决方案)效果更好。这非常巨大,因为如果你没有足够的罕见疾病图片,就无法重新训练人工智能。
  • 模型规模:人工智能模型越大,该系统的效果就越好。最大的模型变得非常擅长知道自己何时是自信的,何时是在猜测。

总结

简而言之,这篇论文指出:不要只问人工智能一次。 相反,要教会它提出更好的问题,从所有可能的角度查看图像,并且只有当所有这些不同的视角都达成一致时,才信任该答案。这将一个脆弱、爱猜测的人工智能,转变为一个稳定、可靠的助手,用于发现罕见疾病。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →