← 最新论文
🤖 machine learning

CANDOR: Chance-Calibrated Discordance in Frozen Foundation Encoders

本文介绍了 CANDOR,一种机会校准的差异度指标,该指标揭示了冻结的基座编码器并非本质上对医学发现视而不见,而是由于几何分离度弱以及头部选择不佳所致,这一点从即使在轻量化头部实现强劲性能时,其依然具有高最近邻错误率这一事实中得到了证实。

原作者: Soroosh Tayebi Arasteh, Sven Nebelung, Daniel Truhn

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Soroosh Tayebi Arasteh, Sven Nebelung, Daniel Truhn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人识别不同种类的鸟类。你给它看了数百万张照片,它通过观察图片中的形状和颜色,学会了如何辨认出“知更鸟”或“麻雀”。这就是现代“基础模型”(foundation models)的工作方式:它们是巨大的、经过预训练的大脑,见过几乎所有事物,从猫到汽车,再到云朵。现在,想象一下你想利用这个同样的机器人来帮助医生阅读 X 光片。你并不想重新训练整个机器人,你只想在它上面连接一个微小的、简单的“头部”,用来判断“是的,有一处骨折”或“不,一切看起来都很正常”。

核心问题在于:这个机器人在其内部记忆中是否真的“看到”了骨折,还是仅仅根据其他线索在进行猜测?通常,我们通过检查这个微小的“头部”答对问题的频率来衡量机器人的表现。但如果机器人的内部地图其实是混乱的呢?如果在这台机器人的大脑深处,一张骨折的照片看起来更像是一张健康的骨头照片,而不是另一张骨折的照片,会发生什么?如果真是这样,机器人并不是“瞎了”,它只是“糊涂”了。这就像一位图书管理员,他们是按颜色而不是按故事内容来整理书籍的;他们可以找到一本红色的书,但仅凭书架上的样子,他们无法告诉你这是一本推理小说还是一部浪漫小说。这篇论文提出了一个至关重要的问题:当这些强大的机器人处于冻结状态(frozen in place)时,它们是对医学细节视而不见,还是仅仅在区分这些细节时显得很无力?

旧方法的缺陷

长期以来,科学家们通过一个简单的“头部”能多好地读取特征来衡量这些冻结状态下的机器人。如果这个“头部”得分很高,大家就会认为这个机器人很聪明。但该论文的作者 Soroosh Tayebi Arस्तेh 及其团队意识到,这种衡量方法就像是在没有检查食物是否煮熟的情况下,就通过厨师端菜的速度来评判他们一样。

他们发现了一个关于如何衡量“混乱度”的隐藏陷阱。想象一下,你试图在拥挤的人群中寻找一位朋友。如果你的朋友戴着一顶红帽子,而人群中有 100 个人戴着红帽子,却只有 1 个人戴着蓝帽子,当你要求机器人寻找那个戴蓝帽子的人时,机器人可能会因为蓝帽子很稀有而直接猜“蓝色”。旧有的测量工具会被疾病的常见程度或稀有程度所误导。如果某种疾病很罕见,这些工具会判定机器人“崩溃”(完全失效),仅仅是因为数学上的不平衡,而不是因为机器人本身表现很差。这就像是在责怪一名侦探没能在干草堆里找到针,而真正的难题在于那个干草堆里 99% 都是针,只有 1% 是干草。

迎来 CANDOR:公正的裁判

为了解决这个问题,团队发明了一个名为 CANDOR(机会校准失调度,Chance-Calibrated Discordance)的新工具。把 CANDOR 想象成一名裁判,它会在哨声响起之前确保比赛是公平的。

它是这样工作的:CANDOR 不会让机器人面对混乱的人群,而是设置一场完美平衡的游戏。它提取一张带有特定问题(例如气胸,即塌陷的肺部)的患者照片,并要求机器人从其记忆中找出其五个最近的“邻居”。但诀窍在于:CANDOR 强迫机器人必须在两组大小完全相等的邻居之间做出选择。一组是患有该问题的患者,另一组是没有任何问题的患者。

如果机器人真的很出色,那么患有问题的患者应该离“有问题”的那组人更近。如果机器人很糊涂,患有问题的患者会离“没问题”的那组人更近。因为两组的大小完全相同,机器人靠运气猜对的概率正好是 50/50。这给了科学家一个完美的“机会水平”(chance level)来进行对比。

令人震惊的发现:并非盲目,只是无力

当团队在 22 种不同的强大机器人以及 20 个不同的数据集(包括胸部 X 光片、眼部扫描,甚至鸟类照片)上运行 CANDOR 时,他们发现了一些令人惊讶的事情。

首先,他们证明了这些机器人并非盲目。旧有的工具曾让人们觉得机器人在面对罕见疾病时完全没用,但 CANDOR 表明机器人实际上确实拥有这些信息。它们并不是在盯着一面白墙看;它们只是站在一片迷雾之中。

然而,这些机器人非常脆弱。即使是研究中最优秀的机器人——专门针对胸部 X 光片训练的 RAD-DINO,在处理气胸病例时,仍然会有 18.4% 的时间感到困惑。这意味着,对于近五分之一的肺塌陷患者,机器人的内部地图将该患者归类到了健康人群而非另一名肺塌陷患者的附近。

对于其他病症,数字甚至更加惊人。对于青光眼(一种眼科疾病),表现最好的机器人仅达到了纯粹的机会水平(50%),这意味着它和抛硬币猜正反面没什么区别。对于鸟类品种,同一个机器人却是个天才,出错率仅为 4.5%。但对于胸部 X 光片,它的困惑率高达 42.8%。这就像是一位顶级大厨,可以完美识别出一种稀有的香料,但在被要求分辨盐和糖的区别时却感到困惑。

为什么会发生这种情况?

团队还提出了疑问:“是什么让机器人感到困惑?”他们测试了许多想法。是因为机器人太小了吗?不是。是因为它使用了旧数据吗?不是。是因为疾病很罕见吗?也不是。

他们发现了一件能强烈预测困惑程度的事物:擦除保留度(Erasure Retention)。想象一下,你拍了一张骨折的照片,然后使用魔法橡皮擦擦掉了骨折的部分,只留下健康的骨头。如果你把这张“被擦除”的照片展示给机器人,它的内部地图会改变吗?

  • 如果机器人很聪明,它的地图应该发生剧烈变化,因为最重要的部分已经消失了。
  • 如果机器人很弱,它的地图几乎不会移动。这就像一个人在看一张狗的照片,但实际上他关注的是背景里的草地;如果你把狗擦掉,他根本不会察觉。

团队发现,那些在证据被擦除后几乎纹丝不动的机器人,正是那些最容易感到困惑的机器人。这表明这些机器人并不是在观察疾病本身,而是在观察图像中的其他东西,比如肋骨的形状或光照,从而忽略了实际的问题。

好消息与坏消息

论文以一个充满希望但又现实的转折结束。尽管单个机器人可能会感到困惑,但团队发现,如果你拥有一个由 11 个不同机器人组成的专家组,其中总会有一个能答对。

把这想象成一群侦探。如果一名侦探漏掉了线索,另一名可能会捕捉到它。团队展示了,虽然单个机器人可能会漏掉 35.9% 的病例,但一个能够为每张特定图像挑选最佳机器人的智能系统,漏掉的比例可以降至仅 2.8%。信息就在那里;只是分散在不同的机器人身上。问题不在于数据缺失,而在于我们还没有建立起足够好的系统来为特定的任务挑选合适的机器人。

总结

这篇论文并不是说我们应该抛弃我们的 AI 医生。相反,它为我们提供了一种更公平、更有效的方法来检查它们是否在正常工作。它告诉我们,这些处于冻结状态的机器人并非盲目,而是脆弱。它们很容易被欺骗,并且经常错过那些最重要的细微之处。通过使用 CANDOR,医生和科学家现在可以在尝试使用机器人之前,准确地发现机器人对哪些疾病表现薄弱。这提醒我们,仅仅因为一个机器人庞大且强大,并不意味着它能看清一切;有时,它只是需要一张更好的地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →