← 最新论文
💻 computer science

Benchmarking the Domain Gap: Model Selection Instability Under Domain Shift in Video Capsule Endoscopy

本文表明,在领域偏移(domain shift)下,视频胶囊内窥镜的模型选择具有高度的不稳定性,因为域内性能排名无法一致地预测不同数据集间的跨目标结果,因此有必要将评估重点从追求单数据集的峰值性能转向评估跨目标的排名稳定性。

原作者: Dan Hanson, Debesh Jha

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Dan Hanson, Debesh Jha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人识别不同类型的水果。你给它看了成千上万张在你自己的厨房里拍摄的苹果、橙子和香蕉的照片,这些照片是在你特定的灯光和特定的相机下拍摄的。机器人变得非常擅长了!它成了你厨房里的水果专家。但随后,你把同一个机器人带到了一个朋友家。那里的厨房有不同的灯光,他们的相机是不同的型号,甚至他们对“成熟”的定义也可能和你不同。突然间,那个在你厨房里表现卓越的机器人,可能会在面对一个看起来略有不同的香蕉时感到手足无措;而一个你原本认为表现平平的机器人却突然脱颖而出。这就是计算机科学中被称为“领域偏移”(domain shift)的问题的核心。它是指计算机模型在训练时的实验室环境与它实际应用的杂乱现实世界之间的差距。在医学领域,这个问题至关重要。如果医生依赖人工智能来发现患者体内的病变,那么这个人工智能不仅要对某一家特定的医院很聪明,还要对任何医院、任何相机以及任何患者都适用。

这篇论文深入探讨了正是这样一个问题,只不过这里的“机器人”观察的对象不是水果,而是视频胶囊——一种患者吞下的、用于拍摄体内图像的微型药丸状摄像头。研究人员想要知道:如果我们根据一个特定数据集(即一组图像)的表现来挑选出“最佳”的 AI 模型,那么当我们在来自另一家医院的完全不同的图像集上进行测试时,这个模型是否仍然是最好的?他们不仅仅是凭直觉猜测,而是进行了一场大规模实验。他们选取了 11 种不同的“大脑”架构(驱动人工智能的核心引擎),并在一组标准的胶囊视频上对它们进行了训练。然后,他们将这些训练好的“大脑”在另外两个完全不同的视频集上进行了测试。

这里是他们发现的转折点:谁是“最佳”取决于你问谁。当他们根据第一个数据集对模型进行排名时,表现最好的模型是一个名为 Swin-B 的模型。它是毫无悬念的冠军。但当他们把同一个 Swin-B 模型拿到第二个数据集进行测试时,它的排名掉到了第五位。与此同时,一个在第一次测试中仅排在第七位的 ConvNeXt-Base 模型,却成为了第二个测试中的头号冠军。这就像是你早上举行了一场比赛,赢家是一个短跑选手,但当你下午在另一条赛道上再次举行比赛时,赢家却变成了一个马拉松选手。论文表明,并不存在一个能在所有地方都获胜的“万能钥匙”。如果你仅仅因为一个模型在某次特定测试中得分最高就选择它,你可能选错了那个适合下一个医院的模型。

研究人员还尝试了第二次实验。他们在第二个数据集上训练了一批新的模型,并将其在第三个数据集上进行了测试。结果也是一样的:排名一直在发生变化。一个在第二个测试中表现优秀的模型,在第三个测试中却表现平平。这表明,你在研究论文中看到的“排行榜”往往只是一个模型如何契合特定谜题的快照,而不是它能解决下一个谜题的保证。作者得出结论,我们不应该再去寻找单一数据集上的最高分。相反,我们应该寻找那些在多次不同测试中都能保持一致性的模型。如果一个模型真正具有鲁棒性(稳健性),它就不应该在意灯光的变化或相机的更换;它的排名应该保持稳定。在我们找到这些表现稳定的模型之前,根据单次测试得分来挑选医疗人工智能,就像是仅凭对方对你所在社区的了解程度来挑选旅游指南一样——一旦你离开家乡,他们可能就会迷失方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →