RD-ViT: Recurrent-Depth Vision Transformer for Semantic Segmentation with Reduced Data Dependence Extending the Recurrent-Depth Transformer Architecture to Dense Prediction
本文介绍了 RD-ViT,这是一种循环深度视觉 Transformer,它用单个共享模块替代了标准的深层堆叠,通过自适应计算时间和混合专家等机制,在显著减少参数量和数据依赖性的同时,在心脏磁共振成像基准测试中实现了最先进的语义分割性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人查看医学扫描图像(如心脏磁共振成像或牙科 X 光片),并围绕特定部位(如心脏腔室或单个牙齿)绘制完美的轮廓。这项任务被称为“分割”。
很长一段时间以来,完成这项工作的最佳机器人是视觉 Transformer(ViT)。将标准的 ViT 想象成一条流水线上由10 位不同的专家组成的团队。第一位专家查看图像,第二位查看第一位的结果,第三位查看第二位的结果,依此类推。每位专家都有自己独特的“大脑”(参数),并且必须从头开始训练。这种方法效果极佳,但需要海量的训练数据(数千个示例),因为每位专家都需要学习自己特定的工作。
在医学领域,获取数千个标注示例非常困难。医生工作繁忙,且标注图像耗时漫长。因此,本文的作者问道:我们能否制造出一种学习效果好但所需数据少得多的机器人?
解决方案:“重复专家”(RD-ViT)
作者创造了一种名为RD-ViT的新机器人。他们不再雇佣 10 位不同的专家,而是雇佣了一位杰出的专家,并要求其查看图像、思考、再次查看、再次思考,并将此过程重复多次。
以下是他们如何让这位“重复专家”如此高效工作的方法:
1. “循环”(循环深度)
你不再拥有一长串不同的人,而是让同一个人查看图像,然后查看自己的笔记,接着再次查看。
- 问题: 如果你只是让同一个人查看 10 次,他们可能会陷入死循环或感到困惑。
- 解决方案(LTI 稳定注入): 作者为这位专家设定了一条特殊的“稳定性规则”。这就像汽车上的减震器。无论这位专家查看图像多少次,这条规则都能保证他们不会发疯或卡住。他们总能得出清晰的结论。这使得机器人能够根据需要“思考”任意多次而不会崩溃。
2. “智能中断”(自适应计算时间)
医学图像的各个部分并非同等困难。心脏周围的空白区域很容易忽略,而心肌的纤细、弯曲边缘则极难追踪。
- 比喻: 想象一名学生在参加考试。对于简单的问题(如“天空是什么颜色的?”),他们能瞬间作答。对于难题(如“计算这个复杂的积分”),他们会花额外的时间思考。
- 工作原理: RD-ViT 对图像的每一个微小部分都有一个“停止按钮”。如果某部分很简单(如背景),机器人只需循环 1 或 2 次就会停止思考。如果某部分很难(如心脏边界),机器人会循环 3、4 或 5 次以确保正确。这节省了能量,并使机器人在关键之处更加智能。
3. “专家团队”(混合专家模型)
尽管机器人反复使用同一个“循环”,但作者增加了一个转折:混合专家模型(MoE)。
- 比喻: 想象这位单一专家的大脑中有一个由 8 名隐形助手组成的团队。当机器人看到“右心室”(心脏的一部分)的图像块时,它会自动调用“助手 #1"。当它看到“心肌”(心脏肌肉)时,它会调用“助手 #2"。
- 惊喜之处: 作者并没有告诉机器人哪个部分该用哪个助手。机器人自己弄明白了!“右心室”助手成为了该形状的专家,“左心室”助手也成为了其对应形状的专家。这一切无需任何额外指令,仅靠机器人努力做好工作即可实现。
他们发现了什么?
作者在两项截然不同的医学任务上测试了这种新机器人:
1. 心脏(ACDC 数据集)
- 挑战: 他们只有极少的训练图像(仅 100 名患者)。
- 结果:
- 在2D 切片(一次查看一张平面图像)中,即使数据很少,RD-ViT 的表现实际上优于标准的 10 位专家团队。它学习得更快,错误更少。
- 在3D 体积(查看整个心脏块)中,标准团队的表现略好,除非他们添加了“专家团队”(MoE)。有了 MoE,RD-ViT 达到了标准团队99.4%的准确率,但使用的内存(参数)少了一半以上。
- 额外发现: 他们发现,如果训练机器人循环 8 次,他们可以在实际测试中要求它循环 16 次,而它会表现得更好(或保持不变),无需重新训练。这就像一名学生可以通过延长学习时间来提高成绩,而无需更换教科书。
2. 牙齿(ToothFairy2 数据集)
- 挑战: 他们尝试将同一机器人应用于 3D 牙科扫描,以识别 32 颗不同的牙齿并正确编号(例如,“第 15 号牙”与“第 25 号牙”)。这很难,因为你需要看到整个下颌才能知道哪颗是哪颗。
- 结果: 机器人成功识别了牙齿并分配了正确的编号,准确率达到89.1%。
- 成功原因: 机器人的“全局注意力”使其能够一次性看到整个下颌。它能够区分右上方的牙齿与左上方的牙齿,而旧式、更简单的机器人由于只查看小的局部片段,难以做到这一点。
结论
这篇论文表明,你不需要一支庞大的不同 AI 模型大军来进行出色的医学分割。相反,你可以使用一个智能模型,它能够循环、自适应思考,并拥有内部专家。
- 当数据稀缺时(尤其是在 2D 中),它学习更快。
- 通过在不同层之间共享其“大脑”,它节省了空间。
- 它能自行制定策略(例如哪位专家处理哪个身体部位),无需被告知。
- 它可以在图像的困难部分“更深入地思考”,而在简单部分“少思考”。
作者发布了所有代码和结果,证明了这种“循环”方法是教 AI 识别人体的一种强大且高效的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。