🤖 machine learning
Elastic Attention Cores for Scalable Vision Transformers
本文介绍了 VECA(视觉弹性核心注意力),这是一种 Vision Transformer 架构,通过将二次方全对全自注意力机制替换为高效的核心 - 外围结构来实现线性计算复杂度并支持可扩展的高分辨率处理,在该结构中,图像块令牌仅通过一组小型的、可学习的核心嵌入进行通信。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图组织一场拥有数千名宾客(即图像中的像素)的盛大派对。
旧方式:“人人互聊”派对
传统的 AI 模型,称为视觉 Transformer(ViTs),运作起来就像一场混乱的派对,其中每一位宾客都必须向其他每一位宾客自我介绍,以了解整个房间的情况。
- 问题所在:如果你有 100 位宾客,那就需要 10,000 次握手。如果你有 1,000 位宾客(一张高分辨率照片),那就需要 1,000,000 次握手。组织这一切所需的时间会呈爆炸式增长(二次方增长)。这种方式如此缓慢且昂贵,以至于这些模型在处理高清图像时举步维艰。
- 基本假设:旧模型假设,为了让计算机“看见”一个物体,每个像素都需要与其他每个像素直接交流。
新方式:VECA(“核心 VIP"派对)
本文的作者 Alan Song 及其同事提出:“等一下。我们真的需要每个人和每个人都交谈吗?”他们提出了一种名为VECA(Visual Elastic Core Attention,视觉弹性核心注意力)的新系统。
将 VECA 想象成一场拥有VIP 核心小组和普通宾客名单的派对。
- VIP 核心:与其让数千名宾客互相交谈,模型会创建一个小型、固定的"VIP"群体(称为核心 Token)。假设只有 64 位 VIP。
- 沟通规则:
- 宾客(图像块)只与VIP交谈。他们不直接互相交谈。
- VIP与所有人交谈(包括所有宾客和其他 VIP)。
- 结果:信息流从 宾客 → VIP → 宾客。宾客之间永远不需要互相握手。
- 效率提升:
- 在旧方式中,宾客数量翻倍,工作量就会翻四倍。
- 在 VECA 中,宾客数量翻倍,工作量仅翻倍(线性增长)。这就像拥有一支小型、高效的经理团队(VIP)来处理混乱,而不是强迫每位员工去管理其他每位员工。
“弹性”超能力
VECA 最酷的部分在于它是弹性的(可伸缩的)。
- 训练阶段:在训练过程中,模型学会对其 VIP 进行排名。有些 VIP 是“超级 VIP",他们掌握最重要的信息(例如“这里有一只狗”),而其他则是“初级 VIP",他们了解更细微的细节(例如“这只狗有耷拉的耳朵”)。
- 推理阶段(派对实际运作):
- 需要速度? 你可以告诉模型:“只使用排名前 8 的 VIP。”模型会立即运行得更快,因为它忽略了初级人员。虽然细节可能略有减少,但速度非常快。
- 需要高质量? 你可以说:“使用全部 64 位 VIP。”模型运行速度会稍慢一些,但会给出超级详细、高精度的答案。
- 无需重新训练:你不需要为了速度或质量而构建一个新模型。你只需在运行时动态地伸缩 VIP 的数量。
他们发现了什么?
作者在多种任务上测试了这种方法,包括识别照片中的内容(分类)和勾勒物体轮廓(分割)。
- 性能表现:即使采用了“捷径”(不允许像素直接交谈),VECA 的表现几乎与目前最先进、最昂贵的模型(如 DINOv3)一样好。
- “神奇”的发现:他们注意到,VIP(核心 Token)自然地学会了充当物体检测器。在没有被明确指示的情况下,VIP 开始聚集在一起以代表特定事物,例如“碗里的鸡蛋”或“车轮”。它们从模糊的信息团块进化成了具体的、具有语义的群体。
- 分辨率:该模型在小图像上表现优异,并能扩展到巨大的高分辨率图像而不会崩溃或变得过慢,这与旧模型不同。
核心结论
该论文声称,我们不需要昂贵且呈二次方增长的“人人互聊”方法来构建智能视觉 AI。通过使用一个小型、聪明的“核心”Token 团队来调解通信,我们可以构建出以下特性的模型:
- 更快、更便宜(尤其是对于高分辨率图像)。
- 灵活(你可以随时在速度和精度之间进行权衡)。
- 同样聪明(与当前最先进的巨头模型不相上下)。
这是计算机视觉未来的一个新基石,它使高分辨率 AI 变得切实可行且高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。