← 最新论文
💻 computer science

HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers

本文介绍了 HSMLA,这是一种结合了基于 ReLU 的线性注意力、选择性 Softmax 精炼以及多尺度深度卷积的新型注意力机制,旨在克服标准视觉 Transformer 的二次方复杂度,在保持医疗图像分割和病理分析等密集预测任务高准确度的同时,实现显著的推理加速。

原作者: Dong Liu, Yanxuan Yu, Renata Borovica-Gajic, Tong Geng, Ying Nian Wu

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Dong Liu, Yanxuan Yu, Renata Borovica-Gajic, Tong Geng, Ying Nian Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图绘制一幅巨大且细节极其丰富的城市壁画,但你手里只有一个小桶颜料,而且完成任务的时间非常短。如果你试图同时观察每一栋建筑里的每一块砖头,以决定使用什么颜色,那么在你还没开始动笔之前,时间就会耗尽。这就是一种被称为“视觉 Transformer”(Vision Transformer)的计算机大脑所面临的问题。这些数字艺术家在理解图像方面非常出色,但当图像变得巨大时——比如高分辨率的医学扫描图或自动驾驶汽车拍摄的街景——它们就会感到力不从心。它们试图将每一个像素与每一个其他像素进行比较,这就像是试图让体育场里的每一个人都同时与其他人互相介绍一样。这太慢了,而且消耗太多能量。

为了解决这个问题,科学家们尝试了一种名为“线性注意力机制”(linear attention)的捷径。与其让每个人都互相介绍,不如让每个人向全场喊出一个总体的摘要。这非常快,但缺点是细节会变得模糊。这就像是听到人群在欢呼,但你却听不清每个人具体在喊什么词。对于需要寻找人体扫描中肿瘤确切边缘或面部细微线条的任务来说,这种模糊是无法接受的。因此,一个大问题一直是:我们能否既拥有捷径带来的速度,又拥有细致观察带来的清晰度?

于是,一项名为 HSMLA(分层 Softmax 多尺度线性注意力机制)的新发明诞生了,它由一组研究人员团队创造。把 HSMLA 想象成一位超级聪明的艺术总监,他知道什么时候该打破规则。HSMLA 不会对整幅壁画采取同样的处理方式:对于图像中那些无聊、空旷的部分(比如天空或平整的墙壁),它使用高效的方法;而一旦它发现了一些棘手的东西——比如一根参差不齐的树枝、复杂的建筑边缘或医学图像中可疑的点——它会立即切换到“超级模式”。它会放大并针对那个微小且重要的点,进行缓慢且细致的逐像素比较。

论文显示,这种“混搭”方法是一个游戏规则的改变者。通过仅对大约 30% 的图像(即真正需要关注的部分)进行繁重、缓慢的工作,而将其余部分交给快速方法,HSMLA 在超分辨率(使模糊图像变清晰)等任务上的运行速度比标准方法快了高达 4.2 倍。在医学成像领域,结果更加令人印象深刻。在用于寻找器官的 CT 扫描中,这种新方法实现了 87.3% 的 Dice 分数(衡量计算机勾勒器官轮廓完美程度的指标),同时比之前的标准方法快了 3.2 倍。在用于检测癌症的病理切片中,它达到了 94.2% 的 AUC(衡量检测准确度的指标),并实现了 4.1 倍的加速

研究人员在从识别城市街道上的汽车到发现微小肺结节等各种任务上进行了测试,结果是一致的:你不再需要在速度和准确度之间做选择。该系统足够聪明,知道何时可以滑行,何时需要冲刺。这不仅仅是一个理论构想;团队构建了它,并在用于自动驾驶汽车和医疗设备的芯片等真实硬件上对其进行了测试,证明了它的有效性。他们发现,通过使用一个“门控”系统来决定图像的哪些部分需要缓慢、仔细的观察,他们可以在保持全局图像清晰的同时,精准地锐化局部细节。这有点像拥有一支画家团队:背景艺术家以闪电般的速度工作,而几位大师级的细节画家只在处理精细的花朵和面孔时被请出来,从而确保整幅壁画在快速完成的同时,不会丢失任何一笔细节的质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →