← 最新论文
🤖 machine learning

Accelerating Vision Transformers with Adaptive Patch Sizes

本文提出了自适应补丁 Transformer(APT),通过根据图像内容动态调整补丁大小(在均匀区域使用大补丁、在复杂区域使用小补丁),在保持下游任务性能的同时显著减少了输入令牌数量,从而大幅提升了 ViT 的推理与训练速度。

原作者: Rohan Choudhury, JungEun Kim, Jinhyung Park, Eunho Yang, László A. Jeni, Kris M. Kitani

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Rohan Choudhury, JungEun Kim, Jinhyung Park, Eunho Yang, László A. Jeni, Kris M. Kitani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 APT (自适应补丁变换器) 的新方法,旨在让计算机视觉模型(特别是 Vision Transformers,简称 ViT)跑得更快、更聪明。

为了让你轻松理解,我们可以把处理图像的过程想象成**“阅读一本书”“看一幅画”**。

1. 现在的痛点:不管内容,一律“切方块”

想象一下,你正在看一幅画。

  • 传统的 ViT 模型就像是一个死板的读者。不管这幅画是“一片纯白的天空”还是“一只羽毛极其复杂的鸟”,它都坚持用同样大小的方格(比如 16x16 像素)去切割整幅画。
  • 问题出在哪?
    • 对于纯白的天空,切得那么细完全是浪费!因为那里什么都没有,切得再细也读不出新东西。
    • 对于复杂的鸟头,切得那么细可能还不够,需要更精细的观察。
    • 后果:无论图片多简单,模型都要处理成千上万个“小方块”(Token)。这就像让你用显微镜去读整本《百科全书》,哪怕只是看目录,这也太慢了,而且浪费了大量算力。

2. APT 的解决方案:像人类一样“灵活阅读”

APT 的核心思想是:根据内容的复杂程度,动态调整“阅读”的粒度。

我们可以用**“看地图”**来打比方:

  • 在空旷的沙漠或海洋(简单区域):APT 会拿出一个巨大的望远镜,一眼就能看穿一大片区域。它不需要把沙漠切成无数个小沙粒,而是直接把它当作一个整体(大补丁)。
  • 在繁华的城市或森林(复杂区域):当遇到细节丰富的地方(比如人脸、建筑物),APT 会立刻切换成放大镜,把区域切得非常小,以便看清每一个像素的细节。

这样做的好处是:

  • 简单区域:用大块拼图,数量少,处理快。
  • 复杂区域:用小块拼图,保留细节,不丢失信息。
  • 结果:整幅图需要的“拼图块”总数大大减少,模型处理起来自然飞快。

3. 它是如何工作的?(三个关键步骤)

  1. 智能判断(熵值检测)
    APT 会先快速“扫描”图片,计算每个区域的“混乱程度”(学术上叫)。

    • 颜色单一、平滑的地方 = 低混乱度 = 用大补丁
    • 纹理复杂、边缘多的地方 = 高混乱度 = 用小补丁
  2. 无缝拼接(零初始化 MLP)
    既然补丁大小不一样,怎么把它们拼在一起给模型看呢?

    • 这就好比把大块的乐高积木和小块的乐高积木拼在一起。APT 发明了一种特殊的“连接器”(零初始化的 MLP),它能让模型在刚开始学习时,先忽略大积木带来的细节差异(因为连接权重是 0),等模型慢慢适应后,再逐渐把大积木里的高清细节融合进去。
    • 神奇之处:这意味着你可以直接把一个已经训练好的旧模型拿来用 APT,只需要重新训练 1 个 epoch(甚至更少),就能让它变快,而且准确率几乎不掉。
  3. 打包处理(序列打包)
    因为每张图片切出来的块数不一样,APT 像打包行李一样,把不同图片的“块”整齐地排成一列,让显卡能一次性高效处理,不会因为大小不一而卡顿。

4. 实际效果有多好?

论文中的实验数据非常亮眼:

  • 速度提升:在高分辨率图片和大模型上,推理和训练速度提升了 40% 到 50%
    • 比喻:以前跑完一个任务要 10 分钟,现在只要 5-6 分钟。
  • 质量不变:虽然切得少了,但在识别物体、回答问题(视觉问答)、分割图像等任务上,准确率没有下降,甚至有时候还更好。
  • 通用性强:不仅适用于简单的图片分类,连**自动驾驶(目标检测)医学影像分析(语义分割)**这种需要看清细节的任务也能胜任。

5. 总结

APT 就像给 AI 模型装上了一双“智能眼镜”

  • 以前,AI 看世界是“一视同仁”的,不管哪里都死盯着看,累得半死。
  • 现在,AI 学会了**“抓大放小”**:在平淡无奇的地方一眼带过,在精彩复杂的地方细细品味。

这不仅让 AI 跑得更快、更省电,还让它在处理超高清图片时更加游刃有余。对于未来的 AI 应用(比如手机上的实时翻译、自动驾驶),这意味着更低的成本和更快的响应速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →