← 最新论文
💻 computer science

MicroViTv2: Beyond the FLOPS for Edge Energy-Friendly Vision Transformers

MicroViTv2 是一种轻量级、硬件感知的视觉 Transformer,它利用重参数化组件和单深度逐层转置注意力机制,在边缘设备上实现了卓越的准确率和能效,证明了针对实际性能进行优化比单纯最小化 FLOPs 更加关键。

原作者: Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu, Wen-Kai Kuo, Jun-Wei Hsieh

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu, Wen-Kai Kuo, Jun-Wei Hsieh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代技术的世界中,计算机在观察图像并理解其所见内容方面已经变得非常出色。它们能够识别出一只猫、发现一辆汽车或阅读一个标志,其准确度足以媲美人类视觉。这种能力依赖于一种被称为“视觉 Transformer”(Vision Transformer)的人工智能类型。可以将这些系统想象成高度精细的制图员,它们扫描图像,将其分解成微小的碎片,以理解这些碎片之间是如何相互关联的。虽然这些制图员功能极其强大,但它们也非常沉重且耗能。运行它们需要大量的计算能力和电力,这使得它们很难在智能手机、无人机或自主机器人等较小的设备上使用,因为这些设备依靠电池运行。对于这些边缘设备而言,目标不仅是变得聪明,还要实现高效,即在高性能与低能耗之间取得平衡,以便它们可以在无需充电的情况下持续运行数小时。

长期以来,研究人员一直认为,提高这些系统效率的最佳方法是简单地减少它们执行的数学计算次数。在业界,这一计数被称为 FLOPs,是一个用于估算计算机完成工作量的标准指标。普遍的假设是,更少的计算量自动意味着更快的速度和更高的能效。然而,一项新的研究挑战了这一长期存在的观念。这项研究背后的团队在与台湾国家科学技术委员会合作的过程中指出,仅靠计算次数来判断实际性能是一种不完美的衡量方式。他们发现,如果一个模型的内部结构设计得能更好地与运行它的物理硬件协同工作,那么一个计算量稍多的模型实际上可以运行得更快,且消耗更少的能量。

为了验证这一想法,研究人员开发了一个名为 MicroViTv2 的新模型。这是一个轻量级的视觉 Transformer 版本,专门为像 Jetson AGX Orin(一种常用于机器人和自主系统的强大计算机)这样的边缘设备而设计。该团队并没有仅仅尝试削减数学运算,而是重新设计了模型的架构,以减轻对设备内存和处理器的物理压力。他们引入了一种称为“结构重参数化”(structural re-parameterization)的方法。在训练阶段,模型使用具有多条路径的复杂结构进行学习,类似于一栋拥有许多不同走廊的建筑。但在模型部署到现实世界之前,这些路径会被数学化地融合为一条单一且流线型的路径。这意味着当设备实际运行该模型时,它不需要在复杂的训练结构中穿梭;它通过一条简化、直接的路径移动,这条路径更容易穿越,且所需的内存访问更少。

研究人员还改进了模型连接图像不同部分的方式。他们用一种称为“单深度可分离转置注意力机制”(Single Depth-Wise Transposed Attention)的新组件取代了旧的注意力机制。这使得模型能够观察整个图像,并理解遥远部分之间的关系,而不会被不必要的数据所困扰。通过关注模型如何通过硬件传输数据,而非仅仅关注它解决了多少数学问题,该团队创造了一个更契合实际设备物理限制的系统。

他们在标准图像数据集和目标检测任务上进行的实验结果表明,衡量效率的方式发生了明显的转变。在 Jetson AGX Orin 上进行测试时,新的 MicroViTv2 模型表现优于其前身以及其他几种领先的轻量级模型。它在识别物体时实现了更高的准确度,同时处理图像的速度更快,且每张图像消耗的能量更少。例如,他们模型的其中一个版本每秒可处理 1,883 张图像,而每张图像仅消耗 14.9 毫焦耳的能量。相比之下,其他计算量理论上更少的模型反而运行更慢,且耗电量更高。研究表明,新模型比其前一个版本在准确度上提升了高达 0.5%,并在速度和能量效率方面都超越了 MobileViTv2 和 EdgeNeXt 等竞争对手。

至关重要的是,论文明确排除了“较低的计算量总是等于更好的性能”这一观点。研究人员展示了他们的模型实际上执行了比旧版本更多的数学运算,但运行速度却更快,且消耗的电量更少。这一发现表明,当应用于实际硬件时,传统上对减少计算量的关注具有误导性。真正的瓶颈通常在于计算机如何访问其内存以及软件如何在芯片上进行调度。通过优化结构以适应硬件,研究人员证明了即使模型做了更多的数学运算,也可以更加高效。

团队在包括图像分类和复杂场景下的目标检测在内的多种场景中验证了这些发现。在每一次测试中,结构性的改进都带来了更好的结果。研究结论认为,针对设备的物理现实进行设计,比单纯最小化理论工作量更为重要。这种方法为创造人工智能提供了一条新路径,使人工智能不仅聪明,而且对于在日常生活中日益普及的电池驱动设备而言也更加实用。这项工作证实,要构建真正高效的系统,工程师必须超越纸面上的数字,去考虑模型在机器内部的实际表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →