← 最新论文
🤖 AI

DeVIT: Low-Power Vision Transformer Acceleration Using Delta Computation

本文介绍了 DeVIT,这是一种针对视觉 Transformer 的低功耗加速方法,它利用量化模型中的数值局部性,通过差分计算来实现无乘法器矩阵乘法。

原作者: Reyhaneh Hosseinzadeh, Parham Zilouchian Moghaddam, Mehdi Modarressi

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Reyhaneh Hosseinzadeh, Parham Zilouchian Moghaddam, Mehdi Modarressi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人识别图片,比如在树上发现一只猫,或者在街道上发现一辆车。为了做到这一点,我们使用了一种被称为“视觉 Transformer”(Vision Transformers)的特殊类脑计算机程序。这些程序功能极其强大,但也是庞大且贪婪的巨兽。它们在每看一张照片时,都需要进行数十亿次微小的数学计算,并且会吞噬大量的内存和电池电量。因此,很难将它们放入手机或无人机等小型设备中,否则会导致设备过热或电量耗尽。

为了驯服这些贪婪的巨兽,科学家们一直试图简化数学运算。一种流行的技巧是“量化”(quantization),这就像是对机器人使用的数字进行“四舍五入”。机器人不再使用精确的小数,而是只使用一组有限的整数,比如 0、1、2,直到 255。这节省了空间,但并不能阻止机器人进行数十亿次的乘法运算。然而,这种舍入操作带来了一个隐藏的红利:因为机器人被迫只能使用一组特定的数字,它最终会反复使用相同的数字。这就像如果一位厨师手里只有五种调料,他就会反复使用同一个调料瓶。大的问题在于:我们能否构建一个机器人,让它在意识到自己即将再次使用相同的调料时,能够跳过这项工作,从而节省能量?

这正是 DeVIT(Delta 编码视觉 Transformer)背后的研究人员致力于解决的问题。他们意识到,由于这些“视觉 Transformer”被强制使用一组有限的数字,权重(即告诉机器人要寻找什么的那些数字)在数值上往往紧挨在一起。例如,如果机器人需要将一个数分别乘以 5、6 和 7,它不需要做三次独立且艰深的计算。它可以只做第一个计算,然后为下一个数增加一点点,再为下一个数再增加一点点。

DeVIT 团队发明了一种巧妙的方法来组织这些数字,让机器人可以利用这种“加一点点”的技巧,而不是进行完整的、沉重的乘法运算。他们将数字按从小到大的顺序排成一列,并且只存储它们之间的“差值”(即 delta)。如果差值很小,机器人就可以通过“移位”(类似于乘以 2 或 4)并进行加法,而不是进行复杂的乘法。如果差值为零(意味着这个数与前一个数相同),机器人就完全不需要做任何事——它只需复用之前的答案。

通过使用这种方法,研究人员展示了他们可以将机器人需要进行的数学运算量减少到未优化版本的 0.53 倍。这意味着机器人的工作量减少了一半还多!在测试中,这种新设计在执行单个主要计算步骤时使用了 159.57 nJ(纳焦耳)的能量。这比他们对比过的现有的最佳“移位加法”方法还要节省约 5.5% 的能量。

然而,这里有一个代价。为了实现这一点,研究人员必须对数字进行排序并存储关于它们位置的额外信息,这会占用一些额外的内存空间。此外,由于是在进行近似处理差值,因此存在微小的精度权衡。在针对不同模型的实验中,准确度有所下降——在图像分类任务中最高下降了 3.11 个百分点,或在目标检测任务中下降了 2.53 mAP 点。虽然为了获得如此巨大的节能效果,这是一个很小的代价,但这同时也意味着该方法目前还不是适用于所有情况的完美方案。

简而言之,DeVIT 就像是给了机器人一张参考表。机器人不再每次都从头开始重新计算数学题,而是查看它排序后的数字列表,发现下一个数字只是微小的步进,于是采取了捷径。这使得机器人变得更快、更节能,让我们离拥有能在日常设备上运行且不耗尽电池的强大人工智能又近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →