← 最新论文
⚡ electrical engineering

No Attention, No Problem: DPU-Aware Attention Approximation in Modern YOLO on FPGA

本文提出了一种 DPU 感知架构,通过近似注意力机制并修改操作以实现硬件兼容性,将现代基于注意力的 YOLO 变体(YOLOv26 和 YOLOv11)适配于 AMD FPGA 部署,在六个基准数据集上实现了高达 3 倍的功耗降低和高吞吐量,而精度损失仅为 5%。

原作者: Suraj Karki, Qazi Arbab Ahmed, Thorsten Jungeblut

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Suraj Karki, Qazi Arbab Ahmed, Thorsten Jungeblut

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教会一个机器人如何观察世界。你希望它能瞬间识别出猫、汽车或人,无论他们是直立站着,还是以奇怪的角度倾斜。这就是“目标检测”的工作——它是计算机理解图像和视频的一种超能力。但问题在于:你并不想把这个机器人接入一个庞大且耗电的服务器集群。你希望它能在像无人机或安防摄像头这样的小型、电池供电的设备上运行,就在发生动作的地方。这被称为“边缘计算”。为了实现这一点,工程师们使用了被称为 FPGA 的特殊芯片。把 FPGA 想象成不是一个固定的脑子,而是一套可以根据需要随意拼搭成任何形状的逻辑门乐高积木。这使得它速度极快且能效极高。巨大的挑战是什么?最聪明、最现代化的“大脑”(AI 模型)通常对于这些微小的、定制的乐高大脑来说过于复杂了。它们使用一些乐高积木并不理解的高级数学技巧,这迫使机器人减速,并向一个更大、更慢的计算机寻求帮助。

这篇论文介绍了一个巧妙的“黑客手段”,旨在让最新、最智能的目标检测 AI 模型在这些微小的、定制的乐高芯片上流畅运行,且不丢失其智能。研究人员选取了两个最新且最优秀的 AI 模型,分别命名为 YOLOv26 和 YOLOv11,并为它们进行了一次“感知 DPU(DPU-aware)”的改造。DPU 是内置在这些芯片中的一种特定类型的硬件加速器,它有一套严格的规则手册:它不能执行某些特殊的数学运算,比如以奇怪的方式“拆分”数据,或者使用特定的激活函数。作者意识到,如果尝试按原样运行这些模型,芯片会卡住,导致机器人反应迟钝。因此,他们构建了一个“翻译层”。他们用芯片喜爱的、经过批准的简化版本替换了那些被禁止的数学技巧。例如,他们将一种复杂的“空间注意力(spatial attention)”机制(这种机制能帮助 AI 专注于图像的重要部分)替换为一种使用标准构建模块的简化近似版本。他们还把不支持的激活函数换成了芯片能够识别的函数。

团队在名为 Xilinx ZCU104 的真实芯片上测试了这些修改后的模型,测试数据集涵盖了从标准的街景到物体带有旋转角度的航拍照片等多种类型。他们测量了一切:机器人识别物体的速度(每秒帧数)、消耗的功率以及保持的准确度。结果非常令人期待。通过进行这些特定的架构调整,他们成功让模型以惊人的速度运行——标准检测的速度高达每秒 34.05 帧,检测旋转物体的速度高达每秒 29.55 帧。这足以满足自动驾驶或无人机导航等实时应用的需求。然而,这也付出了微小的代价:与在强大计算机上运行相比,准确度下降了约 5%,作者指出这是将复杂 AI 挤进微型硬件时常见的权衡。他们还发现,虽然随着使用更强大的配置,芯片本身变得更快,但最后一步清理结果的过程(称为后处理)成为了瓶颈,拖慢了整体速度。最终,这篇论文表明,通过适当的定制化修改,即使是最现代的 AI 模型也可以高效地部署在边缘设备上,在速度、功耗和准确度之间找到一个完美的平衡点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →