← 最新论文
🤖 machine learning

Empowering On-Device Model Adaptation with an Edge AI Inference Accelerator

本文提出了一种异构适配流水线,该流水线通过将 Hailo-8L 边缘 AI 推理加速器重新用于冻结骨干网络的特征提取,同时在主机 CPU 上微调轻量级分类头,实现了高效能、高速度的设备端模型适配,其性能显著优于仅使用 CPU 的基准方案。

原作者: Mateusz Piechocki, Alessandro Capotondi, Marek Kraft

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mateusz Piechocki, Alessandro Capotondi, Marek Kraft

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的智能手机或智能摄像头就像一位正试图烹饪复杂佳肴的、精疲力竭的小型厨师。通常情况下,这位厨师通过品尝食物来学习新食谱,弄清楚哪里出了问题,然后从头开始重写整本食谱。但在现实世界中,这些设备往往太小、发热太高或太耗电,无法在工作时进行这种繁重的重写工作。这就是“设备端学习”(on-device learning)的世界——它是人工智能的一个分支,旨在让计算机尝试在数据产生的地方直接进行学习和适应,而无需将所有数据都传回巨大的云端服务器。长久以来的挑战在于:如何教一个微小的设备变得更聪明,而不至于耗尽电池或让运行速度变慢?科学家们一直试图寻找一种方法,让这些设备只需微调它们的“大脑”,就能应对新情况——比如让监控摄像头学会识别一种新型犬类——而不需要超级计算机那样的强大动力。

这篇论文中的研究人员通过借用一个并非初衷用于教学的工具,找到了一个聪明的变通方法。他们采用了一款名为 Hailo-8L 的专用芯片,这款芯片原本是为 AI 模型的快速“试味”(推理)而设计的,但他们将其重新定义,用来辅助实际的“烹饪”(训练)。通常情况下,训练一个模型就像是在品尝菜肴的同时试图重写整本食谱;这既缓慢又耗能。团队的解决方案是将这项工作拆分。他们保持了 AI 模型“骨干”(backbone)部分的固定不变——即识别通用形状和模式的部分——并将其交给这款快速芯片来处理图像识别的重任。这款芯片使用一种简化的、低功耗的语言(INT8)进行工作,这使得它运行得极其迅速。与此同时,设备的中央处理器(CPU)只需要负责对模型的最终“头部”(head)进行轻量级的微调,而头部仅仅是决定正在观察特定物体的那个部分。

通过这种方式,他们创建了一个混合系统,其中重活由快速芯片完成,而学习过程则发生在主处理器上。他们在 Raspberry Pi 5(一种小型且价格低廉的计算机)上进行了测试,发现其训练模型的速度比仅使用计算机处理器快了高达 15.4 倍。例如,在训练 ResNet18 模型时,这种新方法每张图像仅需 6.04 毫秒,而仅使用 CPU 则需要 92.85 毫秒。它还显著降低了能耗,每样本仅消耗 38.65 毫焦,而仅使用 CPU 的方法则需 525.65 毫焦。然而,论文指出,这种速度提升并非在所有情况下都具有魔力;当模型的“头部”较小且简单时,效果最好。如果需要学习的部分过于复杂,主处理器就会再次成为瓶颈,导致速度变慢。

研究人员还发现了一个棘手的副作用:由于快速芯片使用的是简化后的数学运算,它有时会扭曲数据的“味道”,使得主处理器难以进行正确的学习。为了解决这个问题,他们尝试了几种“修复”技术,比如调整“调料”(偏差校正),或者使用一种被称为“知识蒸馏”的更高级方法。他们发现,对于某些模型(如 ResNet18),简单的调整就足以让准确率恢复正常。但对于像 MobileNetV3 这样更复杂的模型,他们需要这些先进的修复技巧,以防止准确率大幅下降。最后,论文表明,虽然你不能直接把完整的训练任务丢给一个微型芯片,但你确实可以利用这些推理芯片让设备端学习变得更快、更节能,前提是你知道如何针对所使用的特定模型来调优系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →