✨ 要点🔬 技术摘要
想象一下,你的智能手机或智能摄像头就像一位正试图烹饪复杂佳肴的、精疲力竭的小型厨师。通常情况下,这位厨师通过品尝食物来学习新食谱,弄清楚哪里出了问题,然后从头开始重写整本食谱。但在现实世界中,这些设备往往太小、发热太高或太耗电,无法在工作时进行这种繁重的重写工作。这就是“设备端学习”(on-device learning)的世界——它是人工智能的一个分支,旨在让计算机尝试在数据产生的地方直接进行学习和适应,而无需将所有数据都传回巨大的云端服务器。长久以来的挑战在于:如何教一个微小的设备变得更聪明,而不至于耗尽电池或让运行速度变慢?科学家们一直试图寻找一种方法,让这些设备只需微调它们的“大脑”,就能应对新情况——比如让监控摄像头学会识别一种新型犬类——而不需要超级计算机那样的强大动力。
这篇论文中的研究人员通过借用一个并非初衷用于教学的工具,找到了一个聪明的变通方法。他们采用了一款名为 Hailo-8L 的专用芯片,这款芯片原本是为 AI 模型的快速“试味”(推理)而设计的,但他们将其重新定义,用来辅助实际的“烹饪”(训练)。通常情况下,训练一个模型就像是在品尝菜肴的同时试图重写整本食谱;这既缓慢又耗能。团队的解决方案是将这项工作拆分。他们保持了 AI 模型“骨干”(backbone)部分的固定不变——即识别通用形状和模式的部分——并将其交给这款快速芯片来处理图像识别的重任。这款芯片使用一种简化的、低功耗的语言(INT8)进行工作,这使得它运行得极其迅速。与此同时,设备的中央处理器(CPU)只需要负责对模型的最终“头部”(head)进行轻量级的微调,而头部仅仅是决定正在观察特定物体的那个部分。
通过这种方式,他们创建了一个混合系统,其中重活由快速芯片完成,而学习过程则发生在主处理器上。他们在 Raspberry Pi 5(一种小型且价格低廉的计算机)上进行了测试,发现其训练模型的速度比仅使用计算机处理器快了高达 15.4 倍。例如,在训练 ResNet18 模型时,这种新方法每张图像仅需 6.04 毫秒,而仅使用 CPU 则需要 92.85 毫秒。它还显著降低了能耗,每样本仅消耗 38.65 毫焦,而仅使用 CPU 的方法则需 525.65 毫焦。然而,论文指出,这种速度提升并非在所有情况下都具有魔力;当模型的“头部”较小且简单时,效果最好。如果需要学习的部分过于复杂,主处理器就会再次成为瓶颈,导致速度变慢。
研究人员还发现了一个棘手的副作用:由于快速芯片使用的是简化后的数学运算,它有时会扭曲数据的“味道”,使得主处理器难以进行正确的学习。为了解决这个问题,他们尝试了几种“修复”技术,比如调整“调料”(偏差校正),或者使用一种被称为“知识蒸馏”的更高级方法。他们发现,对于某些模型(如 ResNet18),简单的调整就足以让准确率恢复正常。但对于像 MobileNetV3 这样更复杂的模型,他们需要这些先进的修复技巧,以防止准确率大幅下降。最后,论文表明,虽然你不能直接把完整的训练任务丢给一个微型芯片,但你确实可以利用这些推理芯片让设备端学习变得更快、更节能,前提是你知道如何针对所使用的特定模型来调优系统。
技术摘要:利用边缘 AI 推理加速器赋能设备端模型适配
问题陈述 设备端模型适配对于在资源受限的硬件上实现终身个性化至关重要,它允许预训练模型在不依赖云端连接的情况下,根据新的数据分布或用户特定模式进行调整。然而,边缘设备的计算、功耗和内存限制使得现代深度神经网络的端到端反向传播变得不切实际。虽然目前已存在专门的推理协处理器,但仍缺乏研究如何利用这些推理加速器来加速训练过程本身。传统的边缘设备通常缺乏进行完整训练的能力,这为先进的自适应解决方案制造了瓶颈。
方法论 作者提出了一种异构适配流水线,旨在重新利用商用边缘 AI 推理加速器 Hailo-8L 来处理设备端训练期间的特征提取。其核心创新在于对计算图进行划分,以充分利用加速器和主机 CPU 的各自优势:
图划分(Graph Partitioning): 将模型拆分为冻结的主干网络(特征提取器)和可训练的分类头。
主干网络(Backbone): 预训练权重被量化为 INT8 并卸载到 Hailano-8L 加速器中。该组件在正向传播期间生成特征图,但在反向传播期间被排除在外。
分类头(Head): 一个轻量级的 FP32 分类头在主机 CPU(Raspberry Pi 5)上运行。仅对该部分进行微调。
截断反向传播(Truncated Backpropagation): 反向传播在加速器边界处进行数学上的截断。梯度仅在 CPU 端的自适应顶层进行计算和参数更新。加速器生成的特征张量作为主机侧可训练分类头的输入。
量化与恢复(Quantization and Restoration): 为了减轻主干网络 INT8 量化带来的精度损失,本研究评估了使用 Hailo Dataflow Compiler 进行的几种后训练量化恢复策略。这些策略包括:
通道均衡化(Channel Equalization, Eq.)
迭代偏置校正(Iterative Bias Correction, IBC)
知识蒸馏微调(Knowledge-Distillation Fine-tuning, FT)
AdaRound (AR) 该流水线将 PyTorch 模型转换为 ONNX,应用这些策略生成硬件委托(HailoOp),并利用 ONX Runtime Training API 来执行混合图。
核心贡献
异构训练流水线: 一种基于 ONNX Runtime 的新颖工作流,通过重新利用 INT8 推理加速器进行冻结主干特征提取,从而实现设备端分类头的微调。
系统性恢复评估: 全面分析了不同量化恢复策略如何影响训练上下文中的下游适配性能(准确率、吞吐量和能耗)。
系统级基准测试: 在多种架构(ResNet18, EfficientNet-Lite 4, MobileNetV3 Large, FastViT-SA12)和数据集(CIFAR-100, Oxford-IIIT Pet)上,与仅 CPU(Raspberry Pi 5)和边缘 GPU(NVIDIA Jetson Orin Nano)基准进行了对比评估。
结果
训练速度: 所提出的流水线显著缩短了墙钟训练时间。对于 ResNet18,与 Raspberry Pi 5 CPU 基准相比,其训练速度提升高达 15.4 倍 。在理想设置下,它在单样本耗时方面也优于专用的边缘 GPU(例如,ResNet18 的情况为 6.04 ms/样本 vs. 13.70 ms/样本)。
能效: 该异构设置一致地降低了每个样本的能耗,对于 ResNet18,其能耗比边缘 GPU 基准低约 3.3 倍 。
吞吐量: 该系统在小批量(1 和 4)下表现出强大的可扩展性,其吞吐量能够匹配甚至超过边缘 GPU,同时消耗更低的功耗。然而,吞ap量增益因架构而异;具有计算密集型分类头的模型(如 MobileNetV3)由于主机侧 FP32 反向传播成为瓶颈,其速度提升较为有限。
准确率与量化: 研究发现量化韧性因架构而异。ResNet18 和 EfficientNet-Lite 对简单的恢复方法(Eq., IBC)具有韧性。相比之下,使用 Hard-Swish 或自注意力机制的架构(MobileNetV3, FastViT-SA12)对 INT8 退化更为敏感,需要更高级的恢复策略(FT 或 AdaRound)才能保持接近 FP32 基准的准确率。
意义与主张 论文声称,重新利用面向推理的边缘加速器是实现高效设备端适配的一种切实可行的方法。通过严格划分执行图,该方法克服了关键的计算瓶颈,能够在严格的能量和延迟约束下实现频繁、小规模的模型更新。
作者将这项工作定位为解决边缘场景问题的方案,即在核心感知主干保持固定而标签语义发生演变(例如:人体活动识别个性化、局部环境感知或工业缺陷检测)的情况。他们强调,通常用于推理的性能恢复技术在训练上下文中同样对于稳定上游梯度和减轻准确率损失至关重要。
研究承认了局限性,指出有效性取决于架构对 INT8 退化的鲁棒性,且主机侧开销(数据传输、量化/反量化)可能会限制复杂分类头模型的加速效果。未来的工作建议将该框架扩展到参数高效微调范式和动态持续学习场景。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。