想象一下,你有一个住在微型设备(如智能手表或工厂传感器)里的微型、超智能机器人助手。这个机器人在一所“高级学校”(强大的计算机)接受了训练,学会了识别事物——比如你的声音、特定的声音或某种特定的动作。训练完成后,这个机器人就被送到了它的新家(微型设备)去执行任务。
问题:“新邻居”带来的冲击
论文指出,这种设置存在一个大问题。它在“学校”学习时的环境是完美且洁净的,但现实世界却是混乱的。一旦机器人开始工作,环境就会发生变化。也许背景噪音变大了,或者当你疲惫时你的声音听起来不一样了,又或者一台机器开始以一种新的方式震动。
在过去,机器人只会机械地执行它被教导的任务,即使那是错误的。这就像一个背下了考试答案的学生,当老师问了一个稍微不同的问题时,他就会感到困惑。论文将这种现象称为**“分布变化”(distribution change)**。基本上,就是机器人部署后看到的数据与它在学校看到的数据不同。
解决方案:机器人在工作中学习
为了解决这个问题,作者调查了大约 70 个关于这些微型机器人如何在工作中学习的项目。这被称为“设备端学习”(On-Device Learning)。机器人不再是静态的,而是能够实时适应它的新邻居。
然而,论文指出,并不是所有的“新邻居”都是一样的。他们将这些变化归纳为三种不同的场景,就像三种不同的搬迁体验:
“一次性搬迁”(单次变化机制/Single-Change Regime):
想象你搬到了一个新房子,家具的摆放变了,但之后就一直保持那样了。机器人只需要快速学习一次这种新布局,然后就完成了。它不需要永远持续学习。
- 例子: 教会智能音箱识别你的特定声音或一个新的关键词。
“持续的天气变化”(概念漂移机制/Concept Drift Regime):
想象你在开车,路况每隔几分钟就会变化——一会儿下雨,一会儿晴天,一会儿大雾,一会儿结冰。机器人必须不断调整驾驶风格,忘掉旧规则(比如“在干燥路面上开快车”)并立即学习新规则。这是一个永不停歇的适应循环。
- 例子: 工厂中的压力传感器由于热量或老化而产生缓慢的漂移,需要不断的重新校准。
“不断扩充的图书馆”(持续学习机制/Continual Learning Regime):
想象你是一位图书管理员,每周都会收到新书,但你的书架很小。你需要学习关于新书的知识,同时不能丢掉你已经知道的旧书。如果你为了腾出空间给新书而忘记了旧书,这就叫做“灾难性遗忘”。机器人必须在保留旧知识的同时,不断增加新知识。
- 例子: 一个脑机接口,随着时间推移学习用户的各种新指令,同时记住旧指令。
硬件的现实检验
论文还观察了这些机器人赖以生存的“大脑”(硬件)。它们不是功能强大的笔记本电脑,而是内存和电池都非常有限的微型芯片。
- 微型芯片(极度受限型): 它们就像计算器。它们只能处理“一次性搬迁”场景。它们太弱了,无法进行持续的学习。
- 标准芯片(标准 MCU): 它们就像基础智能手机。它们可以处理所有三种场景,但在处理“不断扩充的图书馆”时会遇到困难,因为它们会因为试图记住所有内容而耗尽内存。
- 超级芯片(PULP 平台): 它们像是微型超级计算机。它们是唯一能有效处理“不断扩充的图书馆”场景的硬件,但价格昂贵且难以编程。
巨大的脱节
作者发现研究界存在一个奇怪的鸿沟:
- **“实验室科学家”**主要在完美的、杂乱的图像数据集(如猫和狗的照片)上测试他们的机器人,这些数据对于真正的微型设备来说太重了。他们专注于在真空环境下让学习算法达到完美。
- **“现实世界构建者”**则致力于解决实际问题,如修复传感器或识别手势,但他们通常缺乏标准的测试方法来对比自己的工作成果。
因此,“实验室科学家”正在制造那些无法装进“现实世界构建者”汽车里的精美引擎。论文建议,我们需要更好的方式让这些机器人协同测试,考虑整个系统(大脑、内存和学习方法),而不是仅仅关注其中一个部分。
总结
这篇论文是关于微型设备上“学习型机器人”现状的一张地图。它告诉我们,要让这些机器人在现实世界中发挥作用,我们不能再把它们视为静态的机器。我们需要设计它们来应对三种特定的变化(一次性的、持续的或增长型的),并将它们与合适规模的“大脑”(硬件)相匹配,同时停止孤立地测试它们。我们需要建立更好的工具,帮助工程师一次性设计整个机器人,而不是拆开来一段一段地设计。
技术摘要:部署后发生了什么变化?关于微型机器学习(TinyML)中设备端学习的综述
1. 问题陈述
部署在微控制器类设备(TinyML)上的机器学习模型面临着一个根本性的挑战:部署后的分布变化。在经过精选数据集离线训练的模型,在面对部署后数据分布发生偏移的现实世界条件时,往往表现不佳。虽然**设备端学习(On-Device Learning, ODL)**通过直接在设备上执行学习过程来解决这一问题,但现有文献缺乏对分布变化如何发生的统一表征。先前的综述未能明确区分不同类型的分布变化机制,导致将运行在完全不同的约束和假设下的解决方案混为一谈。此外,方法论基准(通常以图像为中心)与现实世界部署场景(通常以传感器为中心)之间存在持久的差距,阻碍了算法进步向实际应用的迁移。
2. 方法论
本文对 TinyML 领域约 70 项 ODL 研究工作进行了全面的综述。本综述围绕一个核心组织原则进行构建:分布变化机制(distribution change regime)。作者根据部署时间 T 后数据生成过程 (P) 的性质,将文献分为三个截然不同的机制:
- 单次变化机制(Single-Change Regime): 分布在部署时仅发生一次偏移(pT−1=pT),此后保持稳定。挑战在于如何在设备剩余寿命期间快速、高效地适应新环境。
- 概念漂移机制(Concept Drift Regime): 分布多次且不可预测地连续变化(pt−1=pt)。重点是在适应新条件的同时,丢弃或降低无关过去知识的权重。
- 持续学习机制(Continual Learning Regime): 新概念随时间增量式引入。解决方案必须在积累新知识的同时,避免遗忘先前学习的信息(解决灾难性遗忘问题)。虽然在分布变化方面与概念漂移在形式上相似,但其对过去知识相关性的假设以及评估标准却显著不同。
对于每个机制,本综述通过三个互补的维度对文献进行分析:
- 应用维度(Application Lens): 所涉及的现实世界上下文和任务(例如:关键词检测、传感器校准、脑机接口)。
- 硬件维度(Hardware Lens): 目标设备,范围从极度受限的处理器(如 Cortex-M0, ISPU)到标准 MCU(Cortex-M4/M7)以及并行超低功耗(PULP)平台。
- 解决方案维度(Solution Lens): ODL 解决方案的技术组成,分解为四个组件:
- R(⋅): 降维(例如:冻结的 CNN、统计特征提取器)。
- B: 数据管理(缓冲策略、准入/触发条件)。
- ft(⋅): 机器学习算法(例如:DNN、SVM、KNN)。
- L: 学习机制(例如:反向传播、仅前向更新、原型生成)。
本综述还对 ODL 问题进行了形式化定义,规定了内存 (MD)、时钟频率 (FD)、功耗和执行时间 (E) 的约束,并建立了针对每个机制特定的评估协议(例如:针对概念漂移的逐样本预验评估/prequential evaluation,以及针对持续学习的纵向评估/longitudinal evaluation)。
3. 核心贡献
- 以机制为中心的分类法: 这是首个围绕分布变化机制(单次变化、概念漂移、持续学习)来组织整个 ODL 文献的综述,并指出由于对过去知识和适应目标的假设不同,为一种机制设计的解决方案不能直接与其他机制的解决方案进行比较。
- 全面的覆盖范围: 本综述涵盖了约 70 项工作,显著扩大了以往(仅综述约 10 项工作)的研究规模,并捕捉了 2023 年后发表的大量研究成果。
- 多维度分析: 通过同时从应用、硬件和解决方案三个维度分析研究工作,本综述揭示了跨领域的模式,例如硬件能力与机制复杂度之间的相关性,以及方法导向研究与应用导向研究之间的错位。
- 识别结构性差距: 本文指出了方法论贡献(通常侧重于标准基准上的反向传播优化)与应用导向工作(优先考虑标签效率和现实世界约束)之间的脱节。研究强调,方法论类工作很少能同时解决标签稀缺性或全流程约束(内存、延迟、功耗)的问题。
4. 关键结果与发现
应用发现
- 任务错位: 方法导向的工作主要使用图像分类基准(CIFAR, MNIST),这些基准对于现实世界的 TinyML 来说计算需求过高。相反,应用导向的工作专注于关键词检测(KWS)、人体活动识别(HAR)和传感器校准等任务,而这些任务缺乏标准化的基准。
- 标签获取策略: 成功的应用导向工作将标签获取视为一等公民的设计需求。策略包括少样本学习、自监督学习(利用辅助传感器)、无监督学习(用于异常检测)以及通过结构化刺激进行的隐式标注。
- 机制分布: 应用导向的工作高度集中在单次变化机制(例如:KWS 个性化、传感器校准)。概念漂移和持续学习机制则由方法导向的工作主导,极少有实际的应用部署报告。
硬件发现
- 硬件-机制相关性: 硬件能力与机制复杂度之间存在单调关系。
- 极度受限的处理器(Cortex-M0, ISPU)几乎完全出现在单次变化机制中,这是由于严格的内存/计算限制。
- 标准 MCU(Cortex-M4/M7)跨越了所有三个机制,但在持续学习方面代表性不足,原因是受到回放缓冲区(replay buffer)的内存限制。
- PULP 平台(多核,如 GAP9)主导了持续学习机制,因为它们是目前唯一能够支持持续学习算法所需的高内存和高计算需求的硬件类别。
- 报告缺失: 硬件报告存在不一致性。诸如峰值 RAM 和能量等指标通常是以单实例、单批次或单轮次(per-epoch)的形式报告,缺乏标准化,使得不同工作之间的比较变得困难。
解决方案发现
- 组件模式:
- 降维 (R): 对于图像/音频输入,冻结的预训练 CNN 是主流选择;而对于低维传感器数据,则使用恒等函数或统计提取器。
- 数据管理 (B): 在单次变化和概念漂移机制中,全在线操作(∣Δ∣=1)占主导地位。在持续学习中,为了防止灾难性遗忘,显式缓冲在结构上是必要的。
- 学习机制 (L): 全反向传播是持续学习的标准配置(由回放缓冲区支持)。在单次变化和概念漂移中,较轻量级的替代方案(仅前向更新、基于原型的分类器、KNN)更为普遍。
- 优化差距: 方法论工作大量优化反向传播(稀疏化、量化),但这些优化在应用导向的部署中很少被采用。这表明存在一种脱节:即算法改进并未针对完整的流水线约束(如标签策略、数据缓冲成本)进行验证。
5. 重要性与主张
本文主张,分布变化机制是决定 ODL 解决方案可行性和设计的关键因素,而此前这一因素被忽视了。通过明确区分单次变化、概念漂移和持续学习,本综述提供了一个此前文献所缺乏的、用于进行有意义比较的框架。
作者谦虚地指出,他们的工作揭示了该领域的一个结构性差距:算法进展和应用开发正在平行发展,但缺乏有效的交叉融合。他们认为该领域需要:
- 标准化的评估框架: 基准测试应固定硬件预算、解决方案组件和部署约束(包括标签稀缺性),以实现公平比较。
- 端到端设计工具: 软件框架应将整个 ODL 流水线(R,B,f,L)视为可联合优化的对象,而不是孤立地优化各个组件。
- 面向 ODL 的硬件: 从适配云端训练架构转向设计专门针对 ODL 约束(标签稀缺、无设备端验证、严苛功耗预算)的硬件。
综述总结道,虽然 ODL 拓宽了 TinyML 应用的范畴,但要实现这一愿景,必须解决方法论基准与现实世界部署场景(特别是在标签效率和非平稳学习机制的具体需求方面)之间的错位问题。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。