想象一下,你拥有一个训练有素的 AI 助手,就像一款智能导航应用,它被教导在阳光明媚、视野清晰的高速公路上完美驾驶。但现在,你将其部署到了一个混乱的城市中,那里突然下起了雨,道路被积雪覆盖,交通标志也变得模糊不清。
大多数 AI 系统在离开实验室后就被“冻结”了。它们无法从这些新的、混乱的条件中学习。为了修复它们,工程师通常必须召回车辆,在一个巨大的车库中重新训练它(使用反向传播,这是一个沉重、昂贵且极度消耗内存的过程),然后再将其送回。这对智能手表或无人机等小型设备来说,既缓慢、昂贵,又不可行。
一些较新的方法试图让 AI 在不进行繁重重新训练的情况下即时学习。但它们通常要求 AI 对同一个问题“思考”数十次才能确定正确的方向,这对于实时应用来说仍然太慢。
EVA-0 登场:双次猜测的天才
本文的作者提出了一种名为EVA-0的新方法。他们的核心想法简单而有力:AI 能否仅通过两次观察问题,就能有效地学习和适应?
他们回答“可以”。以下是他们如何利用一些富有创意的类比来实现这一点的:
1. 问题:“捷径”陷阱
想象你正在尝试减肥(即改进 AI)。
- 捷径: 你可以完全停止进食。体重秤(损失函数)会立即显示你在减肥,但你实际上并没有变得更健康;你只是在挨饿。在 AI 术语中,模型找到了一种“捷径”,即通过将其置信度数值人为放大来伪造一个好答案,而不是真正理解图像。
- EVA-0 的解决方案: 作者设计了一种特殊的“饮食计划”(一种尺度不变目标),防止 AI 作弊。它迫使 AI 真正学习正确的特征,而不仅仅是膨胀其置信度数值以显得良好。
2. 问题:迷失方向(权重漂移)
想象你在雾气弥漫的森林中徒步。如果你为了寻找路径而随意迈步,可能会不知不觉地偏离路线数英里。在 AI 中,为了改进而进行随机的“猜测”可能导致模型偏离其原始训练太远,以至于忘记了它所学到的一切。
- EVA-0 的解决方案: 他们引入了一个锚点。将其想象为一条牢固的绳子,系在起点处的树上。AI 被允许漫游和探索以寻找新路径,但如果它开始漂移得太远,绳子会将其轻轻拉回。这既保持了 AI 的稳定性,又允许它进行学习。
3. 问题:猜测方向
通常,为了知道该往哪走,你可能会尝试向前走一步,看看是否更好,然后向后走一步,再进行比较。
- 旧方法: 一些方法使用“单侧”猜测(只向前走并寄希望于好运)。这充满噪声且不可靠。
- EVA-0 的诀窍: 他们使用了一种对称双侧方法。他们要求 AI 观察问题两次:一次是向左轻微“推”一下,另一次是向右轻微“推”一下。
- 神奇之处: 通过平均这两个“推”的结果,他们得到了一个非常清晰的画面,即没有任何“推”时的答案本应是什么(因此他们可以做出预测)。
- 效率: 通过比较“左推”和“右推”之间的差异,他们精确地确定了为了改进应该朝哪个方向移动。
- 结果: 他们仅从完全相同的两次观察中,同时获得了预测和学习信号。无需额外步骤。
为什么这很重要
该论文在两种类型的 AI 模型(ViT 和 ResNet)上,针对被破坏的图像(模糊、有噪声、有雪)测试了这种方法。
- 速度: 它比之前的“无反向传播”方法快14 倍,因为它不需要像旧方法那样猜测 28 次;它只需要猜测两次。
- 内存: 它使用的内存极少(约 822MB,而其他方法需要 5GB),这意味着它可以在手机或传感器等小型边缘设备上运行。
- 性能: 它的实际效果甚至优于一些使用繁重、昂贵反向传播的方法,并且是第一种无需任何“源数据”就能做到这一点的(它纯粹从混乱的新世界中学习)。
简而言之: EVA-0 是一种让 AI 仅通过两次快速观察问题,就能实时从错误中学习的方法。它不会迷失方向,不会作弊,也不需要超级计算机。它将一个“冻结”的模型转变为一个“鲜活”的模型,能够即时适应现实世界。
技术摘要:EVA-0
问题陈述
现代人工智能模型日益部署于受分布偏移(例如传感器差异、用户行为变化)影响的动态环境中。尽管测试时适应(TTA)旨在使模型能够从无标签的测试时经验中学习,但大多数现有方法依赖反向传播(BP)。BP 会产生巨大的内存开销,使其无法与资源受限的边缘设备、量化模型、专用加速器或黑盒模型设置兼容。
近期的工作已探索利用零阶(ZO)优化实现无 BP 的 TTA。然而,现有的 ZO 方法面临显著局限:
- 效率与性能的权衡:像 FOA 之类的方法需要多次前向传播(例如 28 次)才能获得稳定信号,而像 ZOA 之类在严格限制两次前向传播预算下运行的方法,则遭受更新方向粗糙且噪声大的问题。
- 优化挑战:ZO 优化容易学习到“捷径解”(例如通过 logits 范数膨胀来降低熵,而非改善决策边界),遭受不受控制的权重漂移,并在严格的计算约束下难以进行有效的更新方向估计。
本文解决的核心问题是:部署中的模型能否仅利用每个样本两次前向传播且无需反向传播,从无标签的测试时经验中稳定且有效地演进?
方法论:EVA-0
作者提出了EVA-0(基于零阶梯度的进化适应),这是一个旨在严格限制两次前向传播预算下实现稳定测试时模型演进的极简框架。EVA-0 通过以下三个核心设计原则解决上述挑战:
1. 样本级对称双边扰动(SSD)
为了在遵守两次前向传播约束的同时克服单边 ZO 估计器的噪声和低效问题:
- 机制:对于每个样本 xi,模型评估两个对称扰动:fθt+μzt,i(xi) 和 fθt−μzt,i(xi)。
- 双重效用:这两次前向传播具有双重目的:
- 推理:输出被平均以近似干净模型的预测(通过泰勒展开抵消一阶扰动项),从而消除了对第三次“干净”前向传播的需求。
- 适应:两个对称输出之间的损失差异提供了低方差的双边 SPSA 梯度估计。
- 样本级独立性:与批次级扰动不同,EVA-0 对小批量内的每个样本应用独立的扰动。这增加了所探索更新方向的多样性,与共享批次扰动相比,显著提高了与真实 BP 梯度的一致性。
2. 抗捷径目标
为了防止 ZO 优化利用捷径(例如通过膨胀 logits 范数来最小化熵而不进行学习):
- 尺度不变熵:EVA-0 采用尺度不变熵目标(ESR)。它通过其平均范数对扰动输出的 logits 进行归一化,并应用去中心化(减去在线中心)。这防止模型仅仅通过膨胀 logits 的幅度来降低熵。
- 样本级特征对齐:当源统计量可用时,EVA-0 使用样本级特征对齐损失(ℓSWA)。它不是从单个噪声样本估计方差,而是通过指数移动平均(EMA)在线跟踪特征的一阶和二阶矩,以重建用于对齐的稳定方差估计。
3. 锚点引导的轨迹控制
为了减轻随机 ZO 更新中常见的权重漂移累积:
- 锚点引导扰动:维护一个可靠的锚点(例如预训练权重或在线参数的缓慢移动 EMA)。扰动分布 Dt 是自适应的:一部分样本探索随机方向,而其他样本则受指向锚点的向量引导。
- 权重松弛:在 ZO 更新之后,一个微弱的松弛步骤将更新后的权重与锚点混合(θt+1=(1−γ)θt+1′+γθanc)。这作为一个软边界,对轨迹进行去噪,防止模型漂移至不稳定的区域,同时保留适应所需的可塑性。
主要贡献
- 严格两次前向传播设置:本文建立并研究了每个样本仅两次前向传播且无反向传播的测试时模型演进这一具有挑战性的领域,推动 TTA 向高效现实世界部署迈进。
- ZO 局限性的系统分析:作者揭示了零阶 TTA 中的三个具体障碍:易受捷径解影响、不受控制的权重漂移以及在严格预算下更新方向估计无效。
- EVA-0 框架:一种统一的方法,集成了尺度不变目标、锚点引导的轨迹控制和样本级对称扰动。
- 全面验证:在 CNN(ResNet50-GN)、视觉 Transformer(ViT-Base)、量化模型(6 位/8 位)、持续流以及黑盒设置中进行了广泛的实验。
实验结果
在 ImageNet-C(15 种损坏,严重程度等级 5)上的评估结果:
- 性能:EVA-0 优于基于 BP 的方法(如 DeYO)和无 BP 基线(FOA、ZOA、FOZO)。在 ViT-Base 上,EVA-0 实现了**66.7%**的平均准确率,超过了 DeYO(65.7%)和 ZOA(61.3%)。
- 效率:EVA-0 比需要 28 次前向传播的 FOA 实现了14 倍的加速,并且与基于 BP 的方法相比显著降低了内存使用量(在 ViT-Base 上,EVA-0 为 822MB,而 DeYO 为 5,350MB)。
- 量化模型:EVA-0 使 6 位量化 ViT 在 OOD 准确率上比未适应的 32 位 ViT 高出 4.4%,证明了其在边缘部署中的可行性。
- 持续适应:在模型跨域演进而不重置的长期持续 TTA 设置中,EVA-0 保持了稳定性(ResNet50-GN 上准确率为 45.6%),而其他方法(如 FOA、DeYO)则遭受显著退化。
- 黑盒适应:EVA-0 有效地在黑盒设置中适应输入提示,在两次前向传播约束下比 FOA 高出 5.3%。
意义与主张
本文主张,仅前向的模型演进不仅仅是对受限场景的妥协,而是通向自适应部署智能的有前景且可扩展的路径。
通过统一抗捷径目标、轨迹控制和高效方向估计,EVA-0 证明了在极其严格的部署约束下(两次前向传播,无 BP)实现有效、稳定且高效的模型演进是可能的。这项工作表明,模型可以在现实世界的资源受限环境中,无需反向传播的沉重计算成本,从自身的无标签经验中进行有意义的学习。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。