想象一下,你正试图教一个机器人在混乱的世界中做出决策,比如在繁忙的十字路口行驶的自动驾驶汽车,或者在树林中飞行的无人机。在现实世界中,情况很少是非黑即白的;通常会有多种有效的反应方式。汽车可以左转,也可以等待。无人机可以从树的左侧飞过,也可以从右侧飞过。为了处理这种情况,科学家们使用“随机预测器”(stochastic predictors)——这些聪明的计算机程序不仅给出一个答案,而是给出一整片可能性的云团,展示事物发展的各种不同方式。
然而,这些聪明的程序有一个弱点:它们很容易被欺骗。如果有人对机器人的传感器进行微小的、几乎不可察觉的改变(比如在相机镜头上涂抹一点污迹),机器人可能会惊慌失措并做出一个糟糕且危险的决定。为了解决这个问题,研究人员使用了一种叫做“随机平滑”(randomized smoothing)的技术。把它想象成向一群人征求建议,而不是只问一个人。你向问题中加入一点“噪声”或混乱,向机器人询问多次,然后将所有的答案取平均值。这通常会让机器人更加稳定,也更难被欺骗。但问题在于,如果机器人的原始答案是两种截然不同的选项的混合(比如“左转”和“等待”),简单地对它们取平均值会产生一个奇怪且无用的中间地带(比如“一边等待一边轻微左转”)。这就像是将“是”和“否”取平均值,得到了一个“也许”,而当你需要一个明确的选择时,这并无帮助。
这篇论文介绍了一种修复这种平均值问题的巧妙新方法。Eduardo Figueiredo 及其团队提出了一个名为“聚类随机平滑”(Clustered Randomized Smoothing)的方法。与其将所有答案扔进一个大搅拌机里,他们的方法首先根据答案的类型将答案分类。如果机器人正在考虑“左转”和“等待”,该方法会将这两个想法分成不同的堆。然后,它分别对每一堆进行平滑处理,并将它们作为独立的选项保留下来。这样,机器人既能保持对欺骗的鲁棒性,又能记住情况中有两种截然不同的有效处理方式。
研究人员在两个完全不同的场景中测试了这个想法。首先,他们观察了十字路口其他车辆的行为预测。在这些测试中,他们的新方法在保持“转向”和“等待”选项的独立性方面表现得更好,其预测结果比旧的平均法更接近现实世界的真相,提升了 27%。其次,他们在无人机穿过障碍物时进行了测试。旧的方法经常导致无人机坠毁,因为它将“向左走”和“向右走”的路径平均成了“直冲着树撞过去”的路径。新方法则保持了路径的分离,使无人机的坠毁率比之前的最佳技术降低了惊人的 81%。
这篇论文不仅展示了这在模拟实验中有效,还提供了一个数学保证。他们证明了,在极高概率下,即使传感器受到轻微扰动,他们的方法也能让机器人的决策保持在安全区域内。虽然该方法需要更多的计算能力来运行(因为它必须对答案组进行排序和处理),但结果表明,对于让自动驾驶汽车和无人机等安全至上的机器人变得既聪明又安全而言,这是一个至关重要的升级。
技术摘要:用于随机预测函数的聚类随机平滑技术
1. 问题陈述
现代随机预测器(如变分自编码器 VAEs、标准化流 Normalizing Flows 和贝叶斯神经网络 BNNs)能够对丰富的多模态输出分布进行建模。这种表达能力对于自动驾驶、机器人技术和医疗保健等安全至关重要的领域至关重要,在这些领域中,预测多种可能的未来(例如,车辆左转或等待)是必不可少的。
然而,确保这些模型的对抗扰动鲁棒性面临着重大挑战。随机平滑(Randomized smoothing)是一种领先的技术,通过向输入注入噪声并对生成的预测进行平均来实现。虽然对于单模态分类任务非常有效,但该方法在随机多模态回归设置中会遭遇模式崩塌(mode collapse)。通过对噪声输出进行平均,标准的随机平滑会将不同的模式坍缩为一个单一的、通常是无信息的单模态估计。这种失败在安全至上的应用场景中尤为危险,因为“平均”预测可能对应于一个不安全或物理上不可能的状态(例如,与其选择绕过障碍物的有效路径,不如直接撞向障碍物)。
现有的解决方案(如 α-平滑,即修剪异常值)减轻了极端值的影响,但在分布本质上是多模态时,仍无法保留底层的多模态结构。
2. 方法论:聚类 α-平滑
作者提出了 聚类 α-平滑(Clustered α-Smoothing),这是一个旨在保留多模态性同时提供认证鲁棒性保证的框架。该方法分为三个主要阶段:
- 聚类: 给定输入 x 和一组噪声样本 {x+ϵ1,…,x+ϵN},将生成的预测样本 {hw(x+ϵi)} 分割为 M 个不相交的簇(模式) V={V1,…,VM},使用任意聚类算法(例如 DBSCAN)。
- 局部 α-平滑: 在每个簇 Vm 内,该方法应用 α-修剪。这涉及移除前 α 比例和后 α 比例的样本(将其视为异常值),并计算剩余样本的平均值。这为每个模式生成一个局部平滑预测器 H~N,α,Vm(x)。
- 混合重构: 最终的平滑预测器被构建为一个混合分布。一个分类随机变量 z 以与簇大小成正比的概率(π(m)=∣Im∣/N)选择一个簇 m,输出则是该簇的局部平滑预测。
理论保证
论文推导了一个概率下界,即平滑后的预测落在由对应于不同模式的紧致区域 R~=∪Rl 组成的并集内的概率。
- 鲁棒性认证: 利用 Neyman-Pearson 引理和并集界(union-bound)论证,作者证明了对于任何满足 ∥δ∥2≤r 的扰动 δ,预测器输出保持在认证覆盖区域内的概率具有下界。
- 处理非凸性: 计算这些界限所需的优化问题是非凸的。作者提出了一种使用**锚点(anchor points)**来近似目标函数凸包的易处理方案,从而将问题转化为带有可控误差项(残差)的线性规划(LP)问题。
- 算法实现: 该框架包含一个算法(算法 1)来构建分区 V 和覆盖集 R,确保这些集合包含在其各自的分区内(使用广义 Voronoi 分区),以满足理论要求。
3. 主要贡献
论文概述了三个主要贡献:
- 框架引入: 一种新型的多模态随机预测器随机平滑框架,利用聚类和 α-修剪来防止模式崩塌。
- 理论证明: 证明了聚类 α-平滑预测器的输出在特定半径内,以高概率落在每个簇的一个小覆盖区域内。
- 实证验证: 在两个基准测试上进行的评估展示了其相对于现有最先进方法的显著改进。
4. 实验结果
该框架在两个不同的基准测试上进行了评估:
A. 随机轨迹预测 (L-GAP 数据集)
- 任务: 预测车辆在路口是“停留”(等待)还是“通过”(左转)。
- 指标: 风险率(由于预测错误导致的碰撞概率)和与地面真值分布的 Wasserstein 距离 (W2)。
- 结果:
- 风险率: 该方法实现了 2.5% 的风险率,显著优于 RS-Reg (7.5%) 和标准 α-平滑 (16.5%)。作者将其归功于该方法维持行为不确定性的能力,防止模型在分布模糊时自信地预测危险的“通过”动作。
- 分布保真度: 与标准 α-平滑相比,该方法将平均 2-Wasserstein 距离降低了 27% (3.80 对比 5.18),表明其能更好地保留底层分布的结构。
B. 四旋翼飞行器控制 (多模态 RL)
- 任务: 引导四旋翼飞行器穿过障碍物到达目标点,其中存在两条不同的可行路径(障碍物左侧或右侧)。
- 结果:
- 碰撞率: 标准 α-平滑方法将两个模式坍缩为单一的平均路径,导致碰撞率为 48%。相比之下,聚类 α-平滑方法保留了不同的路径,将碰撞率降低至 9%(相对于现有最先进平滑方法的碰撞率降低了 81%)。
- 认证: 该方法提供了鲁棒性的认证下界,尽管随着扰动半径的增加,这些界限变得更加保守。
5. 重要性与局限性
重要性:
本文解决了随机平滑在回归任务中的一个基本局限性:即破坏了对安全至关重要的多模态结构。通过对各个模式进行单独处理而非进行全局平均,该方法允许在不牺牲复杂决策(如机器人和自主系统)所需的预测多样性的情况下,实现鲁棒的认证。作者强调,该方法与底层预测器和聚类算法无关,因此适用于 BNNs、VAEs 和 RL 策略等各种架构。
局限性:
作者明确指出了以下几点局限性:
- 计算成本: 与所有随机平滑方法一样,它依赖于重复推理,这对于大型神经网络来说可能成本过高。
- 分区约束: 理论保证依赖于将覆盖区域定义为不相交且凸的集合。对于复杂的、非凸的簇(例如“半月形”形状),这可能具有限制性。
- 预测器 vs. 平滑器: 保证适用于平滑后的预测器,而非基础预测器。如果需要与基础回归器保持精确一致(例如在物理模拟中),则此方法可能并不适用。
- 噪声-半径权衡: 为了在减少噪声的同时维持概率界限,鲁棒半径 r 必须与噪声标准差 σ 成反比。
- 保守性: 在高度多模态的设置中,下界会变得越来越保守,可能需要更大的噪声水平或更小的认证半径来保证鲁棒性。
论文最后指出,未来的工作可以探索依赖于输入的平滑分布和动态分区 V(x),以此借鉴该领域的最新趋势。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。