想象你是一位艺术策展人,正试图用徒步者的照片填满一座巨大的画廊。你的目标不仅仅是找到一张完美的照片;你希望拥有一整套既高质量(出色的照片)又多样化(涵盖所有可能场景的徒步者:雪山、阳光海滩、雨淋森林)的收藏。
这就是质量多样性(QD)优化所面临的挑战。
问题:“拥挤房间”效应
过去,计算机尝试通过将画廊划分为微小的、固定的方格(如网格)来解决这个问题。如果一张“雪山”场景的徒步者照片落入某个方格,计算机就会将该方格标记为“已填满”。
然而,当场景变得复杂(例如试图捕捉每一种具体的地貌类型)时,这些“方格”会变得巨大。突然间,一张阿尔卑斯山徒步者的照片和一张落基山脉徒步者的照片可能都会落入同一个巨大的方格中。计算机心想:“哦,这个方格已经满了”,于是停止寻找新的、独特的徒步者。它陷入僵局,误以为自己已经找到了所有可能,而实际上并非如此。这被称为失真。
旧方案:“折扣清单”
以往最好的方法(CMA-MAE)为每个方格维护一份“折扣”清单。如果某个方格是空的,折扣就很高(鼓励计算机去填满它);如果方格已满,折扣就很低。
- 缺陷:由于方格太大,许多不同的徒步者会落入同一个方格。他们都获得了相同的“折扣”分数。计算机无法区分阿尔卑斯山的徒步者和落基山脉的徒步者,因此不再尝试寻找新的徒步者。
新方案:折扣模型搜索(DMS)
作者提出了一种名为折扣模型搜索(DMS)的新方法。DMS 不使用僵硬的方格清单和固定折扣,而是利用一张智能、平滑的地图(神经网络)。
可以这样理解:
- 旧方法:一张带有巨大、块状区域的地图。如果你位于区域 A,你会得到固定的"5 分”。无论你是在区域 A 的北边缘还是南边缘,得分都相同。
- 新方法(DMS):一片平滑、起伏的地貌。即使两名徒步者彼此非常接近,地图也能根据他们的确切位置给予他们略微不同的分数。这使得计算机能够看到细微的差别,并继续寻找新的徒步者,即使是在那些看起来拥挤的区域。
重大飞跃:“度量即数据集”
这篇论文提出了一种告知计算机“多样性”是什么样子的新方法。通常,你必须编写复杂的公式来描述徒步者的年龄、衣着或天气。这既困难又繁琐。
使用 DMS,你只需向计算机展示一组图像数据集。
- 类比:与其编写一份“森林中的徒步者”的食谱,不如直接交给计算机一本森林照片集。随后,计算机就会尝试生成符合这些特定照片的徒步者。
- 结果:计算机成功生成了穿着厚夹克适应雪山的徒步者,以及穿着轻便衣物适应阳光海滩的徒步者,仅仅是因为你向它展示了这些地貌的照片。
他们发现了什么?
作者通过两种方式将这种新方法与旧方法进行了测试:
- 标准测试:在已知会发生“拥挤房间”效应的数学问题上,DMS 比旧方法发现了更多独特的解决方案和更高质量的结果。
- 图像测试:在新的“数据集”设置下,DMS 能够生成不同地貌中多样化的徒步者图像,而其他方法则失败或陷入僵局。
权衡
存在一个小代价:DMS 需要更多的计算能力,因为它必须在搜索过程中“学习”平滑的地图。然而,论文表明,这种额外的努力是值得的,因为它能发现其他方法完全遗漏的解决方案,尤其是在复杂的高维空间中。
简而言之:DMS 用一张平滑、智能的地图取代了僵硬的、块状的检查清单,使计算机能够找到更丰富、更多样化的解决方案集合,即使搜索空间极其复杂。
技术摘要:高维度量空间中的质量多样性优化折扣模型搜索
问题定义
质量多样性(Quality Diversity, QD)优化旨在发现一组解,这些解在最大化目标函数 f 的同时,覆盖由用户指定的向量值度量函数 m 定义的多样化输出范围。m 的像构成了度量空间 S。当代 QD 算法(特别是像协方差矩阵自适应 MAP-退火(CMA-MAE)这样的最先进方法)的一个关键局限性在于它们无法有效地扩展到高维度量空间。
在高维空间中,算法会受到畸变(distortion)的影响,这是一种大量解空间体积映射到度量空间小区域的現象。CMA-MAE 通过最大化“档案改进”(archive improvement)来解决 QD 目标,其定义为 Δ(θ)=f(θ)−fA(m(θ)),其中 fA 是一个折扣函数。CMA-MAE 将 fA 表示为离散直方图(即单元格的镶嵌)。在高维设置中,畸变导致许多不同的解落入同一个直方图单元格,从而被赋予相同的折扣值。因此,算法无法区分具有相似度量的解,导致改进信号不准确和搜索停滞。此外,为复杂领域(例如,指定“徒步者位于何处”)设计低维度量函数通常既繁琐又不直观。
方法论:折扣模型搜索(Discount Model Search, DMS)
为了克服这些局限性,作者提出了折扣模型搜索(DMS)。DMS 不使用离散直方图,而是采用神经网络来学习折扣函数 fA 的平滑、连续表示。
核心组件
- 折扣模型(f^A): 一个由参数 ψ 参数化的神经网络,它以度量值 s=m(θ) 作为输入,输出一个标量折扣值。该架构具有灵活性:多层感知机(MLPs)用于低维向量度量,而卷积网络或 Transformer 则适用于图像等高维数据。
- 档案与发射器(Archive and Emitters): DMS 维护一个类似 MAP-Elites 的档案,存储已发现的最佳解。它利用基于 CMA-ES 的发射器,从高斯分布中采样解。与 CMA-MAE 不同,档案不存储离散的折扣值;相反,查询折扣模型来计算改进值 Δi=f(θi)−f^A(m(θi))。
- 折扣模型训练: 该模型被训练以近似 CMA-MAE 中使用的阈值更新规则。训练数据集 DA 包含两个来源:
- 发射器采样: 对于每个采样的解 θ,目标折扣值 tA 根据该解的目标函数 f(θ) 是否超过当前模型的预测 f^A(s) 进行更新。如果 f(θ)>f^A(s),则目标值是目标函数与当前折扣的线性组合,由档案学习率 α 控制。
- 空点(Empty Points): 为了防止模型为度量空间中未探索的区域分配任意的高值,算法采样未占用档案单元格的中心,并赋予它们 fmin(最小目标值)作为目标值。这种机制在未探索区域“压制”了模型,确保发射器被引导去探索新区域。
理论洞察
通过将离散直方图替换为连续函数,DMS 即使在解映射到高维空间中相似的度量时,也能为解分配不同的折扣值。这使得算法能够保持改进信号的梯度,防止停滞,并使得在基于直方图的方法失效很久之后,探索仍能持续进行。
主要贡献
- 折扣模型搜索(DMS): 一种新颖的 QD 算法,利用平滑、连续的折扣模型来指导在畸变的高维度量空间中的探索。
- 基于度量数据集的质量多样性(Quality Diversity with Datasets of Measures, QDDM): 作者引入了一种新设置,用户通过数据集(例如,图像集合)而非手工设计度量函数来指定所需的度量。这将数据集的高维空间(例如,图像空间)视为度量空间。
- 新领域: 提出并评估了两个 QDDM 领域:
- 三角形排列(Triangle Arrangement, TA): 排列三角形以匹配 MNIST 或 Fashion MNIST 中的图像。
- 潜在空间照明(Latent Space Illumination, LSI)(Hiker): 使用 StyleGAN3 生成处于多样化景观中的徒步者面部图像,其中度量空间是景观图像的空间。
- 实证验证: 广泛的基准测试表明,DMS 在标准基准测试和新的 QDDM 领域上均优于 CMA-MAE、DDS 和 MAP-Elites 变体。
实验结果
作者在 9 个标准基准测试(包括线性投影和机械臂档案)和 3 个 QDDM 领域上评估了 DMS。
- 基准领域: 在大多数高维设置中(例如 10D、20D、50D 线性投影基准),DMS 在 QD 分数(档案中目标函数的总和)和覆盖率(填充的档案单元格百分比)方面显著优于所有基线。值得注意的是,在 10D 线性投影(球体)基准测试中,CMA-MAE 的覆盖率降至 6.95%,而 DMS 达到了 89.21%。
- QDDM 领域:
- 在 TA (F-MNIST) 中,DMS 在两项指标上均显著优于所有基线。
- 在 TA (MNIST) 中,DMS 在覆盖率方面与 CMA-MAE 持平,但在 QD 分数方面显著优于 MAP-Elites 变体。作者指出,DMS 在此处的 QD 分数并未显著优于 CMA-MAE,推测神经网络近似引入的噪声可能会阻碍低畸变、高精度任务中的细粒度目标优化。
- 在 LSI (Hiker) 中,DMS 显著优于 CMA-MAE,QD 分数达到 214.91(相比之下为 14.61),覆盖率为 3.77%(377 张独特的徒步者图像)。作者指出,MAP-Elites 变体虽然实现了高覆盖率,但由于生成了超出生成器训练分布的图像,导致 QD 分数为较大的负值。
- 计算成本: 由于折扣模型的训练,DMS 的计算成本高于 CMA-MAE,特别是在低维基准测试中。然而,在图像生成成为瓶颈的 QDDM 领域中,这种开销不太明显。
意义与主张
该论文声称 DMS 提供了两个主要优势:
- 性能提升: DMS 通过克服困扰高维度量空间的畸变效应,提升了当前 QD 应用的性能,优于最先进的黑盒算法。
- 可及性与新应用: 通过引入 QDDM 设置,DMS 使 QD 更加易于使用。它减轻了对手工设计度量函数的需求,允许用户仅通过提供数据集即可指定多样性目标。这使得指定复杂的高维度量(如视觉风格或语义位置)成为可能,而这些度量很难用低维向量表示。
作者总结道,鉴于数据集中在机器学习中的普遍性,将问题框架化为 QDDM 并用 DMS 求解是一个有前景的方向。他们承认了局限性,包括训练模型的计算开销以及近似噪声可能影响精细优化的潜力,并建议未来在更先进的模型架构和替代训练目标方面开展工作。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。