技术摘要:用于采样 ℓ1 先验的 Hadamard–Langevin 动力学
问题陈述
本文解决了从高维贝叶斯后验分布中采样的挑战,该分布涉及非平滑的对数密度,特别是 ℓ1 先验(Lasso)。目标分布由下式给出:
ρ(x)=Z1exp(−β(λ∥x∥1+G(x))),
其中 G(x) 表示数据似然,∥x∥1 是促进稀疏性的非平滑 ℓ1 范数。
现有的基于 Langevin 的采样方法(例如,未调整的 Langevin 算法,ULA)难以处理 ℓ1 项的不可微性。标准方法通常依赖于:
- 平滑技术:使用 Moreau–Yosida 包络来近似非平滑项,这会引入目标分布中的偏差,且仅当平滑参数 γ→0 时该偏差才会消失。
- 近端映射:结合近端算子(例如,近端梯度 Langevin 动力学),这可能导致具有点质量(例如在零点)与连续密度混合的平稳分布,或者在分层公式中需要求逆高维矩阵。
作者寻求一种方法,既能避免平滑偏差和近端算子,又能保持可处理的扩散过程,从而精确恢复目标后验 ρ(x)。
方法论:Hadamard 过参数化
核心创新是 Hadamard–Langevin 动力学 (HLD),它利用 ℓ1 范数的平滑过参数化表示。
1. Hadamard 表示
作者利用以下恒等式:
∥x∥1=i∑∣xi∣=u⊙v=xmin{21∥u∥22+21∥v∥22},
其中 ⊙ 表示元素级(Hadamard)乘积。通过将变量 x∈Rd 提升为一对变量 (u,v)∈R+d×Rd,使得 x=u⊙v,非平滑的 ℓ1 项被替换为平滑(尽管非凸)的二次项。
2. 联合分布
从拉普拉斯先验的层次贝叶斯公式(高斯混合表示)出发,作者推导了提升空间上的联合分布 π(u,v):
π(u,v)∝(i=1∏dui)exp(−β(2λ∥(u,v)∥22+G(u⊙v))).
关键在于,在 π 下 x=u⊙v 的边缘分布恰好是目标 ρ,没有任何近似偏差。
3. 动力学
作者在提升空间 (u,v) 上定义 Langevin 动力学以从 π 中采样。由此产生的随机微分方程 (SDE) 为:
dutdvt=−λutdt−vt⊙∇G(ut⊙vt)dt+βut1dt+β2dWt1,=−λvtdt−ut⊙∇G(ut⊙vt)dt+β2dWt2,
其中 Wt1 和 Wt2 是独立的布朗运动。项 1/(βut) 源于 u 上先验的对数密度。该动力学在域 X=R+d×Rd 上是良定义的。
主要贡献与理论结果
1. 连续动力学的适定性
本文建立了连续 HLD 系统(公式 7)的严格适定性理论:
- 存在性与唯一性:作者证明了存在唯一的强解 (ut,vt),使得对于所有 t>0,ut>0 几乎必然成立。
- 证明技术:提供了两种不同的方法:
- 柱坐标:将系统变换为笛卡尔坐标 (y,z,v),其中 u=y2+z2,以消除漂移中的奇点,从而允许应用标准 SDE 理论(Stroock 和 Varadhan)。
- Girsanov 变换:将系统与 Cox–Ingersoll–Ross (CIR) 和 Ornstein–Uhlenbeck (OU) 过程联系起来。这种方法证实了该过程继承了 CIR 过程的正性性质,并建立了强 Feller 性质。
- 遍历性:连续动力学被证明是几何遍历的,即使数据项 G 无界(例如二次损失),只要 x⊤∇G(x) 下有界,它也能以指数速率收敛到不变测度 π。
2. 数值格式与收敛性
作者提出了一种隐式 - 显式时间步进格式(公式 16)来离散化 HLD。该格式在正则化项中是隐式的(确保 u 的正性),在数据项 G 中是显式的。
- 强收敛:本文证明了数值格式随着步长 Δt→0 强收敛于连续解。具体而言,对于固定的时间区间 T,误差界限为 O(Δt1/2−ϵ)。
- 克服技术挑战:分析解决了两个主要困难:
- 逆矩:漂移项包含 1/u 项。作者推导了阶数高达(但不包括)2 的逆矩界限,这是必要的,因为在此设置中标准 CIR 条件 2κμ>θ2 以等式形式成立。
- 非全局 Lipschitz 性:漂移项既非凸也非全局 Lipschitz。作者在大球内采用耦合技术,并利用逃逸概率的快速衰减界限,证明了离散格式的几何遍历性。
- 不变测度收敛:证明了离散格式的平稳分布 πΔt 随着 Δt→0 在 Wasserstein-1 距离下收敛于真实不变测度 π。
3. 与现有方法的关系
- 黎曼联系:HLD 被识别为黎曼 Langevin 动力学的一个特例,该动力学定义在由凸函数 Hessian 导出的度量的流形上,从而将该方法与 Mirror-Langevin 动力学联系起来。
- 与近端方法的比较:与可能引入零点处点质量的近端梯度 Langevin 动力学 (PGLD) 不同,HLD 产生连续密度。与 Moreau–Yosida 正则化方法 (MYULA) 不同,HLD 不引入平滑偏差。
结果与意义
本文为使用过参数化 Langevin 动力学采样非凸、非平滑后验提供了首个理论基础。
- 理论严谨性:该工作超越了优化中过参数化的启发式应用,提供了对由此产生的扩散过程的完整概率分析,包括存在性、唯一性和收敛速率。
- 精确采样:该方法恢复了精确的目标后验 ρ(x),没有平滑近似固有的偏差,也没有近端方法的结构伪影(点质量)。
- 数值证据:虽然离散不变测度偏差的理论收敛速率尚未量化(由于奇点阻碍了标准泰勒展开论证),但在一维问题上的数值实验表明偏差为 O(Δt)。实验显示,与 PGLD 和 MYULA 相比,HLD 实现了更快的混合(更高的有效样本量),且直方图中未观察到偏差。
局限性与未来工作
作者谦逊地指出,他们目前的分析并未提供离散不变测度 πΔt 偏差的定量收敛速率,因为奇异的 1/u 项阻碍了标准半群展开技术的直接应用。未来的工作旨在量化这种偏差,并将高斯混合表示方法扩展到其他诱导稀疏性的先验,例如组 ℓ1(已证明是平凡扩展)以及可能的 q∈(0,1) 的 ℓq 先验,尽管后者目前缺乏闭式高斯混合表示。