技术摘要:用于战略预测的微观基础推断
1. 问题陈述
本文解决了**表演性预测(performative prediction)**中的挑战,即在预测模型 θ 会影响目标变量分布的情景中,利益相关者(代理人)会为了最大化其效用而针对模型采取战略行动。这种现象通常被称为坎贝尔定律(Campbell's law),它创造了一种分布偏移,其中数据分布 Qθ 是预测器 θ 的函数。
应用表演性预测理论的一个关键瓶颈是这种分布偏移的未知机制。现有方法通常分为两类,但两者都存在显著局限性:
- 零阶优化(Zeroth-order optimization): 将问题视为无导数优化(例如使用有限差分法)。这受限于收敛速度慢和维度灾难,因为它没有显式地对分布映射 θ↦Qθ 进行建模。
- 微观基础建模(Microfoundation modeling): 假设代理人遵循特定的响应模型(例如成本调整后的效用最大化)。虽然这种方法可以通过提供分布映射的“白盒”访问权限来加速优化算法,但这些模型往往是**设定错误(misspecified)**的。如果假设的代理人成本函数不正确,生成的分布映射就会出错,导致预测器次优或不一致。
作者提出了一种直接从数据中推断代理人响应微观基础的方法。具体而言,他们旨在学习未知的成本函数 c,该函数决定了代理人在已知收益函数 Bθ 的情况下如何修改其属性 Z 以响应模型 θ。
2. 方法论
2.1 代理人响应模型
作者采用了标准的表演性预测框架,假设代理人是理性的。在暴露于模型 θ 后,具有属性 Z 的代理人通过求解以下问题来更新为 Z′:
Tθ(Z)∈argz′∈Zmax{Bθ(z′)−c(Z,z′)}
这里,Bθ 是已知的收益(例如模型的输出),而 c 是改变属性的未知成本。由此产生的分布是前推测度(push-forward measure)Qθ=(Tθ)#P,其中 P 是模型部署前(事前)的分布。
2.2 可识别性与 Bregman 散度
作者指出,利用有限数量的分布中的有限样本来估计通用的二元成本函数 c(z,z′) 是不可能的。为了解决这个问题,他们将成本函数限制在 Bregman 散度 类中:
cϕ(z,z′)=ϕ(z′)−ϕ(z)−∇ϕ(z)⊤(z′−z)
其中 ϕ 是一个严格凸的势函数。这把估计问题从复杂的二元函数简化为估计标量势函数 ϕ(z),从而缓解了可识别性问题。
2.3 最优传输估计
所提方法的核心在于利用**最优传输(Optimal Transport, OT)**来对齐分布。基于代理人最大化问题的一阶最优性条件,作者推导出对于真实的势函数 ϕ∗:
(∇ϕ∗−∇Bθ)#Qθ=(∇ϕ∗)#P
这意味着在映射 (∇ϕ∗−∇Bθ) 下,事后分布 Qθ 的前推测度与在 ∇ϕ∗ 下的事前分布 P 的前推测度是相同的。
作者提出通过寻找一个“重心”分布 μ 来估计 ϕ,该分布最小化到这些前推测度分布的平方 2-Wasserstein 距离之和。优化问题为:
argϕ∈Φcvxminμ∈Δ(Z)min[W22(μ,(∇ϕ)#P)+k=1∑mW22(μ,(∇ϕ−∇Bθk)#Qθk)]
该问题通过块坐标下降算法(算法 1)求解,在更新重心 μ 和势函数 ϕ 之间交替进行。
2.4 场景
该方法适用于两种设置:
- 事前与事后(Ex-ante and Ex-post): 学习者既拥有部署前分布 P 的样本,也拥有多个部署后分布 Qθk 的样本。
- 仅事后(Ex-post only): 学习者仅能获取部署后分布 Qθk,通过对齐不同 θk 下这些分布的前推测度来估计 ϕ。
3. 核心贡献
- 估计方法: 一种用于估计效用最大化微观基础模型中成本函数(属于 Bregman 散度类)的新方法。该方法依赖于使用最优传输来匹配模型前和模型后的分布。
- 理论分析:
- 可识别性: 作者提供了从数据中识别成本函数的条件(例如,推论 4.2 表明,如果收益函数是严格凹的,则一个事前分布和一个事后分布即可实现可识别性)。
- 收敛速率: 在强凸假设下,他们确定了估计参数的收敛速率为 O(n−2/d),该速率源自经验 Wasserstein 距离的收敛结果。
- 实证验证: 通过在真实信用评分数据集上的数值实验,证明了该方法在估计成本和改进下游任务(表演性风险最小化)方面的能力。
4. 实验结果
作者使用基于真实信用评分数据集(Kaggle)的半合成设置对该方法进行了评估,其中代理人会通过策略性操纵特征来避免被分类为违约。
- 对设定错误的鲁棒性: 在收益函数 Bθ 被设定错误(例如,假设收益为对数函数,而真实情况为平方根函数)的实验中,势函数导数 ϕ′ 的估计出现了偏差。然而,得到的响应映射 Tθ 仍然是鲁棒的,且预测性能并未显著下降。这表明该方法可以容忍收益函数设定的误差。
- 收敛性: 随着样本量的增加,响应映射 Tθ 的估计误差随之减小,这与理论预测一致。
- 表演性风险最小化: 当应用于最小化表演性风险(寻找最优分类器 θ)时,与基准方法相比,所提方法收敛到最优解(Oracle)的速度明显更快:
- 重复梯度下降(RGD) 和 表演性梯度下降(PerfGD):这些零阶或部分指定的算法显示出较慢的收敛速度,并且在某些情况下由于假设(如 PerfGD 中的高斯性)不成立而无法达到最优解。
- 最小二乘法(LS):一种假设线性响应的两步法。
- 结果: 所提方法表现出了竞争力的性能,并随着发布分类器数量(样本量)的增加而收敛至最优解(Oracle)。
5. 意义与主张
本文声称,准确推断代理人的微观基础是对于在战略环境下部署负责任且有效的模型至关重要的一步。通过从数据中学习成本函数而非假设一个设定错误的模型,从业者可以:
- 利用收敛快速的优化算法,这些算法需要显式的分布映射知识,从而避免了无导数方法的缓慢收敛。
- 在面对设定错误时能够放心地部署模型,因为该方法对收益函数的误差具有鲁棒性。
- 更好地理解预测模型对人群的长期影响,从而促进公平性和其他社会约束的执行。
作者总结道,虽然他们的工作侧重于战略型代理人,但学习非战略性表演性设置中分布偏移的更广泛问题仍是一个开放的研究领域。实现的源代码已公开。