想象你有一张庞大且杂乱无章的真实世界数据电子表格——比如患者记录、信用历史或客户习惯。这些数据很有价值,但共享它们存在风险,因为它们包含私人信息。你希望创建一个“虚假”版本的电子表格,使其在外观和行为上与真实数据完全一致,这样研究人员就可以测试新想法,而无需查看真实的私人数据。
本文提出了一种统一框架(一套完整的工具包),旨在大幅提升创建这些虚假电子表格的质量。作者认为,现有的工具就像笨拙的厨师:它们能复制食材,却常常搞砸食谱,导致生成的虚假数据“味道不对”,或者在尝试使用时就会失效。
以下是他们的新工具包如何通过三个主要“成分”来解决这一问题:
1. “口味测试”食谱(新的损失函数)
在机器学习中,“损失函数”就像一张记分卡,告诉计算机其生成的虚假数据有多糟糕。通常,计算机只是试图让数字看起来与真实数据相似。
作者意识到这还不够。真实数据中存在隐藏的关联关系。例如,在健康数据集中,“年龄”和“血压”可能是相互关联的。如果你的虚假数据中,老年人血压低,而年轻人血压高,即使数字看起来没问题,这种关联关系也被破坏了。
- 类比:想象试图重现一段复杂的管弦乐录音。标准工具可能只是确保小提琴和鼓的音量与原版匹配。但如果小提琴在演奏时鼓却保持静音(破坏了节奏),音乐听起来就是错的。
- 解决方案:作者在记分卡中加入了一条特殊的“关联与分布感知”规则。这条规则迫使计算机检查两点:
- 节奏(关联性):变量是否仍像真实数据中那样相互“共舞”?
- 形状(分布):数据的整体形状(峰值、谷值和平均值)是否与原始数据匹配?
- 结果:应用这一新规则生成的虚假数据要“忠实”得多。它保留了变量之间的秘密关联,使其成为真实数据的更佳替代品。
2. “公正的裁判”(迭代目标优化贝叶斯优化)
一旦计算机开始生成虚假数据,你就需要调整其设置(超参数)以获得最佳结果。通常,你需要使用多种不同的指标来评估数据:有些指标衡量数字的接近程度(像数学考试),而另一些指标衡量机器学习模型在虚假数据上的表现(像驾驶考试)。
- 问题:将数学分数(0 到 100)与驾驶分数(0 到 1)进行比较,就像试图把“苹果和橘子”加在一起。标准方法通常只是取平均值,这可能会产生误导。如果一个指标数值巨大,而另一个极小,那么微小的那个就会被忽略。
- 类比:想象一场才艺表演,评委们分别对歌唱、舞蹈和喜剧进行打分。如果你只是简单地将分数相加,那么一位给歌唱打 100 分的评委可能会淹没另一位给喜剧打 10 分的评委的声音。你需要一种方法来判定:“谁是最好的歌手?谁是最好的舞者?”然后公平地对参赛者进行排名。
- 解决方案:作者创造了一种名为IORBO的新方法。它不直接相加分数,而是对分数进行排名。它会问:“在我们目前看到的所有尝试中,哪一次歌唱表现最好?哪一次舞蹈表现最好?”然后根据这些排名来更新计算机的设置。
- 结果:与标准方法相比,这种方法能更快、更可靠地找到更好的设置,尤其是在指标类型不同的情况下。
3. “大考”(基准测试框架)
最后,作者建立了一个庞大的测试场来证明他们的想法有效。他们不仅仅在一个数据集上测试,而是在20 个不同的真实世界数据集上进行了测试(范围从小型医疗记录到大型信用卡数据库),并将他们的方法与10 种不同的现有 AI 模型进行了比较。
- 类比:与其只在一条平滑的赛道上测试一辆新车,他们让这辆车在 20 种不同的地形上行驶:土路、结冰的高速公路和陡峭的山坡。他们还将这辆车与 10 款其他热门车型进行了比较。
- 结果:他们的新“食谱”(损失函数)和“公正裁判”(IORBO)始终胜过其他模型。他们生成的虚假数据在帮助其他 AI 程序学习(一项称为"TSTR"或“训练合成 - 测试真实”的任务)方面表现更好,并且在与真实数据混合以增强模型时效果更佳。
总结
本文认为,要生成高质量的虚假数据,不能孤立地看待数字。你需要一个系统,能够:
- 尊重变量之间的关系(新的损失函数)。
- 在调整系统时公平对待不同类型的成功(新的优化方法)。
- 在多种不同场景下进行严格测试(基准测试)。
通过将这三个部分结合成一个统一的框架,他们创造了一种更可靠的方法来生成合成表格数据,使其表现得像真实数据一样,而无需共享实际的私人数据。
技术摘要:表格生成建模的统一框架
问题陈述
深度生成模型(DGMs)在合成图像和文本等结构化数据方面已取得显著成功。然而,将其应用于表格数据时面临独特挑战,阻碍了从其他领域直接迁移技术。表格数据的特征包括混合连续与离散变量、复杂的非线性交互、类别不平衡以及 intricate 的统计依赖关系。
现有方法在建模生命周期中主要存在三个局限性:
- 训练:现有的 DGM 往往无法保留特征相关性和边缘分布,有时甚至无法近似均值和方差等基本统计量,特别是在数据有限的情况下。它们通常依赖于无引导的似然或对抗目标,未能显式地强制关键统计量。
- 超参数调优:标准贝叶斯优化(SBO)在处理多目标聚合时存在困难。通过简单平均将具有不同单位和量纲的异构指标(例如分类准确率和回归误差)结合,往往导致次优的参数选择。
- 评估:严格的评估仍然支离破碎。现有方法通常关注狭窄的指标子集,使得难以跨多样化数据集评估模型性能,并掩盖了改进是真实的还是选择性测试的产物。
目前缺乏一个统一框架来整合训练、超参数调优和评估,以应对这些相互关联的挑战。
方法论
作者提出了一个包含三个核心组件的统一框架:
1. 感知相关性与分布的损失函数
为解决 DGM 无法捕捉统计依赖性的问题,作者引入了一种新颖的损失函数,设计为辅助正则化项。它由两部分组成:
- 感知相关性损失(Lcorrelation):该项最小化真实数据与生成数据的样本相关矩阵之间的平方差。它利用基于方差的统计量(对角协方差)以确保可扩展性,避免了全协方差矩阵估计的计算成本,同时捕捉成对依赖关系。
- 感知分布损失(Ldistribution):该项通过匹配统计矩(原始一阶矩、中心二阶矩以及直至 H 阶的标准化高阶矩)使合成数据分布与真实数据对齐。与基于距离的指标(如 Wasserstein 距离)不同,该方法使用矩匹配以实现计算效率和稳定性。它通过对矩进行归一化,统一处理连续和离散变量。
这些损失被整合到三种 DGM 架构的主要目标中:
- GANs:添加到生成器的损失中。
- VAEs(特别是 TVAE):添加到重构损失和 KL 散度损失中。
- 扩散模型(TabDDPM):调整为分别处理连续和离散特征,包含针对离散特征相关性和连续特征噪声分布的特定项。
理论保证:本文提供了理论分析,证明在亚高斯尾部假设下,这些损失函数的梯度是有界的,从而确保随机优化过程中的稳定性。
2. 迭代目标细化贝叶斯优化(IORBO)
为了解决超参数调优中聚合异构指标的挑战,作者提出了IORBO。
- 机制:与 SBO 不同(SBO 基于固定聚合函数为每个样本计算静态目标值),IORBO 采用基于排名的聚合策略。
- 过程:在每次迭代 p,样本 u(u≤p)的目标值会根据其性能与截至该点已评估的所有样本的排名进行更新。代理模型利用这些修订后的排名重新拟合。
- 优势:这种迭代细化允许优化过程随着更多数据的收集动态调整超参数配置的相对地位,减轻由具有不同量纲或单位的指标引起的偏差。
3. 综合基准测试框架
作者建立了一个严格的评估流程,涉及:
- 数据集:20 个真实世界的表格数据集,范围从小型(768 行)到大型(约 27.7 万行),涵盖回归、二分类和多分类任务。
- 基线:10 种成熟的表格 DGM(包括 CTGAN、TVAE、TabDDPM、CopulaGAN 等)。
- 评估指标:
- 统计相似性:KL 散度、皮尔逊卡方检验、柯尔莫哥洛夫 - 斯米尔诺夫检验以及用于分布匹配的维度概率(DWP);用于相关性的皮尔逊相关系数和 Cramer's V。
- 机器学习性能(TSTR):合成数据训练 - 真实数据测试,即在合成数据上训练的模型在真实数据上进行测试。
- 机器学习性能(增强):在真实和合成数据混合集上训练的模型与仅在真实数据上训练的模型进行比较。
- 统计分析:使用 Friedman 检验和 Nemenyi 事后检验来确定跨模型和数据集的统计显著性。
主要贡献
- 新颖的损失函数:一种感知相关性和分布的损失函数,作为 DGM 的正则化项,显著提高了合成表格数据的保真度和下游机器学习性能。
- IORBO 算法:一种新的多目标优化策略,利用迭代基于排名的细化,比标准贝叶斯优化更稳健地处理异构评估指标。
- 统一基准测试框架:一个开源框架,使用全面的统计和机器学习性能指标套件,在 20 个数据集上评估 10 种 DGM,为未来研究提供了标准化的协议。
结果
该框架通过广泛的实验进行了验证:
- 损失函数性能:所提出的损失函数在TSTR(胜率:0.611)和增强(胜率:0.551)任务中显著优于普通损失函数。虽然统计相似性指标显示出混合结果(通常与普通损失在统计上无法区分),但下游机器学习效用得到了持续改善。
- CTGAN、CopulaGAN 和 DP-CGANS 等模型显示出高度显著的增益。
- CTAB-GAN 是一个例外,其性能在所提出的损失下显示出统计显著的下降,表明该架构需要专门的调优。
- 优化性能:IORBO在超参数选择中始终优于 SBO(使用均值或中位数聚合),胜率分别为 0.591 和 0.561。它在处理具有不同单位的指标方面表现出卓越的鲁棒性。
- 消融研究:
- 相关性损失被确定为最具影响力的单个组件。
- 分布损失单独提供适度增益,但与相关性损失结合时提供关键的互补优势,增强了鲁棒性。
- **IORBO 与完整损失函数的组合(IOR-CD)**实现了最佳整体性能,在保持高胜率的同时实现了稳健的泛化。
- 计算成本:与 SBO 相比,IORBO 产生的额外计算开销微乎其微,每次迭代的时间几乎保持不变。
意义与主张
本文声称通过将孤立的方法改进推进到统一流程,推动了表格生成建模的发展。通过紧密耦合训练、调优和评估,该框架解决了“级联”问题,即一个阶段(例如相关性捕捉不佳)的失败会破坏下游效用。
作者强调他们的方法:
- 增强保真度:所提出的损失函数确保合成数据忠实地表示底层分布和相关性,从而带来更好的下游机器学习性能。
- 改进优化:IORBO 提供了一种原则性的方法来驾驭多指标评估中固有的复杂权衡。
- 标准化评估:基准测试框架提供了一种可重复的、与领域无关的工具来评估生成模型,有助于区分真正的进步与选择性测试的产物。
这项工作被视为迈向更可靠、更有效的表格数据合成生成的步骤,代码已公开以促进进一步研究。作者指出了由于计算限制导致的数据集规模限制(最高约 27.7 万行),但认为这些方法随特征和批次大小呈线性扩展,表明未来工作在大尺度上具有鲁棒性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。