← 最新论文
🤖 AI

Constraint-Aware Synthetic Tabular Data Generation via Inter-Column Constraint Discovery with LLM Agents

本文提出了一种统一的、以工具为基础的工作流,通过 LLM 智能体发现并强制执行列间约束(等式、线性不等式和逻辑依赖),以生成结构有效的合成表格数据,在实现零测量违规的同时,保持了统计保真度并提升了下游效用。

原作者: Jianxing Zhao, Mao Guan, Dongyu Liu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianxing Zhao, Mao Guan, Dongyu Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字时代,海量的信息被锁在电子表格中,记录着从航班时刻表、信贷申请到篮球统计数据和医疗病史的一切。当真实数据稀缺、敏感或难以共享时,研究人员和工程师会转向合成数据:即模仿现实世界统计模式的计算机生成记录。这些人工数据集允许团队构建和测试软件、训练人工智能并探索各种场景,而无需冒着泄露隐私或暴露机密细节的风险。然而,该领域长期以来一直受到一个重大问题的困扰。虽然计算机非常擅长复制数据的总体形状——确保平均年龄或收入分布看起来是正确的——但它们往往无法理解将各列联系在一起的深层逻辑规则。计算机可能会生成一个包裹在购买之前就已送达的合成订单,或者生成一条总成本与单价乘以数量不符的财务记录。这些被称为“结构性违规”的错误,使得数据在表面上看起来真实,但在简单的逻辑检查下却会崩溃,从而使其无法用于严肃的分析或决策。

一组研究人员开发了一种新方法来修复这一缺陷,创建了一个能够教导人工智能发现并执行数据集隐藏逻辑规则的系统。他们的做法并非试图从一开始就强迫数据生成器遵循严格规则(这往往会扭曲数据或需要复杂的重新训练),而是将其作为一种精密的后处理步骤。该系统首先使用大语言模型——经过大量文本训练的高级人工智能工具——来阅读数据集的描述和样本记录。这些模型充当了好奇的审计员,对不同列之间应如何关联提出假设。它们可能会建议交付日期必须始终晚于订单日期,或者某种特定的产品类型只能通过特定的方式运输。

这项创新的核心在于如何测试和完善这些提议。系统并非盲目接受人工智能的猜测,而是将每个想法转化为一条严格的、机器可读的指令,并可以针对原始数据中的每一行进行检查。如果一个提议的规则即使只失败了几次,系统也不会立即将其丢弃。相反,它会将出错的具体示例展示给人工智能,允许模型修正其假设。这种“提议、测试、纠正”的循环持续进行,直到系统确定出一套适用于整个数据集的规则。研究人员重点关注了三种主要类型的关系:等式(其中一个数字是其他数字的精确结果)、不等式(其中一个值必须大于或小于另一个值)以及逻辑依赖(其中一个项目的类别决定了另一类项目的允许类别)。

一旦规则被发现并验证,系统就会将其应用于由任何标准工具生成的合成数据。它扮演着协调者的角色,按特定顺序修复错误,以确保修正一个错误不会导致产生另一个错误。例如,如果一条规则要求总额必须是两个部分的和,系统会先根据这两部分来修正总额,然后再调整这两个部分以符合任何更广泛的限制。这种精心的排序确保了最终的数据集能同时遵守所有发现的法则。在实验中,研究人员在涵盖从航班记录到钢铁工业能耗的七个不同公共数据集上,使用了四种不同类型的数据生成器测试了这一工作流。在应用修复之前,合成数据经常包含数百个违规项,有些数据集甚至显示几乎每一条生成的记录都违反了至少一条规则。在系统应用其修正措施后,对于每一个可以强制执行的规则,违规数量都降至了零。

至关重要的是,这种严格的清洗并没有破坏数据的可用性。研究人员衡量了清洗后的数据在现实任务(如训练预测信用风险或航班延误的模型)中的表现。在大多数情况下,数据的效用实际上得到了提升;而在最坏的情况下,性能的下降也微乎其微。该系统还保留了数据的个体特征,确保每列数值的分布与原始数据保持一致。这项研究表明,通过将逻辑规则视为相互作用的约束系统而非孤立的检查,我们不仅可以生成在统计上与真实情况相似的合成数据,还可以生成在结构上稳健的合成数据。这种方法为创建可靠的合成数据提供了一条切实可行的路径,确保用于训练我们未来系统的那些人工记录是建立在逻辑真理的基础之上的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →