Generate in the Chart, Not on the Boundary: Function-Symbol Grounding for Hard Constraints in LTN-GANs
本文提出将逻辑公理作为函数符号嵌入到逻辑张量网络增强的生成对抗网络(Logic Tensor Network-Enhanced GANs)中,以构建一个能够通过构造过程保证硬性结构约束,同时保留约束边缘真实分布的内部坐标系,从而克服基于谓词的评分方法和边界钳制方法的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,机器在模仿现实世界模式方面已变得异常出色。它们可以生成看起来逼真的虚假人脸照片,编造听起来合理的虚假新闻文章,或者创建合成的航班时刻表和化学反应记录。对于那些需要更多数据来验证理论或训练其他系统,尤其是在真实数据稀缺或过于敏感而无法共享时的科学家和工程师来说,这些工具具有极高的价值。然而,其中有一个陷阱。仅仅因为机器创造出的东西在统计学上与真实事物相似,并不意味着它遵循支配现实的基本规则。一份合成的飞行记录可能会显示飞机在起飞前就已抵达,或者一个化学分子可能具有不可能的能量平衡。这些错误违反了真实数据所遵循的物理学和逻辑学的硬性法则。研究人员面临的挑战是构建不仅看起来逼真,而且能严格遵守这些不可打破规则的生成器,从而产生既可信又符合逻辑的数据。
多年来,解决这些逻辑错误的标准方法是将它们视为“软建议”。在这种方法中,当计算机违反规则时,会受到惩罚,从而鼓励它随着时间的推移做得更好。虽然这有所帮助,但它永远无法保证完美;机器偶尔仍会出错,通过牺牲规则的遵守来换取一个看起来稍好一点的图像。一种更近期且更严格的方法涉及一个“约束层”,这是一个位于生成过程末端的机械门控。如果机器生成的样本违反了规则,这个门控会物理性地强制改变数值,只需微调便使样本变得有效。它就像一个安全网,确保每一个输出在技术上都是正确的。但爱丁堡大学的 Nijesh Upreti 和 Vaishak Belle 研究人员发现了这个安全网中隐藏的缺陷。他们发现,虽然门控保证了样本的有效性,但它往往会破坏使数据具有真实感的微妙、自然的变异。
问题在于这些规则是如何应用的。许多科学规则是“不等式”,例如“温度必须大于零”或“降落时间必须在起飞时间之后”。在现实世界中,这些间隔不仅仅是零或一,它们具有自然的分布。一次飞行可能会延迟几分钟,或者一个化学反应可能会有一个微小的能量缓冲。当标准的安全性门控修复违规情况时,它会将样本推向允许区域的边缘,使间隔正好为零。对于每一个哪怕只是稍微出错的样本,它都会这样做。结果是,数据集中的每一项都是有效的,但这些间隔的自然分布却消失了。数据在清单上看起来很完美,但感觉平淡且人工化,因为定义现实世界的微妙变化被压缩到了一个点上。Upreti 和 Belle 将其称为“边际分布的坍缩”,并指出这种现象发生得如此隐蔽,以至于标准测试通常会忽略它,导致研究人员得到的数据看起来很好,但在本质上却是扭曲的。
为了解决这个问题,研究人员开发了一种关于机器如何构建样本的新思维方式。他们不再是生成一个完整的样本然后再检查它是否违反规则,而是改变了蓝图本身。他们引入了一种名为“函数符号落地”(function-symbol grounding)的方法,这就像是在允许区域内建立了一个坐标系。想象一下,机器不再是试图击中一个目标然后再修正瞄准,而是绘制了一张整个安全区域的地图,并直接从其中选取一个点。机器生成一个自由的、不受约束的数字,然后一个特定的数学函数将该数字转化为一个保证有效的数值。这种转换是通过在基准值上增加一个微小的正值来实现的,从而通过构造确保满足规则。因为机器是从内向外构建样本的,所以它永远不需要被强制或钳制。自然的变异,即数值之间的“边际”,依然保持完好,并像任何其他数据特征一样被学习。
该团队在涉及化学、分子特性和出租车行程记录的四个复杂高分辨率数据集上测试了这种方法。在每种情况下,旧有的“钳制”法产生的数据虽然是100%有效的,但其数值间隙的分布却发生了扭曲。然而,新方法产生的数据不仅也是100%有效的,而且完美地保留了这些间隙的自然分布。差异非常显著:新方法将这些间隙分布误差的降低幅度提升了高达二十五倍。研究人员还发现,他们可以在开始训练之前预测旧方法何时会失败。他们计算了一个基于数据规模与规则间隙大小的简单比例。当这个比例很大时,即间隙相对于数据而言非常微小时,旧方法总是会导致分布坍缩。而新方法无论这种比例如何都能奏效,实际上成为了这类约束问题的通用解决方案。
该研究还解决了一个实际问题:对于涉及整数或离散类别的规则(即“间隙”不是一条平滑曲线而是一个单一的点),该怎么办?研究人员发现,他们的新方法最适用于平滑的连续规则,而旧有的钳制法在处理这些离散情况时反而表现更好。为了兼顾两者的优点,他们创建了一个混合系统。在训练开始前,系统会分析每条规则是平滑的还是离散的,然后自动选择最合适的工具。它对平滑规则使用这种“由内而外”的新方法,对离散规则则使用旧有的钳制法。在与现有的最佳基准进行对比测试时,这个混合系统在所有数据集上都达到或超过了标准钳制法的性能,并且在旧方法失效的高难度高分辨率案例中,其表现显著优于旧方法。
这项工作改变了我们对生成受限数据的思考方式。它表明,仅仅让数据有效是不够的;数据还必须在其变异中保持真实。通过从一个“在错误发生后进行修复”的系统转向一个“将有效性构建在数据结构本身之中”的系统,研究人员创造了一种能够生成不仅安全,而且忠实于其所要代表的复杂、细微现实的合成数据的方法。研究结果表明,对于任何涉及数值间微妙差异的应用领域——从设计新分子到规划物流——如何在机器架构中实现规则的落地,与规则本身同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。