← 最新论文
💻 computer science

Towards Automatically Inferring Constraints to Identify Implicit Assumptions in Data Analysis

本文提出了一种统一的视角,并利用静态分析进行概念验证实现,旨在自动推断并将数据分析脚本中隐含的假设显式地表示为代码约束,从而增强可复现性、运行时验证以及代码的可理解性。

原作者: Florian Sihler, Lars Pfrenger, Oliver Gerstl, Matthias Tichy

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Florian Sihler, Lars Pfrenger, Oliver Gerstl, Matthias Tichy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图按照一份食谱来烤蛋糕,但这份食谱是你的朋友写的,他忘了写下几个至关重要的细节。他没有提到你需要一种特定类型的烤箱,或者面粉必须在加入鸡蛋之前过筛,又或者只有使用特定品牌的泡打粉时,这个食谱才会奏效。

如果你尝试用自己的设备和食材来烤这个蛋糕,它可能会失败,或者味道完全不同。在数据科学的世界里,科学家们编写“食谱”(脚本)来进行数据分析。问题在于,这些食谱充满了隐藏的假设——即作者认为理所当然、却从未写下来的内容。

这篇由乌尔姆大学(Ulm University)研究人员撰写的论文,提出了一种新方法来发现这些隐藏的假设,并将它们转化为清晰的文字规则。

问题所在:“神奇”的食谱

数据科学家使用 R 或 Python 等语言来分析数据。通常,他们在交互式笔记本中工作,输入代码,看到结果,再输入更多代码,然后看到另一个结果。

麻烦在于,这些脚本往往依赖于并未写下来的“魔法”:

  • 正确的工具: “我使用了一个特定的软件工具版本,但我没告诉你我也安装了它。”
  • 操作顺序: “我在执行这一步之前运行了那一步,但我没告诉你必须按这个顺序操作。”
  • 数据的形状: “我假设你的数据有一个名为‘Age’(年龄)的列,但你的数据里叫作‘Years’(年份)。”

当其他人尝试运行这段代码时,代码经常会崩溃或给出错误的答案,因为这些隐藏的规则被破坏了。研究表明,大量的这类数据脚本对于原作者以外的人来说根本无法运行。

解决方案:“侦探”方法

作者建议使用一种叫做**静态分析(Static Analysis)**的技术。你可以把它想象成一个超级聪明的侦探,它在不实际运行代码的情况下阅读代码。

侦探不仅仅是在看文字,它还在观察逻辑,并进行提问:

  • “为了让这一行代码生效,这里必须有什么版本的软件?”
  • “这个数据文件必须长成什么样,计算才能有意义?”
  • “这个脚本是否依赖于一个未包含在内的前置步骤?”

随后,侦探会将这些隐藏的规则写成约束条件(Constraints)。这就像是把那份模糊的食谱加上了一份顶部的清单:“必须使用 X 型号烤箱”、“面粉必须过筛”、“鸡蛋必须是常温”

它是如何工作的(三个主要线索)

论文将这些隐藏的假设分为三个主要类别:

  1. 工具包(软件包版本):

    • 假设: “我使用了一个我的软件中尚未具备的新功能。”
    • 修复: 侦探通过查看代码并指出:“这个脚本使用了一个仅在 2022 年才发明的特定绘图工具。你需要 2.0 或更高版本的软件。”
  2. 连锁反应(脚本依赖):

    • 假设: “我正在使用一个名为 grouped 的变量,它是在另一个文件中创建的,但我没告诉你先要加载那个文件。”
    • 修复: 侦请追踪这些连接。它意识到:“嘿,这个脚本缺少了一个拼图碎片。它需要在运行完那个其他脚本之后才能运行,以获取所需的数据。”它会创建一个地图,展示运行所有内容的正确顺序。
  3. 数据的形状(数据预期):

    • 假设: “我假设数据中有一列名为‘Score’(分数),且数字是整数。”
    • 修复: 侦探分析数学逻辑。它增加了一个安全检查:“在开始之前,检查数据是否真的包含‘Score’这一列。如果没有,停止运行并告知用户。”

目标:让科学具有可重复性

最终目标不仅仅是修复一个脚本,而是让科学更加可靠。

  • 对于原作者: 这有助于他们编写出更好的、具有自我检查功能的代码。
  • 对于使用者: 它充当了一份清晰的说明书。如果你尝试使用错误的数据或工具来运行脚本,脚本会停下来并提示:“嘿,你缺少一项要求,”而不是在出错时保持沉默或给出错误答案。

当前进展

研究人员利用一个名为 flowR 的工具构建了一个“概念验证”(工作原型)来分析 R 代码。他们在数千个真实世界项目中进行了测试,发现许多项目确实存在这些隐藏的依赖关系。

他们承认这并不是解决一切问题的“魔杖”(有些假设对于计算机来说过于复杂,无法完美猜测),但他们相信,仅仅是发现列出这些隐藏的假设,就是向前迈出的巨大一步。它将一份破碎、令人困惑的食谱变成了一份清晰、可用的指南,供所有人使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →