← 最新论文
💬 NLP

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

CausalDS 是一个综合性的基准测试,旨在通过整合合成结构因果模型、真实的自然语言叙述以及跨越 珍珠(Pearl)因果关系三个层级的多步编码任务,来评估数据科学智能体的因果推理能力,同时显式地评估其工具使用、不确定性量化以及在无法给出合理答案时进行弃答的能力。

原作者: Andrej Leban, Yuekai Sun

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrej Leban, Yuekai Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:CausalDS – 数据科学智能体中的因果推理基准测试

1. 问题陈述

当前针对大语言模型(LLMs)在数据科学和因果推理方面的基准测试存在碎片化问题,无法捕捉现实世界因果分析的复杂性。现有的评估通常孤立地测试特定能力:

  • 数据科学基准测试(如 DS-1000, MLE-bench)强调编码、工具使用和开放式分析,但缺乏隐藏的、有原则的因果数据生成结构。
  • 因果推理基准测试(如 CLadder, CausalGraph2LLM)测试符号图推理、干预和反事实逻辑,但通常运行在纯符号层面,或使用来自现有文献的精选案例。

这种分离造成了一个差距:模型可能会依赖“摊销因果推理”(即记忆现有数据集中的模式),而非真正的结构敏感型推理,这种失效模式被称为“因果鹦鹉”。此外,现实的因果数据科学要求智能体不仅要回答因果问题,还要能够解释领域描述、检查观测数据、确定可识别性、估计量值、量化不确定性,并识别何时问题是无法回答的(弃权)。目前尚不存在能够在一个统一的、合成但真实的框架内,同时评估符号推理、数据科学执行、不确定性量化、认识论弃权和工具使用的基准测试。

2. 方法论:CausalDS 框架

CausalDS 通过生成合成的因果数据科学场景来解决这一差距,这些场景构成了基准测试的基本单元。每个场景包含一个隐藏的结构因果模型(SCM)、一个自然语言故事、表格观测数据以及一套涵盖 Pearl 三层阶梯的任务。

2.1 场景生成流水线

生成过程遵循严格的流水线,以确保在保持叙事连贯性的同时,已知地面真值(ground truth):

  1. 图采样: 从规范基元(链、分叉、混杂因素、碰撞因子等)中采样有向无环图(DAGs),并可通过“基于锚点的嫁接”进行扩展,即通过共享节点连接辅助基元,以在增加复杂性的同时保持叙事流。
  2. SCM 实例化: 每个图都通过使用类型化机制配置文件的结构因果模型进行实例化,这些配置文件从混合了经验性生化/布尔规则与合成机制的注册表中提取。
  3. 观测层: 一个关键的设计选择是将概念性的 SCM 与提供给智能体的实际数据区分开来。概念变量可能被替换为一组噪声测量值(代理变量)。这一层增加了数据分析的难度,但不会改变底层的因果可识别性状态。
  4. 语言化: 将抽象节点映射到领域相关的变量名称(可选地从 CauseNet 获取种子),并由审计员验证,以确保生成的自然语言故事忠实地反映了隐藏的图结构,而不会引入“偶然边”。
  5. 任务推导: 从每个场景中,跨越第一层(关联/预测)、第二层(干预/识别/估计)和第三层(反事实/中介)推导出任务。

2.2 评估环境

智能体在沙盒环境(使用 mini-swe-agent)中进行交互,它们必须:

  • 阅读提供的文件(故事、数据模式、观测数据)。
  • 执行代码(Python/bash)进行分析。
  • 按特定格式编写答案文件。
  • 处理不完美的观测,并决定在目标不可识别时是否弃权。

2.3 评分与指标

评估是完全确定性的,并针对五个不同的维度进行评分:

  • 符号因果推理: 图恢复和识别逻辑。
  • 数据科学执行: 估计值和预测值的准确性。
  • 不确定性量化: 置信区间的校准度。
  • 认识论弃权: 正确识别不可识别的查询并拒绝回答。
  • 工具使用/效率: Token 使用量和工具调用次数。

综合得分(CausalDSScore)汇总了各项表现,并会对内容错误和在不可识别任务上未能弃权的行为进行惩罚。

3. 核心贡献

  • 基于 SCM 的合成场景: 第一个生成隐藏 SCM、合成观测数据并计算私有地面真值用于评估的基准测试,同时将组成轴(变量类型、图结构)锚定到来自真实世界数据集的经验分布,以确保真实性。
  • 图忠实的自由形式语言化: 一个将抽象图节点映射到连贯领域变量并生成自然语言故事的流水线,经过审计以确保叙事不会偏离底层的因理解结构。
  • 独立的观测层: 一种可以独立于因果可识别性来改变数据科学难度的机制(通过噪声代理变量),允许基准测试在不改变因果问题的条件下压力测试估计技能。
  • 广泛的任务套件: 一套涵盖 Pearl 阶梯所有三层的全面任务,包括预测、关联、图恢复、识别、效应估计、偏差诊断和反事实推理。
  • 基于弃权的确定性评估: 一种将对不可识别估计量的弃权视为一等结果的评分系统,防止模型因对无法回答的问题进行幻觉而获得奖励。

4. 实验结果

作者在 100 个场景的现实组成考试中,评估了六个模型(三个前沿闭源模型:Claude Opus 4.8, Gemini 3.1 Pro, GPT-5.5;以及三个开源权重模型:Qwen 3.6 35B, Kimi K2.6, Gemma 4 26B)。

  • 性能解耦: 五个评估维度并不坍缩为单一能力。模型在内容正确性、不确定性量化、弃权识别和工具使用效率方面存在显著差异。
  • 排行榜: Claude Opus 4.8 取得了最佳的综合 CausalDSScore (0.278),在通过率、归一化误差和信噪比(SNR)方面均处于领先地位。它是唯一一个在保持强劲弃权性能的同时,在二元任务上实现 100% 内容正确性的模型。
  • 弃权作为区分特征: 识别不可识别查询的能力是一个主要的区分点。前沿模型(尤其是 GPT-5.5 和 Claude)表现出显著更高的弃权通过率(高达 75%),而开源权重模型的弃权通过率较低(Gemma 4 26B 仅为 18.8%)。
  • 不确定性量化: 所有模型都表现出过度自信。名义 95% ATE 区间的经验覆盖率降至 20.0% 到 71.4% 之间,其中 Claude Opus 4.8 表现最好(71.4%)。
  • 工具使用与效率: 前沿模型(Claude, GPT-5.5)采用了“近乎单次(one-shot)”策略,每次任务的工具调用次数较少(2.1–3.4 次)且 Token 使用量较低;而开源权重模型迭代频繁(每次任务 11–18 次调用)并消耗了更多的 Token。
  • 观测难度: 在最难的观测变体(噪声代理)下,性能有所下降,尤其是对于开源权重模型。GPT-5.5 的连续估计校准度下降最大(平均归一化误差上升至 3.10),而 Claude Opus 4.8 则保持了受控的误差。

5. 意义与主张

论文声称,CausalDS 通过将符号推理、定量估计和智能体工具使用集成到一个统一的、真实的设置中,实现了基准测试的必要演进。主要的实证发现是,因果数据科学能力是分解的:模型可能掌握了局部(读取结构、产生估计),但在整体上会失败(例如不知道估计的质量,或者不知道是否被授权回答问题)。

作者断言,一个胜任的因果数据科学智能体必须同时满足所有五个维度。该基准测试表明,当前的前沿模型正在接近这种能力,其中 Claude Opus 4.8 脱颖而出,是最接近“全能型因果数据科学智能体”的模型,而开源权重模型和较小的模型在认识论维度(弃权和不确定性)以及工具使用效率方面仍面临巨大挑战。这项工作强调,“知道何时弃权”是一项区分鲁棒智能体与易产生幻觉智能体的独立且高级的技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →