← 最新论文
🤖 machine learning

From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers

本文系统地评估了 12 个大型语言模型作为直接因果边分类器的表现,并发现尽管它们表现出较强的召回率,但存在显著的过度预测、难以区分直接关系与间接关系以及对错误判断表现出严重过度自信的问题,这表明它们更适合作为软因果先验的来源,而非可靠的因果结构直接证据。

原作者: Amit Kumar, Elnur Adl Zarabi, Suranjana Trivedy, Zhiqian Chen, Lei Zhang, Kaiqun Fu, Taoran Ji

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Amit Kumar, Elnur Adl Zarabi, Suranjana Trivedy, Zhiqian Chen, Lei Zhang, Kaiqun Fu, Taoran Ji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

科学不仅寻求了解发生了什么,还寻求了解为什么会发生。当研究人员试图绘制出现象背后的因果图谱时——无论是病毒在人群中传播,还是工厂中的机器发生故障——他们都在构建一个连接图。在这个图中,从一件事物到另一件事物的直接连线意味着第一件事立即导致了第二件事。如果病毒导致感染,进而导致检测结果呈阳性,那么病毒是通过感染间接导致检测结果的。弄清楚哪些连线是直接的,哪些是间接的,是一个被称为“因果发现”的难题。几十年来,科学家们一直依赖复杂的数学工具和大量的观察数据来解决这个谜题,但当数据匮乏或不同模式看起来完全一致时,这些工具有时会显得力不从心。

近年来,一种新型工具应运而生:大型语言模型。这些计算机系统通过海量文本训练而成,能够回答问题、编写故事并进行逻辑推理。由于阅读了大量资料,它们似乎拥有关于世界运作方式(包括事物如何相互作用)的深厚知识储备。研究人员开始询问,这些系统是否可以充当专家向导,告诉我们图中哪些连接是真实且直接的。人们曾希望这些模型可以提供一种捷径,无需进行昂贵的实验即可对因果关系提供可靠的判断。然而,一项新的研究表明,虽然这些模型擅长感知两件事物之间存在关联,但它们往往并不了解确切的连接方式,并且在出错时往往表现得过于自信。

一个研究团队通过将大型语言模型视为直接因果关系的评判者,对它们的可靠性进行了测试。他们收集了十二个不同版本的此类模型,涵盖了从小型高效系统到庞大功能强大的系统。随后,他们向这些模型展示了六个不同的现实场景,每个场景都由已知的因果图谱表示。这些场景涵盖了广泛领域,从肝炎和新冠肺炎等医疗状况,到工业流程和生态系统。对于图中的每一对变量,研究人员向模型提出了一个简单的问题:第一个项目是否直接导致第二个项目?模型必须回答“是”或“否”,并提供一个置信度分数,即一个表示其对答案把握程度的数值。

结果显示出一种一致的“过度热情”模式。模型倾向于过频繁地回答“是”。它们并没有绘制出仅包含必要直接连接的稀疏地图,而是生成了密集的网络,其中几乎所有事物似乎都与其他所有事物直接相连。这种行为非常强烈,以至于即使研究人员尝试了不同的提问方式,也无法轻易训练模型变得更加谨慎。它们能正确识别两件事物相关,但却无法区分直接原因和间接原因。例如,如果病毒导致感染,进而导致发烧,模型通常会声称病毒直接导致了发烧,而忽略了中间步骤。在涉及间接关系的情况下,这种错误大约发生了40%;而在因果方向相反的情况下,错误率约为36%。

最令人担忧的发现或许是模型对于自身错误的缺乏自知之明。当模型在间接相关的项目之间错误地声称存在直接联系时,它们并不会犹豫。在超过80%的模型错误声称间接项之间存在直接联系的案例中,它们给出的置信度分数至少达到了80%。它们不仅仅是在猜测,而是错得理直气壮。研究还调查了模型是否可以根据其置信度分数来区分正确猜测与错误猜测。研究人员发现,模型给出的置信度数值通常是不可靠的。一个模型可能会说它有90%的把握,但这个数字实际上与答案是否正确并不相关。唯一显示出轻微改进的方法是采用不同的提问方式并观察它们之间是否达成一致,但即便如此,这种方法也并非完美的解决方案。

研究人员还调查了模型是否仅仅是在记忆测试题中见过的答案。他们发现,对于一个涉及特定医疗状况的数据集,几个模型的表现异常出色,这表明它们可能在训练期间见过这些数据。然而,这种熟悉感并不能解释在其他五个数据集上的糟糕表现,在那些数据集中,模型仍然面临着同样的错误类型。即使研究人员强制模型在三个选项(直接原因、反向原因或无直接联系)中做出选择,而不是仅仅在两个选项中选择,模型的表现也没有显著改善。它们继续在不存在直接联系的地方预测直接联系,这证明了问题不仅在于提问方式的缺陷,更在于这些系统理解因果关系的根本局限性。

最终,研究结论指出,虽然大型语言模型是生成想法的强大工具,但不应将其视为世界运作方式的确定性证据。它们更适合被视为“软建议”的来源,提供一个必须通过其他方法进行检查和验证的起点。它们可以告诉我们两件事物很可能相关,但不能被信任独立绘制精确的因果图谱。它们所表达的信心往往是训练数据的反映,而非真实的真理度量。对于需要理解因果机制精确性的科学家和工程师来说,仅依赖这些模型就像是在一座复杂的城市中依靠一张将每条街道都与其它所有街道相连的地图进行导航;它看起来可能很详尽,但会误导你。未来的路径在于利用这些模型生成假设,然后对其进行严格的测试,而不是将其自信的判断视为最终答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →