Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models
本文介绍了 Linear-LLM-SCM,这是一个用于基准测试大语言模型在线性高斯结构因果模型中估计定量因果系数能力的框架,揭示了它们在处理现实世界数据集时在准确性和稳定性方面的显著局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人,它读过了互联网上几乎所有的书籍、文章和网站。当你问它一个问题时,它会以资深教授般的自信给出答案。但问题在于:虽然这个机器人非常擅长告诉你两件事是否有关联(比如“吸烟会导致咳嗽”),但它往往难以告诉你这种关联到底有多深(比如“吸烟使咳嗽增加了整整15%”)。这就是定性推理(了解故事)与定量推理(了解数学)之间的区别。在科学领域,我们使用一种叫做“因果模型”的东西来绘制这些故事的蓝图。你可以把因果模型想象成一个流程图或一个食谱,其中的箭头展示了一个成分如何改变另一个成分。通常,科学家需要通过真实的实验来计算出这个食谱中精确的数量。但是,如果我们能直接让这个超级聪明的机器人根据它读过的资料来猜测这些数字呢?这就是研究人员今天正在提出的重大问题:一个了解世界万物的AI,是否也能通过数学计算来准确预测未来?
这篇题为“Linear-LLM-SCM”的论文建立了一个游乐场,旨在测试正是这一点。研究人员创建了一个游戏,给七个不同的“大语言模型”(这些超级聪明机器人的高级称呼)提供了一个真实世界的系统图——即有向无环图,简称 DAG。你可以把 DAG 想象成一张单向行驶的街道地图,你无法在其中绕圈。这张地图展示了哪些变量(如“血糖水平”或“花钱”)会影响其他变量。机器人的任务是扮演专家统计学家,写下描述这些关系的精确数学方程,特别是猜测那些“系数”(即告诉人们效应强度的数字)。
团队测试了七个不同的真实世界地图,范围从人们如何消费到藻类植物如何生长。他们要求机器人观察地图和变量描述,然后为地图的每个部分写出一个回归方程(一个数学公式)。随后,他们将机器人的猜测与“地面真值”(即科学家已经在现实世界中测量出的实际正确数字)进行了对比。
结果既有“还不错”也有“哎呀,错了”。研究人员发现,虽然机器人有时能猜对方向(正向或负向影响),但实际的数值却千差万差。即使研究人员告诉机器人要尽可能保持一致(通过将“温度”设置为零,这就像是告诉机器人停止猜测,直接进行计算),答案在不同尝试之间仍然存在巨大的波动。例如,在关于“恶病质”(与肌肉萎缩相关)的地图上,一个机器人猜测的系数是 1.07,而另一个猜测的是 1.04,但这种偏差大到令人担忧。在“藻类”地图上,一个较小的模型(Llama 3.1 8B)甚至完全无法写出一个可读的方程。
论文还对机器人进行了压力测试,以观察它们的韧性。首先,研究人员改变了测量单位(比如从微米切换到纳米)。令人惊讶的是,有时这竟然在无意中让机器人的答案看起来更好了,这很可能是因为数字变得更容易书写了,而不是因为机器人更理解物理学了。其次,研究人员通过在地图中添加虚假连接(伪造边)来欺骗机器人。当地图中出现一个指向并不实际影响另一事物的因素的虚假箭头时,机器人的表现下降了。它们变得困惑,而且它们对不同因素重要性进行排序的能力也变差了。
主要的结论是,虽然这些 AI 模型非常擅长理解因果关系的“故事”,但它们目前在进行数学计算以预测效应的确切大小方面仍不可靠。这项研究表明,目前将这些机器人用于医疗保健或临床环境等高风险决策是危险的,因为它们的数字可能是不一致的,并且对问题的呈现方式极其敏感。作者并不是说这些机器人没用;他们是在说,在它们变得更加稳定之前,我们必须非常谨慎,不要把最终的数字交给它们。他们甚至向公众发布了他们的测试框架,以便其他科学家可以继续尝试解决这个问题,希望有一天,我们的数字助手不仅能讲述故事,还能完美地完成数学计算。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。