← 最新论文
🤖 machine learning

Causal methods for LLM development and evaluation

本文认为,因果推断方法目前在大型语言模型的开发与评估中尚未得到充分利用,但对于解决混淆、偏差和非平稳性问题至关重要,它提供了一个原则性框架,以指导从预训练到部署的整个大型语言模型流程中的干预措施。

原作者: Dennis Frauen, Marie Brockschmidt, Konstantin Hess, Haorui Ma, Yuchen Ma, Abdurahman Maarouf, Maresa Schröder, Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Sonali Parbhoo, Rahul G. Krishnan, Stefan
发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Dennis Frauen, Marie Brockschmidt, Konstantin Hess, Haorui Ma, Yuchen Ma, Abdurahman Maarouf, Maresa Schröder, Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Sonali Parbhoo, Rahul G. Krishnan, Stefan Feuerriegel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位厨师,正试图为一家大型连锁餐厅创造完美的新食谱。你拥有成千上万种食材(数据)、不同的烹饪方法(模型)以及一个由评论家组成的团队(评估者)。目前,大多数厨师只是靠猜测:“多加点盐”、“换个烤箱试试”或者“问问评论家他们喜欢什么”。他们品尝菜肴,记下笔记,然后再次尝试。这就是大型语言模型(LLM)目前的构建方式——通过试错。

本文认为,这种“猜测与检查”的方法风险很大。相反,作者建议我们应该使用因果方法,这就像一套科学侦探工具包。这些工具不仅能让我们看到发生了什么,还能帮助我们回答这个问题:“是什么导致了这一结果,如果我们做了不同的事情,会发生什么?”

以下是该论文愿景的分解,通过简单的类比呈现:

1. 核心问题:“虚假”的关联

想象你注意到,点最昂贵葡萄酒的顾客给的小费也最多。

  • 天真的观点:“如果我给每个人都免费提供昂贵的葡萄酒,他们就会给更多小费!”
  • 因果的观点:“等等。也许那些买得起葡萄酒的富人本身就是给小费大方的人,而不是葡萄酒本身。如果给富人提供廉价葡萄酒,他们可能仍然会给不错的小费;如果给穷困的人提供昂贵葡萄酒,他们可能根本不会给小费。”

在大型语言模型中,这种情况时有发生。

  • 场景:一个系统将难题发送给“聪明”(大型)模型,将简单问题发送给“快速”(小型)模型。
  • 错误:大型模型得分较低,是因为问题更难,而不是因为模型更差。
  • 因果修正:我们需要将问题的难度模型的质量区分开来,才能看清谁实际上做得最好。

2. 三大主要工具(“如何做”)

论文指出,要解决这些谜题,我们需要三种特定的技能:

  • 可识别性(“我们能知道吗?”检查):在开始之前,我们要问:“我们是否真的拥有足够的信息来解决这个问题?”如果我们的数据存在偏差(例如只向满意的顾客征求评论),那么无论收集多少数据,我们可能永远无法知道真正的答案。因果方法能告诉我们何时陷入困境,以及我们做出了哪些假设。
  • 估计(“如何计算”检查):即使我们能够知道答案,数据也是混乱且庞大的。我们需要特殊的数学方法(称为“双重机器学习”)来清除噪声并获得精确的答案,这类似于降噪耳机过滤背景杂音以清晰地听到音乐。
  • 反事实(“如果……会怎样?”机器):这是超能力。它允许我们模拟不同的现实。“如果我们把这个问题路由到小型模型会怎样?”我们可以在不实际破坏系统以进行测试的情况下回答这个问题。

3. 应用场景(厨房之旅)

作者描绘了这些侦探工具如何融入人工智能的构建过程:

  • 预训练(混合食材)

    • 问题:我们混合书籍、代码和论坛来训练人工智能。但是,如果我们过滤掉“有毒”文本,可能会意外地移除重要的方言或事实。
    • 修正:使用因果工具来预测改变“食谱”(数据混合)将如何改变最终的“味道”(模型性能),而无需重新烹饪整道菜。
  • 对齐(教导人工智能变得礼貌)

    • 问题:我们让人类在两个选项中选择更好的答案。但人类存在偏见(例如,他们更喜欢更长的答案)。
    • 修正:使用因果工具剔除人类偏见,以便我们可以看到哪个答案实际上更好,而不仅仅是哪个看起来更漂亮。
  • 路由(服务员的决策)

    • 问题:服务员(路由器)决定哪个厨师(模型)接收哪个订单。如果他们把困难订单交给主厨,主厨看起来就会很慢。
    • 修正:因果方法帮助服务员了解每位厨师的真实速度和质量,无论订单难度如何,从而高效地分配任务。
  • 智能体(人工智能团队)

    • 问题:现代人工智能不仅仅是回答问题;它会采取行动(搜索网络、使用工具、调用其他人工智能)。如果最终结果不好,是搜索工具的问题?工具使用者?还是第一步的问题?
    • 修正:因果方法充当“黑匣子”记录器,精确追踪哪一步导致了成功或失败,帮助我们修复链条中具体的断裂环节。
  • 评估(评论家)

    • 问题:有时我们使用一个人工智能来评估另一个人工智能。但作为法官的人工智能可能存在偏见(例如,它喜欢自己的写作风格)。
    • 修正:结合人类和人工智能法官,利用因果数学消除偏见,获得公平的评分。

4. 安全检查

最后,论文讨论了安全性。如果人工智能说了有害的话,我们需要知道为什么。是训练数据的问题?还是奖励机制的问题?

  • 类比:如果一辆车撞了,我们不会只说“它撞了”。我们会查看黑匣子,看看是刹车、司机还是道路的问题。
  • 修正:因果方法帮助我们追踪有害行为在训练流程中的源头,而不是仅仅靠猜测。

结论

作者并不是在说“因果方法会让人工智能变得更聪明”。他们在说:“因果方法将使构建和测试人工智能的过程更加可靠。”

目前,我们是在黑暗中构建这些复杂系统,猜测什么有效。本文认为,我们应该打开灯光,使用科学工具来理解因果关系,并构建更安全、更便宜、更值得信赖的人工智能系统,因为我们实际上知道它们为何有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →