← 最新论文
🤖 AI

In LLM Reasoning, there is Irrationality on top of Value Misalignment

本文引入并形式化了“理性价值风险”(rational value risk),将其定义为大语言模型部署的推理策略与其最优理性对应策略之间的效用差距,并通过在多种模型和基准测试上的广泛实验证明,即使是经过良好对齐的模型,也经常由于推理时推理能力的局限、有限的数据约束以及不完美的验证机制,而无法实现期望效用的最大化。

原作者: Kejiang Qian, Fengxiang He

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Kejiang Qian, Fengxiang He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:拥有地图,却迷失了方向

想象你拥有一台非常聪明、训练有素的 GPS(AI)。在出发之前,这台 GPS 已经与你的目的地完美对齐了。它完全了解你的目的地,理解你的偏好,并且被编程为避开危险道路。这就是研究人员所说的**“价值对齐”(Value Alignment)**。

然而,这篇论文指出,即使拥有完美的 GPS,你仍然可能迷失方向。为什么?因为 GPS 可能会生成一系列可能的路线,看到了那条完美的路径,但随后却不小心选了一条糟糕且蜿蜒曲折的小路。

作者将这种差距称为**“理性价值风险”(Rational Value Risk)**。它是指 AI 所能找到的最佳可能答案(如果它能完美思考的话)与它实际给出的答案之间的差异。

核心问题:“不理性”的驾驶员

论文对两种类型的失败做了关键的区别:

  1. 价值失配(Value Misalignment): GPS 被编程为带你去错误的地方(例如,它以为你想去海滩,而你其实想去机场)。
  2. 不理性推理(Irrational Reasoning): GPS 知道你想去机场,它在屏幕上也看到了那条最快的路线,但它仍然告诉你走那条风景优美但要绕行 3 小时的远路。

作者发现,即使解决了第一个问题(AI 已实现对齐),第二个问题依然存在。即使 AI 知道什么是好的答案,它在选择最终答案时也是“不理性”的。

他们是如何衡量的:“试吃”类比

为了证明这一点,研究人员设计了一个大规模实验。想象一位厨师(AI)正在尝试烹饪一道菜。

  1. 设置: 他们要求厨师烹饪 64 种不同版本的同一道菜(采样 64 条不同的“推理路径”)。
  2. 试吃: 一位美食评论家(“验证器”)品尝了所有 64 道菜。
    3.结果:
    • REU(理性预期效用): 评论家发现,这 64 道菜中至少有一道是米其林星级杰作。这意味着 AI 能够做出那样的美味。
    • AEU(实际预期效用): 然而,厨师实际呈献给顾客的那道菜只是“还可以”甚至有些烧焦了。
    • RVR(理性价值风险): AI 本可以做出的“米其林星级”菜肴与它实际呈献的“还可以”菜肴之间的差距。

他们发现这种差距无处不在。无论 AI 是在编写代码、解决数学问题还是进行聊天,它都一致地表现出无法从它生成的选项中挑选出最优解的问题。

关键发现(“我们学到了什么”部分)

1. 问题无处不在 (H1)
无论 AI 是规模大小,还是在与你交谈或解决数学问题,情况都一样。AI 经常生成一个“金票”级别的答案,却未能将其递交给你。这就像一个彩票玩家买到了一张中头奖的彩票,却不小心把它扔进了垃圾桶。

2. 训练有帮助,但不能解决问题 (H2)
研究人员测试了经过“训练”以变得更好的 AI 模型(使用诸如 RLHF 等方法,类似于通过奖励来引导 AI 的良好行为)。

  • 结果: 训练让 AI 更擅长于生成好的答案(厨师变得更擅长烹饪了)。
  • 但是: AI 仍然难以从它烹饪出的答案中挑选出最好的那一个。训练减少了这个问题,但并未消除它。“不理性”是一个独立于训练之外的问题。

3. 提问方式很重要 (H3)
你询问 AI 思考的方式会改变结果。

  • 温度(随机性): 如果你告诉 AI 要更具随机性(更高的“温度”),它会生成更多样化、更有创意的答案。它能找到更好的潜在答案,但它也变得更难挑选出正确的那个。这种差距(风险)会变大。
  • 自一致性(投票法): 如果你让 AI 生成许多答案,然后通过投票选出最常见的那个,它在挑选正确答案方面会做得更好。这缩小了差距。

4. 思考时间长也有极限 (H4)
你可能会想:“如果 AI 思考得更久,它会变得更聪明。”

  • 结果: 有时确实如此。给 AI 更多的时间(更多的“Token”或步骤)有助于它找到更好的答案。
  • 陷阱: 过了某个临界点后,思考更久并不会带来太多帮助。这就像学习考试:阅读一小时教科书会有帮助,但阅读十小时并不会让你聪明两倍;你只会感到疲劳,并可能犯下愚蠢的错误。论文发现了“收益递减”现象——最终,过长的推理并不会带来持续的帮助。

错误的三个原因

作者将这种差距的存在归纳为三个部分:

  1. 候选问题: AI 在第一批尝试中没有生成那个好的答案。(它根本没有做出那道米其林佳肴)。
  2. 提示词问题: AI 在测试时题目数量太少,导致无法得到完美的平均值。
  3. 验证器问题: “美食评论家”(用于检查答案的工具)可能存在噪声或不确定性。

结论

论文得出结论,我们不能再将 AI 对齐视为一个“一劳永逸”的修复过程。即使我们教会了 AI 如何“行善”(对齐),我们仍然需要教会它如何“聪明”(理性)地去选择它的最终答案。

简而言之: 我们制造了拥有完美导航系统的汽车(对齐),但驾驶员(推理策略)仍然容易走错路。我们需要修理的是驾驶员,而不只是地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →