← 最新论文
🔬 physics

A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints

本文提出了一种统一的价值数学理论,将其视为一种类似于信息的、对数形式且相对于框架的结构化量,并推导出一个将目标进展与互信息联系起来、并将失调与可测量的浪费联系起来的编码定理,该框架通过其预测不同任务中语言模型性能及过度自信的能力得到了实证验证。

原作者: Cheng Qian

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Cheng Qian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图测量某种非常抽象的东西,比如“价值”。通常,我们会认为价值是某物的价格、感觉有多好,或者其道德属性。这篇论文说:停下来。 把这些全部剥离掉。

作者提出了一种衡量价值的新方法,它像物理学一样严谨且具有数学性。他们认为,价值仅仅是一个目标导向型智能体(如机器人、人或人工智能)将有限资源(如能量、时间或金钱)转化为特定目标进展的速度。

以下是该论文的理论,使用日常类比进行了拆解。

1. “价值”公式:对数定律

概念:
如果你有一袋资源(比如100美元)并且想要实现一个目标,你应该如何使用它?论文指出,价值的增长不是线性的。你花费的第一美元价值巨大;而第一百美元的价值则小得多。这被称为“收益递减”。

类比:
想象你在用一根漏水的软管给水桶注水。最初的几加仑能让水桶迅速变满。随着水桶越来越满,水位上升的速度就越来越慢。
作者通过数学证明,衡量这种“进展”的最佳方式是使用对数(一种特定的数学曲线)。

  • 为什么重要: 这意味着将资源过度分散到许多不同的目标上是低效的。将资源集中在最重要的目标上才能创造最多的“价值”。

2. “速度限制”:价值受限于信息

概念:
你无法创造比你理解世界的速度更快的价值。如果你蒙着眼睛开车,无论投入多少汽油(资源),都无法比睁着眼睛时更快到达目的地。

类比:
想象你是一个赛马场上的赌徒。

  • 世界: 奔跑的马匹。
  • 你的目标: 选出赢家。
  • 你的资源: 你的钱。
  • 你的感知: 你观察哪匹马领先的能力。

论文证明了一个“价值编码定理”:你的最大利润(价值)完全等于你掌握关于这场比赛的信息量。
如果你一无所知,你就无法赚钱。如果你拥有对比赛的完美观察,你就能赚取尽可能多的钱。你不能凭空“创造”价值;你只能将信息转化为价值

3. “价值第二定律”:失调即浪费

概念:
在物理学中,热力学第二定律指出,当你尝试做功时,能量往往会以热的形式损失(浪费)。作者认为,在价值领域也是如此。
如果你的世界模型是错误的,你就会浪费资源。

类比:
想象你正试图用弓箭射中目标。

  • 潜在价值: 如果你表现完美,你可能射出的距离。
  • 耗散(浪费): 因为瞄准了错误的位置而损失的能量。
  • 结果: 如果你虽然自信但方向错了,你不仅会失败,还会主动破坏价值。论文表明,人工智能中的“过度自信”是一种可衡测的浪费形式,就像机器中的摩擦力一样。

4. “集群”问题:群体如何协作

概念:
当你有整个团队的智能体(一个“集群”)协同工作时,会发生什么?
论文认为,你不能简单地像做加法一样把它们的价值相加。每个智能体都有自己的“参照系”(它自己的目标和对世界的看法)。

类比:
想象一群投资者。

  • 价值是相对的: 一个投资者可能看重黄金,另一个可能看重石油。如果不使用共同的货币,你无法判断谁拥有的“价值”更多。
  • 价格是桥梁: 资源的“价格”(如美元)是大家达成共识的东西。它充当了不同目标之间的翻译官。
  • 集群上限: 如果整个团队汇集资金并共享他们的视野(信息),他们就像一个巨大的超级智能体。他们的总成功受限于整个团队拥有的总信息量。如果每个人看到的都完全一样,那么增加人数并不会带来帮助。但如果他们看到的各不相同(多样性),这个群体可以实现比任何单个人单独行动时更高的成就。

5. “实然”与“应然”的差距

概念:
“实然”(关于世界的客观事实)与“应然”(目标)之间存在根本区别。

  • 信念(“实然”): 这些是可以学习的。如果你看到世界是蓝色的,你会将信念更新为“世界是蓝色的”。
  • 目标(“应然”): 世界不会告诉你想要什么。你必须由设计者告知你想要什么。

类比:
想象一个GPS导航系统。

  • GPS可以轻松学习道路的事实(交通状况、施工情况)。
  • 但GPS无法决定你想去哪里。那是一个目标。
    论文表明,如果你试图通过“监督”(强制停止)来修正一个失调的智能体(一个走错路的人),这是低效的。更好的方法是改变激励机制(价格),使得智能体想要走的路径,恰好就是你想要它走的路径。

6. 现实世界测试

作者不仅写了数学公式,还对真实的AI模型(大语言模型)进行了测试。

  • 测试: 他们要求AI解决数学问题、编写代码并回答问题。
  • 发现: 他们测量了AI从问题中获取了多少“信息”,以及它产生了多少“价值”(正确答案)。
  • 结果: 数学模型完美成立。AI产生价值的能力与其从问题中提取信息的能力直接相关。
  • 惊喜之处: 更大的模型(拥有更多“脑力”)并不总是表现得更好。一个更小、更高效、且对特定任务理解更透彻的模型,往往比一个庞大却混乱的模型能创造更多的“单位能量价值”。

总结

这篇论文将价值视为一种物理量,而非一种感觉或价格标签。

  1. 价值是将资源转化为目标进展的速率。
  2. 信息是驱动价值的燃料。你无法获得超过信息所允许的价值。
  3. 错误即浪费。自信地犯错会破坏价值。
  4. 群体在分享多样化信息并在公平价格下进行资源交易时运作得最好。
  5. 对齐不是关于强迫智能体服从,而是关于设计“价格”,使得智能体想要做的正是你想要它做的。

作者得出结论,这一框架提供了一种稳固且数学化的方式,用于理解、衡量和管理AI智能体群体,从而超越模糊的“好”或“坏”的概念,转向对效率和浪费的精确计算。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →