← 最新论文
💻 computer science

Scaling Laws for Moral Machine Judgment in Large Language Models

本研究证明,大型语言模型的道德判断能力(通过其在生死困境中与人类偏好的一致性来衡量)随着模型规模的增大,按照幂律缩放关系可预测地提升,而扩展推理进一步增强了这种一致性,尤其在小规模模型中更为显著。

原作者: Kazuhiro Takemoto

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Kazuhiro Takemoto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人如何做出艰难的选择,比如在车祸中决定救谁。你希望机器人能像人类一样思考。但是,让机器人变得更“聪明”(通过赋予它更多的算力)是否会自动让它变得更“善良”,或更符合人类的价值观?

这篇题为《道德机器判断的缩放定律》的论文,通过测试 75 种不同的 AI 模型(从微小的模型到庞大的模型)来回答这个问题。以下是他们发现的故事,以简单的方式呈现。

大实验:“道德机器”

研究人员使用了一个著名的测试,称为“道德机器”。想象一个电子游戏,你需要在车祸中做出 10,000 种不同的选择,决定谁生谁死。

  • 人类基准:数百万真实的人已经玩过这个游戏。他们的回答绘制出了一幅“地图”,显示了人类通常的偏好(例如:人类通常比宠物更受青睐;拯救更多人通常比拯救更少人更受青睐)。
  • 测试:研究人员让 75 种不同的 AI 模型玩同样的游戏。他们测量了 AI 的回答与人类“地图”之间的偏差。AI 的回答越接近人类,得分就越高。

主要发现:更大的大脑 = 更好的对齐

研究人员发现了一个清晰、可预测的模式,他们称之为“缩放定律”。

将 AI 模型想象成学校里的学生。

  • 小模型就像小学生。他们表现各异:有些非常好,有些非常差,他们的答案遍布各处。
  • 大模型就像博士候选人。随着模型变得更大(拥有更多的“参数”,这类似于拥有更多的神经元或脑细胞),它们会持续地更接近人类认为正确的观点。

数学部分(简化版):
论文发现,随着模型规模的增加,与人类偏好的距离会缩小。这不是一条直线,而是一条曲线。

  • 如果你将模型规模扩大10 倍,它并不会变得好 10 倍。它只会比人类道德接近约 21%
  • 这就像攀登一座山:你爬得越高,离顶峰就越近,但最后的几步非常缓慢,需要付出巨大的努力。

“思考”因素:智能工具帮助小模型

研究人员还考察了那些拥有特殊“思考模式”的模型(例如在回答前深呼吸并逐步思考)。

  • 发现:使用这种“扩展推理”的模型通常在道德选择上表现更好。
  • 转折:这种“思考”技巧对小模型的帮助最大。这就像给一个数学不好的学生一台计算器;这对他们帮助巨大。但对于一个已经拥有庞大大脑的巨型模型来说,计算器虽然也有帮助,但效果不那么显著。巨型模型已经足够庞大,可以自行理清逻辑。

为什么这很重要(根据论文)

  1. 可预测性:你可以根据 AI 的规模来预测它处理道德困境的能力如何。这不是随机的运气,而是这些机器的一种自然法则。
  2. 一致性:这条规则适用于他们测试的几乎所有类型的 AI,无论是谷歌、Meta 还是独立研究人员制造的。
  3. 可靠性:随着模型变大,它们不仅平均表现更好,而且更加一致。小模型是混乱的(有时极好,有时极差),但大模型则稳定可靠。

论文没有说什么

  • 它并没有说 AI 现在在人类意义上是“道德”的。 它只是说 AI 的回答与人类统计数据更吻合。
  • 它并没有说我们应该继续制造更大的模型。 论文指出,由于改进是缓慢的(即那个 21% 的规则),仅仅让它们变大可能过于昂贵或低效。有时,添加“思考工具”是更好的捷径。
  • 它并没有声称这适用于每一种文化。 他们使用的“人类地图”主要基于来自西方国家的人。论文承认,我们不知道这条规则是否适用于世界其他地区的人们。

核心结论

如果你希望 AI 做出听起来像人类的伦理决策,规模很重要。更大的模型更有可能与我们达成一致。然而,改进是缓慢的,因此对于较小的模型,教它们“仔细思考”是一种追赶的强大方式。这为我们提供了一条数学规则,有助于预测 AI 在做出生死抉择时可能有多安全、多可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →