Benchmarking Large Language Model Rationality Using Measurement Axioms
本文引入了一个基于效用公理的测度论框架,用于评估大语言模型的理性程度,揭示了许多模型表现出系统性的偏好传递性违背,这种违背破坏了决策的一致性,尽管其中某些模式反映了人类行为。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一名新的助手来帮助你做出重要的决策,比如在不同的投资计划或医疗方案之间进行选择。你不仅仅想要一个能在考试中拿到“正确”答案的助手;你想要的是一个具有一致性的助手。如果他们告诉你计划 A 比计划 B 好,而计划 B 又比计划 C 好,那么他们理应得出结论:计划 A 比计划 C 好。如果他们会因为你提问的方式不同,或者因为午饭吃了什么而改变主意,那么他们就不是一个可靠的决策者。
这篇论文就像是对 20 种不同的语言大模型(LLM)——即像聊天机器人背后的 AI 大脑——进行的一次严格的“逻辑测试”。研究人员并没有问:“你的数学算对了吗?”而是问:“你的选择是否符合逻辑一致性?”
以下是他们使用简单类比进行的实验分解:
1. 测试:逻辑的“剪刀石头布”
在现实世界中,我们期望选择是具有传递性的。如果你认为苹果比香蕉好,而香蕉又比樱桃好,那么你也应该认为苹果比樱桃好。如果你突然觉得樱桃比苹果好,那么你的偏好就是“非传递性”的(逻辑断裂)。
研究人员设置了一个游戏,让 AI 在不同的“赌博”票券之间进行选择。每张票券都有赢得奖金的机会。
- 票券 A: 7/24 的机会赢得 5.00 美元。
- 票券 B: 8/24 的机会赢得 4.75 美元。
- 票券 C: 9/24 的机会赢得 4.50 美元。
他们要求 AI 对这些票券进行每一种可能的组合进行比较。如果 AI 是理性的,它的选择应该形成一条直线。如果它创造了一个循环(A > B > C > A),那么它就未能通过逻辑测试。
2. 他们试图破解 AI 的三种方式
研究人员不仅仅是问了一遍问题。他们尝试通过改变三样东西来“破解” AI 的逻辑,就像科学家调整配方以观察蛋糕是否会塌陷一样:
“温度”旋钮(随机性):
想象 AI 是一位厨师。在“低温度”下,厨师非常严谨,严格遵守食谱。在“高温度”下,厨师变得很有创意,会随机添加香料。研究人员将这个旋钮从非常严谨调到了非常混乱。他们想看看让 AI 变得更“有创意”是否会让其逻辑崩溃。- 结果: 出人意料的是,让 AI 变得更混乱(更高温度)实际上让它在最简单的测试中表现得更“好”,但这很可能是因为它开始随机猜测(就像抛硬币一样),而这种随机性恰好符合测试规则。这并不意味着 AI 的思考变得更清晰了。
“记忆”游戏:
想象你在参加考试。在第一个版本中,你孤立地回答每个问题。在第二个版本中,有人告诉你:“记住,你刚才在过去 10 个问题中都选择了选项 A;现在请再选一次。”- 结果: 给 AI 提供关于过去选择的“记忆”反而让它表现得更差。它并没有变得更加一致,反而变得困惑了。它的逻辑变得摇摆不定,并且会根据问题的顺序而改变主意。
“措辞”诡计:
他们询问了完全相同的问题,但改变了数字呈现的形式。- 版本 1:“7/24 的机会”(分数形式)。
- 版本 2:“29.17% 的机会”(百分比形式)。
- 结果: AI 的逻辑仅仅因为数字看起来不同就发生了变化。如果它是真正理性的,7/24 和 29.17% 应该被视为完全一样。它对数字的不同处理方式表明,它的“大脑”对数据的表面形态非常敏感,而不是基于底层的真相。
3. “类人”的错误
这是最引人入胜的部分。当 AI 未能通过逻辑测试时,它并不是随机失败的。它以一种与人类失败方式非常相似的特定方式失败了。
几十年前,心理学家发现人类经常使用一种“捷径”规则:“如果获胜概率的差异很小,我会选择钱最多的那个。但如果获胜概率的差异很大,我会选择更稳妥的一个。”这种捷径会导致人类产生逻辑循环。
这些 AI 模型不仅制造了随机错误,它们还模仿了这种特定的“人类捷径”。然而,它们模仿这种行为的频率比实际人类还要高得多。这就像是 AI 试图模仿人类,但它把“人类错误”的部分做得太过头了。
4. 核心结论
论文得出结论,虽然这些 AI 模型在生成文本和回答常识问题方面表现出色,但它们并不具备像理性人类或完美计算机程序那样稳定的、内在的“价值体系”。
- 它们不是严格意义上的“理性智能体”。
- 它们的决策高度依赖于你如何提问、你要求它们有多“随机”,以及它们是否记得自己刚刚说了什么。
- 如果你依赖 AI 进行一系列连续的决策(例如医生分步骤诊断患者),你无法保证它的逻辑能从第一步一直保持到第十步。
简而言之: AI 是一个出色的模仿者,听起来非常聪明,但如果你用逻辑棒去戳它,它就会摇晃。它并不拥有一个坚固、不变的信念体系;它只是对问题的即时形态做出反应。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。