← 最新论文
💰 quantitative finance

Measuring Behavior Portability in Large Language Models

本文引入了一个衡量大语言模型行为可移植性的形式化框架,并通过受控实验证明,尽管这些模型的决策行为在结构上是等价的,但由于对表层呈现具有显著的敏感性,导致其无法在不同的决策环境中可靠地进行迁移。

原作者: Tianjia Dong, Nadav Kunievsky, James A. Evans

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianjia Dong, Nadav Kunievsky, James A. Evans

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、训练有素的决策者(一个人工智能),它表现得像一位专业厨师。你想知道这位厨师是否无论是在一个精致的法式厨房、一个质朴的意大利小酒馆,还是在一个现代的美式餐厅里,都能做出同样美味的佳肴。

这篇名为**《衡量大型语言模型的行为可移植性》(Measuring Behavior Portability in Large Language Models)**的论文提出了一个简单但至关重要的问题:如果人工智能在一个场景中学会了如何做决策,那么当你换一种不同的方式来描述这个问题时,它还能做出完全相同的决策吗?即便其中的数学逻辑和奖励机制是完全一致的?

作者将这种现象称为**“行为可移植性”(Behavioral Portability)**。

以下是利用简单类比对研究结果进行的拆解:

1. 核心问题:“框架”陷阱

想象你在玩一个分披萨的游戏。

  • 场景 A: 你被告知:“你有一个披萨。分一些给你的朋友。”
  • 场景 B: 你被告知:“你有一个披萨。你的朋友很饿,理应得到一份。”

在数学上,规则是完全相同的。所谓的“收益”(你得到的披萨量)也是一样的。但是,描述这些情况所使用的“词汇”不同。

研究人员测试了大型语言模型(LLMs)在这些不同措辞下的行为是否具有一致性。他们发现,模型的行为是不具备可移植性的。 就像一位在法式厨房里能做出完美牛排、但在意大利厨房里却会把牛排烧焦的厨师一样,人工智能会根据文本的“风味”改变其行为,即使其中的“食材”(数学逻辑)是相同的。

2. 实验设计:七种经济博弈

为了进行测试,研究人员并没有随机向人工智能提问。他们让人工智能参与了七种经典的经济博弈(例如“独裁者博弈”、“信任博弈”和“彩票选择”)。这些博ately 就像是决策能力的标准化驾驶考试。

  • 设置: 他们为每种游戏创建了数十个不同的“版本”。在其中一个版本中,游戏可能涉及与“同事”分享金钱;而在另一个版本中,则可能是与“伙伴”分享一笔“奖金”。
  • 转折点: 数字、规则以及潜在的奖励是完全相同的。变化的仅仅是围绕数字展开的故事背景。
  • 测试: 他们先用“法式厨房”的故事教会了人工智能如何玩这个游戏。然后,他们要求人工智能使用“意大利小酒馆”的故事来玩同一个游戏。

3. 结果:人工智能被故事搞糊涂了

研究结果令人惊讶,对于任何依赖人工智能进行一致性决策的人来说,这都值得警惕:

  • 人工智能是脆弱的: 当故事发生变化时,人工智能的决策也会发生显著变化。一个在某种故事中学会了“公平”的模型,可能会在另一个数学逻辑完全相同的故事中变得“自私”,仅仅是因为措辞不同。
  • “可移植性”得分: 研究人员测量了人工智能行为的变化程度。他们发现,对于社交类游戏(如分享或信任),人工智能的行为非常不稳定。它就像一个指南针,尽管北极星没动,但只要风向一变,它就会疯狂旋转。
  • 例外情况(彩票): 当任务纯粹关于数字和风险(如在两个彩票之间做选择)时,人工智能的表现要稳定得多。这表明人工智能处理数学的能力似乎强于处理社交故事的能力。

4. “出声思考”是否有帮助?(思维链)

研究人员尝试了一种常见的技巧:要求人工智能在回答之前“一步步思考”(这被称为思维链,或 CoT)。

  • 期望: 或许如果人工智能解释了它的推理过程,它就能忽略干扰性的故事,专注于数学逻辑。
  • 现实: 这种方法有时有效,但并非总是奏效。在某些游戏中,通过“出声思考”,人工智能确实变得更加一致;但在另一些游戏(如最后通牒博弈)中,它反而对故事的具体措辞变得更加敏感。这就像一个学生,当被要求解释自己的解题过程时,有时会意识到自己的错误,但有时又会被自己的解释带偏,从而产生新的错误。

5. “推理型”模型

他们还测试了一种更新、更“聪明”的模型(DeepSeek-R1),该模型专门为复杂推理而设计。

  • 结果: 这个模型更擅长忽略故事并专注于数学逻辑。它更具“可移植性”。然而,它并不完美。即使是最聪明的模型,在故事改变时仍表现出了一些不稳定性。

总结

论文的结论是:你不能仅仅因为数学逻辑相同,就假设人工智能的行为会保持不变。

如果你训练一个人工智能在特定的提示词下做出公平决策,你不能自动信任它在描述稍有不同的问题时,仍能做出同样的公平决策。目前,人工智能对于文本的“风味”过于敏感了。

简而言之: 人工智能就像一个熟知地图、却会在你用另一种语言描述目的地时迷路的旅行者。在解决这个问题之前,我们无法完全信任这些模型在现实世界中做出一致的决策,因为现实中的问题很少会以完全相同的方式被描述两次。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →