← 最新论文
💬 NLP

Eliciting Trustworthiness Priors of Large Language Models via Economic Games

本文介绍了一种利用迭代上下文学习和信任博弈来诱导大语言模型中信任先验的新方法,揭示了 GPT-4.1 的信任行为与人类模式高度相似,并且可以由温暖度和能力感的刻板印象来预测。

原作者: Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:AI 有多“值得信赖”?

想象一下,你正在雇佣一名新助手来处理你的资金。你给了他们 10 美元,并告诉他们:“我会把这笔钱变成 3 倍,也就是 30 美元。请把其中的一部分还给我。”

  • 如果他们还给你 15 美元: 他们是值得信赖的。
  • 如果他们还给你 0 美元: 他们就不可信。

这就是著名的**信任博弈(Trust Game)*的基本设定。通常,心理学家使用这个游戏来观察人类*的行为。但本论文提出了一个新问题:像 GPT-4 或 Llama 这样的语言大模型(LLMs)在游戏中表现如何? 它们对于如何信任他人以及如何回报他人,是否存在一个“默认设置”?

问题所在:你不能直接询问 AI

你可能会想:“为什么不直接问 AI,‘你会值得信赖吗?’” 作者说这是一个坏主意。

  • “礼貌机器人”问题: 如果你问 AI,“你会偷我的钱吗?”它几乎肯定会回答:“不会,我是一个乐于助人的助手。”
  • 现实情况: 就像人类一样,AI 可以非常有说服力且表达流畅,但在实际操作中仍可能做出冒险或不可靠的选择。我们需要观察它们的行为,而不仅仅是听它们怎么

解决方案:“传声筒游戏”式的信任测试

为了找出 AI 真实的“信任设置”,研究人员发明了一种基于**迭代上下文学习(Iterated In-Context Learning)**概念的巧妙方法。

你可以把它想象成一个传声筒游戏(Telephone Game),只不过传递的不是耳语,而是一个关于金钱的故事。

  1. 设定: 研究人员创建了一系列“代际”相连的 AI 链条。
  2. 第一步: 他们向 AI 展示几个玩信任博弈的例子(例如:“A 寄了 5 美元,B 退回了 2 美元”)。
  3. AI 的回合: AI 观察这些例子并预测:“如果我是 B,我会退回多少?”假设它预测为 40%。
  4. 循环: 研究人员将这个 40% 的预测结果用于生成新的、虚构的玩游戏的人类案例。然后,他们将这些新的例子喂给链条中的下一个 AI。
  5. 结果: 他们重复这个过程 30 次。

为什么要这样做?
想象一下,你试图通过观察一群人反复玩游戏来猜测他们的“平均人格”。起初,结果可能看起来很随机。但如果你不断将结果向下传递,那些“噪音”就会消失,剩下的就是 AI 关于信任运作方式的深层本能(或称“先验知识”)。这就像是在调频收音机,直到杂音消失,你听到真正的电台信号。

他们的发现

1. 有些 AI “像人”,有些则不然
研究人员测试了 20 种不同的 AI 模型。他们将发现的 AI “信任设置”与数千名真实人类的平均信任设置进行了对比。

  • 获胜者: GPT-4.1 与人类行为最接近。它的“信任旋钮”设置几乎与人类设置的位置完全一致。
  • 失败者: 其他一些模型要么过于吝啬(退回极少的钱),要么有着奇怪的分裂人格(有时非常信任,有时又非常怀疑)。

2. “风险”之间的联系
他们注意到一个有趣的现象:那些被评定为“更具冒险性”(更有可能冒险或发表大胆言论)的 AI 模型,实际上在信任博弈中表现得最像人类。那些极其严格遵守规则或规避风险的模型,在处理这种社交游戏时,表现得并不像真实的人类。

3. AI 根据“温暖度”和“能力”来评价他人
在研究的第二部分,他们使用最像人类的 AI(GPT-4.1)来与不同的“角色”(人格)进行博弈。

  • 他们让 AI 与“医生”、“AI”、“埃隆·马斯克”、“马拉拉·优素福齐”等角色进行游戏。
  • 发现: AI 对待每个人并不一样。对于它认为温暖(善良、体贴)和有能力(聪明、有技能)的人,它会退回更多的钱。
  • 神奇公式: 研究人员根据两个要素构建了一个简单的数学公式:温暖度(Warmth)能力(Competence)
    • 如果一个角色仅仅是“有能力”(聪明)但不“温暖”(善良),AI 对其信任度不高。
    • 如果一个角色“温暖”但不“有能力”,AI 会对其信任度稍高。
    • 黄金分割点: 如果一个角色既温暖又有能力(比如一位深受爱戴且聪明的导师),AI 的信任度会飙升。这与人类判断他人的方式完全一致。

总结

这篇论文表明,我们可以通过一个“金钱游戏”来窥探 AI 大脑内部,观察其隐藏的信任规则。

  • 一些 AI 在涉及信任时,表现得已经非常像人类了。
  • 这些 AI 根据我们所使用的同样两个标准来判断他人:他们善良吗?他们有能力吗?
  • 这有助于我们理解,AI 不仅仅是一个计算器;它拥有我们可以测量和研究的社交“偏见”和本能。

这篇论文并未宣称:
作者并未声称这种方法可以解决 AI 安全问题、治愈心理健康问题或用于招聘员工。他们只是在说:“这是一种衡量 AI 如何思考信任的方法,以及我们在此过程中发现了什么。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →