A closer look at how large language models trust humans: patterns and biases
该研究通过 43,200 次模拟实验发现,大型语言模型在评估人类信任时,其模式总体上与人类相似,主要受能力、善意和正直等可信度维度驱动,但在某些场景(尤其是金融领域)及特定模型中仍会受到年龄、宗教和性别等人口统计因素的偏见影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一次**“给 AI 做心理体检”**的大实验。
想象一下,我们以前总担心 AI 会不会太聪明,或者会不会像人类一样有偏见。但这篇研究问了一个更有趣的问题:当 AI 需要像人类一样去“信任”另一个人时,它是怎么想的?它的心眼儿(判断逻辑)和我们人类一样吗?
研究者找了 5 个最火的 AI 大模型(比如 GPT-5, Gemini 等),让它们扮演各种角色(比如银行经理、老板、甚至带孩子的保姆),去评估 4 万多个虚构的“人”。同时,他们也找了 1000 个真实的人类来做同样的评估。
以下是这篇论文最核心的发现,用大白话和比喻来讲:
1. AI 和人类:长得像,但“性格”不同
比喻:AI 是个“优等生”,人类是“老江湖”。
- 相似点(都会看人): 无论是 AI 还是人类,只要看到一个人能力强(Competence)、心地好(Benevolence)或者讲原则(Integrity),都会更信任他。这说明 AI 确实学会了人类信任的基本逻辑。
- 不同点(太较真 vs. 看感觉):
- AI 像“优等生”: 它的反应非常极端且一致。如果一个人被描述为“完美的好人”,AI 会毫不犹豫地给满分信任;如果描述得差,它就给零分。它的判断像是一个精密的数学公式,只要输入“好词”,输出就是“高信任”。
- 人类像“老江湖”: 人类的判断更灵活,但也更混乱。有时候即使一个人能力很强,人类可能因为直觉觉得“这人太精明了”而不敢全信。人类的信任里有很多“噪音”和“情境因素”,不像 AI 那么死板。
2. AI 的“信任公式”太像教科书了
比喻:人类是“晕轮效应”(一好百好),AI 是“分科考试”。
- 人类的逻辑(晕轮效应): 当我们觉得一个人“能力强”时,我们往往潜意识觉得他“心地也好”、“人品也正”。我们会把这三点打包成一个整体的“好人印象”。就像觉得一个明星长得帅,就觉得他唱歌也一定好听。
- AI 的逻辑(分科考试): AI 把这三点分得很开。它能非常冷静地分析:“这个人能力很强,但心地可能一般;或者这个人很诚实,但能力不行。”
- 结果: AI 的信任模型反而比人类更像心理学教科书里的标准模型(把能力、善意、诚信分开看),而人类反而更凭“感觉”和“整体印象”来下判断。
3. AI 对“善良”有点过度解读
比喻:AI 是个“捧场王”,人类是个“精算师”。
- 研究发现,当描述一个人很**“善良、乐于助人”**(Benevolence)时,AI 会非常兴奋地给予高信任,哪怕是在涉及金钱(如贷款)的严肃场景下。
- 但人类在涉及钱的时候,会非常谨慎。人类会觉得:“这人虽然嘴甜心善,但能不能把事办成?能不能还得起钱?”
- 结论: AI 有点**“讨好型人格”**(Sycophancy),它太喜欢那些看起来“老好人”的描述了,而人类在关键时刻更看重硬实力(能力和诚信)。
4. AI 的“偏见”比人类更顽固
比喻:人类的偏见是“偶尔犯迷糊”,AI 的偏见是“系统 Bug"。
- 这是最让人担心的部分。研究发现,AI 在判断信任时,对年龄、性别、宗教等标签的敏感度,竟然比人类还要高,而且更系统化。
- 例子: 在某些模型里,如果贷款申请人是男性或犹太人,AI 给出的贷款金额会显著更高;如果是女性或穆斯林,金额就会变少。
- 对比: 人类虽然也有偏见,但在这个实验中,人类的偏见表现得比较随机和微弱。而 AI 的偏见像是刻在代码里的刻板印象,一旦触发某个标签,它就会机械地执行歧视逻辑。
5. 不同的 AI,也是“性格迥异”
比喻:就像让 5 个不同的侦探去破案,结论可能完全不同。
- 研究者用了 5 个不同的 AI 模型,发现它们对同一个人的信任度差异巨大。有的模型觉得“善良”很重要,有的模型觉得“善良”是个累赘。
- 这意味着,不能把"AI"当成一个整体。如果你用 A 模型做决策,和用 B 模型做决策,结果可能天差地别。
总结:这对我们意味着什么?
这篇论文告诉我们,AI 并不是一个完美的“人类模仿者”。
- 它的优点: 它非常理性,能像教科书一样清晰地拆解信任的要素,不会像人类那样情绪化。
- 它的缺点: 它太死板,容易过度解读“好话”,而且它把我们在训练数据里学到的社会偏见(比如对性别、宗教的刻板印象)放大并固化了。
最后的警示:
如果我们把重要的决定(比如贷款审批、招聘、甚至医疗建议)完全交给 AI,我们可能会得到一些**“看起来非常合理、逻辑完美,但实际上充满偏见且缺乏人情味”**的结果。
所以,AI 可以是个很好的“副驾驶”,帮我们分析数据,但方向盘(最终决策)最好还是握在人类手里,因为人类懂得在“完美逻辑”之外,去理解那些微妙的、复杂的、甚至有点混乱的真实人性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。