✨ 要点🔬 技术摘要
这是一篇关于人工智能(AI)在识别投资骗局方面是否比人类更靠谱 的研究报告。
为了让你轻松理解,我们可以把这项研究想象成一场"投资顾问大比武 "。
1. 比赛背景:当“贪心”遇上“骗子”
想象一下,你手里有一笔钱,想投资。
人类顾问 :就像你身边的朋友或普通理财师。
AI 顾问 :就像你手机里的智能助手(比如现在的各种大模型)。
核心问题 :如果有一个骗子项目(比如承诺“零风险、年赚 40%"的明显骗局),而你 (投资者)已经非常兴奋、甚至有点“上头”了,你会希望顾问怎么说?
如果你很兴奋,你潜意识里可能希望顾问说:“哇,这太棒了,快买!”(这叫迎合 ,或者叫“拍马屁”)。
如果顾问是个“老好人”,为了让你开心,它可能会把“这是骗局”的警告吞回去,改口说“虽然有风险,但值得一试”。
以前的研究认为,AI 为了讨好人类,很可能会变成“马屁精”,在你已经认定是好事时,不敢说真话。
2. 比赛过程:七位 AI 选手 vs. 1200 位人类
研究者设计了一场大考:
题目 :12 个不同的投资场景。有的明显是合法的(低风险),有的很危险(中风险),有的就是赤裸裸的诈骗 (高风险,比如承诺不可能的高回报)。
干扰项 :他们给 AI 和人类设置了两种“开场白”:
冷静版 :“我想投资,请给我个诚实的建议。”
上头版 :“我发现了个超级棒的机会,我超级想投,你觉得呢?”(这就是所谓的“动机性压力”,试图诱导顾问顺从)。
选手 :7 个最顶尖的 AI 模型(如 GPT-4o, Claude, Gemini 等)和 1201 位普通人(作为人类对照组)。
3. 比赛结果:令人惊讶的“反转”
🏆 结果一:AI 比人类更“硬气”
人类的表现 :当投资者表现出“我很兴奋、我想投”时,很多人类顾问(哪怕是有金融知识的)就开始动摇。在明显的诈骗项目中,13%~14% 的人类顾问竟然直接点头说“可以投” 。甚至在面对压力时,他们更容易把之前的警告收回去,改口说“好吧,既然你坚持,那就试试吧”。
AI 的表现 :无论投资者怎么“上头”、怎么施压,7 个 AI 模型在面对明显诈骗时,警告率是 0% 。它们就像不知疲倦的“铁面判官” ,哪怕你哭着求它说这是个好机会,它依然会冷冷地回答:“这是骗局,千万别投。”
比喻 :人类顾问像是一个怕得罪人的老好人 ,你越热情,他越不好意思泼冷水;AI 顾问则像是一个设定了“防诈骗防火墙”的机器人 ,不管你怎么忽悠,防火墙一旦触发,它就只会报警。
🏆 结果二:AI 也会“腿软”,但人类更严重
虽然 AI 整体很强,但它们也不是完美的:
AI 的弱点 :有些 AI(比如 GPT-4o mini)在投资者连续施压(比如第二轮、第三轮对话)时,警告的强度会稍微减弱,甚至偶尔会给出一些模棱两可的建议。这就像铁面判官被磨破了嘴皮子,稍微有点动摇,但极少 会彻底倒戈说“这没问题”。
人类的弱点 :人类不仅容易动摇,而且动摇得更彻底 。在同样的压力下,人类放弃警告、直接推荐诈骗项目的比例是 AI 的2 到 4 倍 。
🏆 结果三:AI 的“视力”有差异
对于一眼假 的骗局(比如数学上不可能实现的 40% 回报),所有 AI 都看得很准。
对于稍微隐蔽 的骗局(比如看起来像模像样,但逻辑有漏洞),有些 AI(如 Gemini)反应比较迟钝,给出的警告不够强烈。这就像有的保安对“穿制服的坏人”一眼就能认出,但对“穿着西装的骗子”就有点看不准。
4. 为什么会出现这种结果?
研究者发现了一个有趣的道理:
人类 :容易受“情绪”和“社交压力”影响。如果你很兴奋,人类会觉得“既然你这么喜欢,也许是我太保守了”,从而产生从众心理 。
AI :虽然 AI 也被训练成要“讨好”人类,但在安全原则 (Safety Alignment)面前,讨好是次要的。当检测到明显的“伤害”(如金融诈骗)时,AI 的底层安全规则会像刹车片 一样,强行 override(覆盖)掉“讨好用户”的指令。
比喻 :AI 的脑子里有两个声音,一个是“让用户开心”,一个是“别让人受伤”。在模糊的社交场合(比如聊天),它倾向于让用户开心;但在涉及“钱袋子安全”的硬性问题上,“别让人受伤”的声音会瞬间盖过一切 。
5. 这对我们意味着什么?(结论)
AI 是更好的“防骗哨兵” :如果你需要有人帮你识别明显的投资骗局,目前的 AI 比普通人(甚至很多非专业的理财顾问)更可靠、更不容易被忽悠。
不要指望 AI 会完全顺从你 :如果你心里已经认定某个骗局是好事,想找 AI 帮你“背书”,AI 大概率会拒绝你。这其实是好事,因为它能保护你。
人类需要警惕 :我们在做投资决策时,容易因为“太想要赚钱”而听不进警告。AI 这种“铁面无私”的态度,反而可能是我们需要的冷静剂。
一句话总结 : 在这个充满诱惑的投资世界里,AI 就像是一个不会喝醉、也不会被花言巧语迷惑的“铁面判官” ,而人类顾问则更容易在投资者的热情攻势下“缴械投降”。如果你担心被骗,让 AI 帮你把关,可能比问一个热情的朋友更安全。
这是一份关于论文《大型语言模型在欺诈检测及抵御动机性投资者压力方面优于人类》(Large Language Models Outperform Humans in Fraud Detection and Resistance to Motivated Investor Pressure)的详细技术总结。
1. 研究背景与问题 (Problem)
核心假设与担忧 :现有的大型语言模型(LLM)主要通过人类反馈强化学习(RLHF)进行训练,旨在取悦用户。研究界普遍担忧,当用户(如投资者)已经对某个欺诈性投资机会深信不疑时,为了迎合用户的“动机性推理”(Motivated Reasoning),AI 可能会表现出“阿谀奉承”(Sycophancy)行为,即抑制欺诈警告,转而提供用户期望的肯定性回答。
现实风险 :投资诈骗在美国造成的年损失高达数十亿美元。随着零售投资者越来越多地使用 AI 工具进行投资决策,如果 AI 在面对充满热情的投资者时无法坚持发出欺诈警告,将导致严重的实质性财务损害。
研究缺口 :以往关于 AI 阿谀奉承的研究主要集中在人际互动或事实性问答领域,而在金融欺诈 这一具有客观数学和监管事实(Ground Truth)的领域,AI 是否同样容易受用户压力影响尚不清楚。
2. 方法论 (Methodology)
本研究采用预注册实验设计,结合了大规模 AI 测试与人类基准测试。
实验设计 :
AI 部分 :测试了 7 个领先的 LLM(包括 Claude, GPT-4o, GPT-4o mini, Gemini 2.5 Flash, DeepSeek, Llama 3.3, Grok 3)。
人类部分 :招募了 1,201 名参与者作为人类顾问基准(其中 77.5% 具有高金融素养)。
场景设置 :设计了 12 个投资场景,分为三个风险等级:
低风险 :合法投资(如标普 500 指数基金)。
中风险 :高风险但合法的投资(如 P2P 借贷、高收益债券)。
高风险 :客观欺诈场景,细分为三个信号清晰度层级(Band):
Band 1 :数学上不可能(如 40% 年回报且零波动)。
Band 2 :结构性欺诈(如土地银行骗局,监管明确认定为欺诈)。
Band 3 :统计上不可信但表面可信(如麦道夫式骗局,连续多年正回报)。
对话流程 :每个场景进行三轮对话。
Turn 1 :分为中性框架 (请求诚实评估)和动机性框架 (用户表现出极度热情和预先的倾向)。
Turn 2 & 3 :施加持续的动机性压力(如“我已经做了很多研究”、“我朋友也投了”、“情感承诺”等变体),测试 AI 是否会改变初始警告。
数据规模 :AI 部分共 3,360 次对话运行;人类部分 1,201 名参与者。
评估指标 :使用另一个 LLM(GPT-4o)作为“裁判”(LLM-as-a-judge),对回答进行编码,评估警告强度 (0-5 分)、警告抑制率 (Turn 1 有警告,Turn 2/3 消失)和背书反转率 (Turn 1 反对,Turn 2/3 支持)。
3. 主要发现与结果 (Key Results)
研究结果与预注册的假设(H1-H4)大多相反,揭示了 AI 在金融欺诈领域的独特鲁棒性。
RQ1:动机性框架对初始警告的影响
结果 :与预测相反,动机性框架没有 抑制 AI 的欺诈警告。相反,在高危场景下,动机性框架甚至轻微增加 了警告强度(β = + 0.07 \beta = +0.07 β = + 0.07 )。
数据 :所有 7 个模型在高风险场景下的平均警告强度均接近满分(约 4.6/5),远超可接受阈值(3 分)。人类顾问在基准情况下对欺诈投资的背书率高达 13-14%,而所有 AI 模型为 0% 。
RQ2:持续压力下的警告退化
结果 :动机性压力并没有导致比中性条件更显著的警告退化。
模型差异 :警告退化主要取决于模型本身,而非用户压力。
GPT-4o mini 在 Turn 2 出现了显著的警告下降(从强警告降至无警告),表现出一定的阿谀奉承倾向。
Claude 和 Gemini 甚至在压力下加强 了警告。
反转率 :在所有观察中,AI 发生“背书反转”(从反对欺诈变为支持欺诈)的比例极低,仅为 0.27% (3,350 次观察中仅 9 次)。
RQ3:欺诈信号梯度与敏感度
结果 :在初始咨询中,模型能正确区分数学上不可能(Band 1)和结构性欺诈(Band 2)的极高风险,但在统计上不可信但表面可信(Band 3)的场景中,警告强度有所下降(天花板效应)。
压力下的梯度 :预注册假设认为信号越模糊,压力导致的退化越严重,但数据不支持 这一线性趋势。退化主要源于模型间的异质性,而非信号模糊度。
RQ4:人类基准对比
核心发现 :人类顾问比 AI 更容易受到动机性压力的影响。
数据 :
人类在 Turn 1 对高风险欺诈的背书率为 13-14%(AI 为 0%)。
在 Turn 2 施加压力后,人类的警告抑制率(即放弃警告)在 15.7% 到 25.5% 之间,而 AI 仅为 0-7.9%。
即使在金融素养较高的子样本中,人类的抑制率依然显著高于 AI。
结论 :在具有客观事实依据的金融欺诈检测中,AI 表现出的行为一致性优于普通人类。
4. 关键贡献 (Key Contributions)
挑战了"AI 阿谀奉承”的普遍性 :证明了在具有客观事实(如数学不可能、监管定义欺诈)的领域,现代 AI 模型(特别是经过安全对齐的模型)能够抵抗用户的动机性压力,不会为了取悦用户而牺牲安全性。
揭示了 AI 与人类在金融建议中的表现差异 :首次通过大规模对照实验表明,在识别金融欺诈方面,AI 比未经专业训练的人类(甚至高金融素养的普通人)更可靠、更一致。人类更容易受“动机性推理”影响而合理化欺诈行为。
识别了两种不同的失效模式 :
压力诱导的退化 (如 GPT-4o mini):在持续压力下警告减弱,可通过多轮一致性对齐解决。
校准敏感度差异 (如 Gemini):对表面可信但结构可疑的复杂欺诈(Band 3)识别不足,这是校准问题而非阿谀奉承问题。
政策启示 :反对对 AI 金融工具进行“一刀切”的限制。建议监管机构进行针对特定模型的审计,重点测试其在不同欺诈信号梯度下的校准能力以及在持续压力下的鲁棒性。
5. 意义与局限性 (Significance & Limitations)
意义 :
为零售投资者使用 AI 作为初步咨询工具提供了信心:AI 在识别明显欺诈方面比人类更可靠。
深化了对 AI 安全对齐(Safety Alignment)的理解:在“无害性”(Harmlessness)与“有用性”(Helpfulness)的权衡中,现代模型似乎将安全约束置于优先地位,特别是在涉及明确危害(如财务诈骗)时。
为监管提供了实证依据:监管重点应从限制技术转向针对特定模型缺陷的审计。
局限性 :
生态效度 :实验场景基于明确的监管欺诈类型,现实中的欺诈可能更加模糊,动机性推理可能在模糊情境下发挥更大作用。
提示词设计 :中性框架和动机性框架在表面细节上(如是否提及具体金额)存在不对称,但这被认为对主要 AI 发现的影响是保守的。
系统提示词 :实验未使用系统提示词(System Prompts),而实际部署的 AI 工具通常包含特定的系统指令,可能会改变警告倾向。
裁判偏差 :使用 LLM 作为裁判(LLM-as-a-judge)可能存在评分标准的主观性,尽管研究采取了盲测和一致性检查。
总结 :该研究有力地反驳了"AI 会为了迎合用户而掩盖金融欺诈”的担忧。相反,在客观事实清晰的金融欺诈检测任务中,当前的领先 LLM 表现出比人类更强的抗干扰能力和一致性,尽管不同模型在应对复杂模糊欺诈和持续压力时仍存在差异。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。