← 最新论文
📊 statistics

The Behavioural Reflection Test: A time-efficient measure of reflective reasoning in morally and epistemically charged decisions

本文介绍了行为反射测试(BRT)和定制化认知反射测试(bCRT),它们作为高效、低暴露的测量手段,成功预测了在线成年人的证据敏感型、伦理驱动型决策以及特定的语言模式,其表现优于传统的经熟悉度调整后的 CRT 指标。

原作者: Sion Weatherhead, Flora Salim, Aaron Belbasis, Ben R. Newell

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Sion Weatherhead, Flora Salim, Aaron Belbasis, Ben R. Newell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的大脑有两种模式。一种是“快车道”:一个快速、自动的自动驾驶模式,它会抓取跳进你脑海里的第一个答案。另一种是“慢车道”:一个反思模式,在这里你会踩下刹车,查看地图,并进行周密的思考。多年来,科学家们一直使用一个著名的益智游戏——认知反射测试(CRT),来观察谁在使用“慢车道”。但问题在于,旧的谜题已经变得如此出名,以至于大家都知道了那些“陷阱”答案。这就像在玩一款视频游戏,而每个人都已经背下了作弊码;得分高仅仅意味着你以前见过这个关卡,而不是说明你现在正在进行深度思考。

这篇论文引入了一套全新的工具来解决这个问题:**行为反射测试(BRT)**以及一个更短的谜题——定制化 CRT(bCRT)

新谜题:新鲜血液

首先,作者构建了一个新的四题益智游戏(bCRT),大多数人还没有见过它。他们在网上对 473 名成年人进行了测试。结果显示,这个新谜题是一个更好的“作弊码检测器”。虽然旧的谜题被 40–74% 的人熟知,但新的谜题仅有 5–32% 的人熟悉。

当他们观察谁在新谜题中得分较高时,发现了一些有趣的现象:这些人不仅聪明,而且具有反思性。他们与“认知需求”(热爱思考)和“尽责性”(有组织且谨慎)等特质相关联。论文指出,这个新谜题测量的是一种真正的、能够抑制直觉冲动的倾向,而非仅仅测试你对旧谜题的记忆力。

现实世界测试:餐厅与医生

为了观察这种“反思型”大脑是否真的会改变人们在现实生活中的行为,研究人员创建了行为反射测试(BRT)。参与者不再是解决数学谜题,而是在两个混乱的现实场景中做出决策:

  1. 餐厅困境: 你预订了一个不可退款的生日晚餐。一位朋友给你发了一些来自社交媒体的恐怖、低质量评论,说食物很糟糕,这与专业评论家的意见相悖。你会取消吗?
  2. 药物困境: 你的医生开了一种标准药物。一位流行的社交媒体网红基于一些可怕的故事警告说这种药很危险。你会服用它吗?

研究发现,那些在新 bCRT 谜题中得分较高的人做出了更好、更基于证据的选择

  • 在餐厅场景中: 他们更有可能保留预订,信任专业评论家而非嘈杂的社交媒体传闻。他们使用的语言也表现出他们关心公平和忠诚,并且更愿意指责那位不讲理的朋友是自私的。
  • 在药物场景中: 他们更有可能遵循医生的建议;或者,如果他们犹豫了,他们会计划去寻找高质量的证据(如同行评审的研究),而不是仅仅在社交媒体上刷更多的网红帖子。

语言线索:他们的表达方式

研究人员还分析了这些人解释其选择时所使用的词汇。他们发现,具有更高反思性的人不仅思考方式不同,他们的说话方式也不同。

  • 他们使用了更多与风险相关的词汇(如“危险”或“隐患”),表明他们关注潜在的负面影响。
  • 他们使用了更多的负面情绪词汇(如“沮丧”或“恼火”)。作者认为这并不是因为他们在生气,而是因为他们对这种不公平的情况产生了情感上的投入。
  • 他们使用了更少的“填充”词(如“是”、“有”或“将”等助动词)。这表明他们的思维更加直接且高效,去除了冗余。

本论文排除了什么

需要注意的是,这项研究明确指出这不是答案。

  • 这不仅仅关乎聪明才智: 论文认为,旧的谜题往往只是测量了数学能力或对陷阱的记忆,而非真正的反思能力。
  • 这并不关乎使用“道德”词汇: 作者明确发现,虽然具有反思性的人做出了更公平的决定,但他们并不一定使用了更多的“道德”词典词汇(如“对”或“错”)。他们的道德感体现在他们的行动推理结构中,而非仅仅通过华丽的词汇。
  • 它不是解决一切问题的万能灵药: 论文指出,在药物场景中,谜题得分与最终决策之间的联系略显模糊。这表明在某些复杂情况下,具备反思性并不总是会导致一个单一的“正确”选择,因为接受医生建议和延迟检查事实都是合理的。

结论的可信度如何?

作者对他们的主要发现是审慎且具有统计学信心的。他们在 473 人身上运行了数据,并发现新的谜题(bCRT)能一致地预测这些更好的决策和语言模式。他们甚至使用严格的统计校正(Benjamini–Hochberg)来确保结果并非偶然,而结果在五个关键指标中有四个都得到了验证。

然而,他们对某些细节持谨慎态度。例如,他们发现具有反思性的人使用了更多“负面情绪”词汇,但他们承认无法 100% 确定这是否意味着这些人真的感到难过,还是仅仅在用这些词来尖锐地描述情况。他们认为这是一个值得进一步研究的线索,而非最终定论。

核心总结

把旧的 CRT 谜题想象成一张大家都背熟了的陈旧地图。BRTbCRT 则像是全新的、未被开发的领域。这项研究表明,当你给人们全新的、棘手的处境时,那些真正懂得“反思”的人,是那些能够忽略嘈杂人群、信任专家、检查风险并用清晰直接的声音说话的人。他们不仅是在解谜,更是在用一种更细致的方式,应对现实世界中混乱且嘈杂的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →