← 最新论文
💬 NLP

Human Adults and LLMs as Scientists: Who Benefits from Active Exploration?

本文表明,通过主动探索赋予成年人主体性,能显著提高他们识别合取因果规则的能力,优于被动观察;同时研究也揭示,尽管大语言模型在推理准确度上可以媲美人类,但它们通常采用效率较低的探索策略,并在合取与析取推理之间表现出类似的性能差距。

原作者: Mandana Samiei, Eunice Yiu, Anthony GX-Chen, Dongyan Lin, Jocelyn Shen, Blake A. Richards, Alison Gopnik, Doina Precup

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Mandana Samiei, Eunice Yiu, Anthony GX-Chen, Dongyan Lin, Jocelyn Shen, Blake A. Richards, Alison Gopnik, Doina Precup

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的通俗易懂版解释,使用了日常类比。

核心问题:成年人的“团队协作”逻辑不行吗?

想象一下,你正在试图弄清楚一台神秘机器的工作原理。你有四把不同的钥匙(我们称之为“Nexioms”)。你需要找出哪些钥匙能让机器启动,以及它们是如何协同工作的。

机器有两种可能的运作方式:

  1. “或”规则(析取逻辑): 只要放入其中任何一把正确的钥匙,机器就会启动。(就像电灯开关:拨动其中一个,灯就亮了)。
  2. “且”规则(合取逻辑): 只有当你同时放入所有正确的钥匙时,机器才会启动。(就像保险箱:你需要密码、指纹和钥匙同时到位)。

旧有的发现:
科学家过去认为成年人在理解“且”规则方面表现很差。当人们只是观察别人测试钥匙时,即使证据表明是“且”规则,成年人通常也会猜测是“或”规则。这就像是成年人在“团队协作”逻辑上存在某种思维盲点。

新的问题:
本文的作者提出了疑问:这是因为成年人真的逻辑不行,还是因为他们只是在被动地观察?

他们想知道,如果成年人能像科学家一样——亲自动手拿取钥匙、进行测试,并立即看到结果,他们的表现是否会更好。


实验: “Nexiom 检测器”

研究人员构建了一个名为“Nexiom 检测器”的数字游戏。

  • 主动组: 这些参与者可以通过点击来添加或移除钥匙,并按下“测试”键来查看机器是否启动。他们掌控着实验过程。
  • 被动组: 这些参与者只是观看“主动组”的屏幕。他们看到了相同的实验结果,但无法动手操作。
  • “规划者”组: 第三组参与者可以计划要测试哪些钥匙,但他们看不到自己计划的结果。相反,他们观察的是别人测试的结果。

研究人员还测试了几个大语言模型(LLMs)(即 AI 聊天机器人),以观察它们解决这个谜题的能力是否能与人类媲美。


研究发现

1. 给成年人一个“遥控器”改变了一切

当成年人被允许亲自主动测试钥匙时,他们的表现大幅提升。

  • 结果: 他们非常擅长破解复杂的“且”规则。他们能够成功识别出需要哪些钥匙,以及必须同时具备所有这些钥匙。
  • 启示: 成年人并不缺乏“且”逻辑。他们之所以表现不佳,仅仅是因为无法设计自己的测试方案。当他们像科学家一样行动时,他们在破解复杂规则方面的表现与儿童一样聪明。

2. “规划者” vs. “执行者”

这里有一个至关重要的发现:仅仅思考要测试什么是不够的。

  • “规划者”组(虽然思考了测试方案,但只能观察他人的结果)表现很差。他们的表现几乎和“被动组”一样糟糕。
  • 类比: 想象你是一名厨师。如果你只写下食谱(规划),但由别人来烹饪,而你只是看着别人吃东西,你并不会学会做菜。你需要品尝你自己做出的食物,才能知道盐放得是否合适。
  • 教训: 主动学习的最佳效果在于你的行动结果之间有紧密的联系。你需要看到自己的选择所带来的直接后果。

3. “且”规则仍然更难(但并非不可完成)

即使拥有主动控制权,“且”规则所需的测试次数和时间也比“或”规则更多。

  • 类比: 找到一把能开门的钥匙很容易(尝试一次可能就成功了);但要找到能打开保险箱的精确组合(三把特定的钥匙),则需要更多的试错过程。
  • 然而,成年人并没有放弃。他们只是通过运行更多的测试来确保准确。他们并没有卡壳,只是需要付出更多的努力。

4. AI(LLMs)表现如何?

研究人员将人类与先进的 AI 模型进行了对决。

  • “或”规则: AI 表现出色。一些模型表现得与顶尖的人类科学家一样好。
  • “且”规则: AI 在这里比人类表现得更吃力。虽然一些聪明的模型表现接近,但许多模型效率较低。它们经常进行不必要的测试,或者在“且”逻辑面前感到困惑。
  • 启示: AI 可以成为处理简单规则的优秀科学家,但在处理复杂“团队协作”规则所需的战略性、循序渐进的侦探工作方面,人类仍然更胜一筹。

总结:这意味着什么?

这篇论文告诉我们,成年人在面对复杂逻辑时并不是“坏掉了”。问题不在于大脑,而在于情境

  • 被动观察: 就像坐在观众席上看魔术表演。你看到了戏法,但因为无法触碰道具,所以无法理解其原理。
  • 主动探索: 就像成为魔术师的助手。你可以拿起道具,尝试戏法,并观察当你拉动错误的杠杆时会发生什么。

主要结论:
当我们让成年人像科学家一样行动时——给予他们测试自己想法并立即看到结果的自由——他们能够非常出色地破解复杂的“且”规则。我们曾以为他们存在的“缺陷”,实际上只是缺乏自主权。

然而,即便拥有这种自由,破解复杂规则也比破解简单规则需要更多的努力;虽然 AI 正在变得越来越好,但在高效、有策略地进行探索方面,人类仍具有微弱的优势。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →