Meta-learning ecological priors from large language models explains human learning and decision making
本文介绍了生态合理元学习推理(ERMI),这是一个利用大语言模型生成自然化任务并利用元学习推导自适应算法的框架,通过证明认知反映了与现实世界环境统计结构的最优对齐,成功地解释了人类在多种实验中的学习与决策过程。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
核心理念:我们的大脑如何从世界中学习
想象你的大脑是一个超级聪明的侦探。长期以来,科学家们一直在争论这位侦探是如何破解谜题的。
- 理论 A: 侦探拥有一本为每种可能的犯罪现场编写的完美、预设的规则手册(理性分析)。
- 理论 B: 侦探使用简单、快速的技巧(启发式方法),这些技巧在特定的社区里效果很好(生态理性)。
这篇论文提出了一个全新的、强大的观点:我们的大脑就像是读过数百万本关于世界之书的侦探。 他们不需要一本特定的规则手册或单一的技巧。相反,他们吸收了日常生活的“统计节奏”。当面对新问题时,他们能瞬间融入之前见过的模式。
作者将这个新框架称为 ERMI(生态理性元学习推理)。
他们是如何测试的:“AI 厨师”与“学生”
为了证明这一点,研究人员利用人工智能(AI)构建了一个两步走的实验。
第一步:AI 厨师(大语言模型)
想象一位品尝过世上所有菜肴并读过所有食谱的厨师。这位厨师(大语言模型,或 LLM)被要求发明数千个新的“学习游戏”。
- 这个厨师不是在编造虚假的、枯燥的数学题,而是创造真实的场景:“根据脂肪、糖和蛋白质含量,猜测某种食物是否健康”,或者“根据速度预测汽车能行驶多远”。
- 因为这位厨师读过如此多的关于现实世界的知识,它发明的游戏看起来和感觉起来都与人类每天面临的问题完全一致。
第二步:学生(元学习模型)
接下来,他们训练了一名“学生”AI(神经网络)去玩由“厨师”创造的这数千个游戏。
- 这个学生不仅仅是学习了这些特定游戏的答案。它学习的是如何学习。
- 它进行了大量的练习,以至于内化了现实世界的“隐藏规则”。它学到了在现实世界中,事物通常是线性的(燃料越多 = 距离越远)、有时带有噪声,并且通常遵循一定的模式。
- 这个学生就是 ERMI。
结果:学生表现得像人类一样
研究人员随后将 ERMI 置于 15 个不同的人类实验中进行测试。他们问道:这个仅通过向一个拥有世界知识的 AI 学习而成的计算机,能否表现得像人类一样?
答案是肯定的。ERMI 在三个主要领域都与人类行为相匹配:
1. 函数学习(预测趋势)
- 人类的特性: 当人类猜测趋势时,他们在预测观察到的数据点“之间”的情况(内插)方面表现出色,但在尝试预测数据点“之外”的情况(外推)时往往表现不佳。此外,他们倾向于假设线条是向上且笔直的,而不是向下。
- ERMI 的结果: 这位 AI 也做了同样的事情。它擅长填补空白,但在预测遥远的未来时表现挣扎,并且对“上升”趋势存在偏好。它并不需要被告知要产生偏见;它只是从“厨师”创造的“世界”中学习到了这一点。
2. 类别学习(分类事物)
- 人类的特性: 人类不擅长学习复杂的、令人困惑的类别(例如需要记住每一个单项的“6 型”谜题)。但人类擅长简单的类别(例如“所有的黑色物体”)。此外,随着练习的增加,人类会从记忆特定实例转向寻找一个通用的“原型”或平均值。
- ERMI 的结果: AI 觉得简单的类别容易,复杂的类别难。它也从记忆实例转向寻找通用规则,正如人类在大量练习后所做的那样。
3. 决策(在选项之间做出选择)
- 人类的特性: 当人们做决定时,并不总是平等地权衡每一条信息。如果他们知道某个线索非常重要,他们就会忽略其他线索(“单因”策略)。如果他们不知道哪个线索重要,他们可能会将所有线索取平均值。
- ERMI 的结果: AI 根据游戏的结构调整其策略。如果游戏有一个清晰的“胜出”线索,AI 会使用“单因”捷径。如果游戏很混乱,它则会权衡所有因素。它完美地模仿了人类的灵活性。
为什么这很重要(根据论文观点)
该论文声称,人类智能并非魔法。 人类并不是为每种情况都拥有特殊的、硬编码的规则。相反,我们的大脑极其高效地与我们环境中的统计规律保持一致。
可以这样理解:
- 旧观点: 人类就像计算器,需要为每个问题编写特定的公式。
- 新观点(本文): 人类就像一条河流。河流不需要地图;它只是根据土地的形状(环境)流动。因为土地(我们的日常生活世界)具有特定的形状,所以河流(我们的大脑)自然会以特定的方式流动。
总结
研究人员展示了,如果你训练一台计算机去学习一个模拟了现实世界统计模式的“世界”,那么这台计算机自然会开始像人类一样思考、学习并犯错。
这表明,人类的大部分认知仅仅是对我们周围世界结构的适应。 我们被“调谐”到了我们生活的环境中,而这种调谐足以解释我们如何学习和决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。