← 最新论文
🧬 biology

Entrenchment in Human Exploration: A Future-Path Model of Early Convergence

本文引入了一个关于人类探索中“固着”(entrenchment)的认知模型,证明了人们通过模拟自身的未来选择,会过早地停留在次优选项上,这一机制独特地解释了为何随着时界延长非贪婪行为会增加,并使其区别于 UCB 或汤普森采样等标准探索策略。

原作者: Shinji Nakazato

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Shinji Nakazato

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

人类不断面临着一个根本性的选择:我们是应该坚持已知行之有效的方法,还是应该尝试新事物以观察其是否更好?这一困境被科学家称为“探索与利用的权衡”(exploration-exploitation tradeoff),它是学习的引擎。当我们进行探索时,我们在收集关于世界的信息;当我们进行利用时,我们在使用这些信息来获取最佳回报。理想情况下,我们会平衡这两种驱动力,通过充分采样来找到最佳选项,然后定居其中享受它。然而,在许多情况下,人们似乎过早地停止了搜索。他们锁定了一个并非真正最优的选择并持续做出该选择,即使更好的选项仍然存在。这种研究人员称之为“固着”(entrenchment)的顽固持久性表明,我们的大脑可能正在以一种让我们陷入次优习惯的方式来模拟未来。

中里真司(Shinji Nakazato)在东京科学大学开展的一项新研究为这一现象提供了一个全新的解释。该研究提出,当我们评估当前的决策时,我们不仅仅是在看眼前的回报。相反,我们在进行一种关于自身未来决策的心理模拟,想象我们下一步会做什么。至关重要的是,研究表明,我们在进行这种模拟时,会保持当前的信念不变,仿佛我们未来永远不会学习或更新自己的观点一样。这种心理捷径创造了一种关于我们未来路径的特定类型的确定性。该模型显示,当时间跨度很长——意味着我们还有许多决策要做时——这种模拟的不确定性会变得足够大,以至于使我们放弃已知的最佳选项,转而向更差的选项漂移。这些发现挑战了人类总是试图实现回报最大化的观点,表明我们自身的未来模拟可能会误导我们。

为了测试这个想法,研究人员分析了两类涉及重复选择游戏的实验数据。在其中一组被称为威尔逊任务(Wilson task)的实验中,参与者面临一个简单的二选一游戏。研究人员仔细控制了游戏,使得参与者在决策开始时的关于选项的知识是完全相同的,但他们需要进行的未来轮数却各不相同。在某些情况下,参与者知道自己只剩下一轮;在另一些情况下,他们知道自己还剩六轮。如果人们仅仅是在寻找最佳选项,他们的行为在两种情况下应该是相同的,因为他们的知识是一样的。然而,数据表现出了明显的差异:当参与者知道剩余轮数较多时,他们更有可能选择那个并非最佳的选项。这一结果非常显著,以至于无法用标准的学习理论或“人们只是变得更加谨慎或好奇”的想法来解释。唯一能够重现这种特定模式的模型,就是基于“未来路径”模拟的模型,即决策者在不预期自己会学到任何新知识的情况下,想象自己未来的选择。

该研究进一步区分了这种行为与其他形式的探索。有时,人们会故意选择一个较差的选项以收集更多关于最佳可能选择的信息;这被称为定向探索(directed exploration)。为了观察这些固执的选择是一种聪明的探索还是仅仅是陷入了困境,研究人员观察了第二个更复杂的、在包含许多位置的网格上进行的实验。在这个游戏中,真正的最佳位置对研究人员是已知的。分析显示,在长跨度情境下,当人们做出非最优选择时,他们压倒性地是向着真正更差的位置移动,而不是向着最佳位置移动。他们并不是在通过探索来寻找最优解;他们是在远离最优解。这证实了这种行为确实是“固着”,即一个自我强化的循环,一个人因为心理模拟让当前的决策看起来比实际情况更有吸引力,从而陷入了一个次优的选择中。

研究还考察了选择集的大小如何影响这种行为。在网格游戏中,参与者必须在30个或121个不同的位置之间做出选择。模型预测,拥有更多选项会增加未来心理模拟中的不确定性,从而使人们更容易陷入糟糕的选择。数据支持了这一点:随着可用选项数量的增加,人们固守非最优选择的比例也随之上升。此外,研究发现,当最佳选项与第二佳选项之间的价值差距非常明显时,人们不太容易陷入困境。但当差距较小,或者感觉未来很遥远时,坚持平庸选择的倾向就会增强。

这些发现描绘了一幅人类决策图景,它与其说是关于冷酷的计算,不如说是关于想象力的局限性。研究表明,我们的大脑并不总是向前看以优化未来;有时,它们向前看,看到的却是一片可能性的迷雾,这使得当前熟悉路径看起来更安全,即便这条路通向虚无。通过将我们未来的自己模拟为永远不会改变主意的人,我们无意中创造了一个学习的障碍。这项研究并不认为这是人类智能的缺陷,而是将其视为处理时间和不确定性的一种结构性特征。它表明,我们用来规划生活的机制——想象我们接下来要做什么——有时正是阻碍我们找到前进最佳路径的原因。这些结果在数千次试验中都是稳健的,并且即使在研究人员排除了其他解释(如简单的错误或对多样性的普遍偏好)后依然成立。

最终,这篇论文提供了一个捕捉这种特定“陷入困境”现象的数学框架。它表明,做出非最优选择的概率随着剩余时间的增长和选项数量的增加而增加。这与传统学习理论所预测的相反,传统理论认为拥有更多时间应该有助于人们找到最佳解决方案。研究证实,对于人类学习者而言,拥有更多时间实际上可能使我们更容易满足于较低的标准。研究留下的问题是,大脑究竟是如何计算这种未来不确定性的,但它明确确立了这样一个事实:我们想象未来选择的方式是驱动当前行为的强大力量,足以将我们锁入并不符合我们最佳利益的模式之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →