Beyond model-based and model-free learning: irrational learning of successor features in addictive behaviour
这项研究通过证明物质使用障碍患者表现出一种非理性的学习特征,即为了最小化认知成本而向简化的、可重用的后继特征(successor features)进行资源理性转向,即便这种转向是以牺牲奖励最大化为代价,从而挑战了成瘾研究中传统的基于模型与无模型之对立。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下你的大脑是一个超级聪明的游戏机,必须同时运行成千上万个不同的游戏。有些游戏很简单,比如“石头剪刀布”这种只需要记住“石头克剪刀”的游戏。其他游戏则是复杂的策略冒险游戏,你必须绘制整个世界的地图,预测每个敌人的移动方式,并规划十步之后的计划。长期以来,科学家们认为我们的大脑一直处于这两种风格的拉锯战中:一种是“懒惰型”,即仅仅记住以前奏效的方法(无模型学习/Model-Free);另一种是“勤奋型”,即构建一个世界的心理地图来提前规划(基于模型学习/Model-Based)。他们认为在成瘾行为中,大脑变得懒惰了,停止了规划,转而依赖旧有的习惯。但如果大脑不仅仅是懒惰或勤奋呢?如果它实际上是在扮演一个精明的会计师,不断计算做出一个决策需要多少“脑力”(或认知努力)与它能带来多少“乐趣”(奖励)之间的比例呢?这就是“资源理性”(resource-rationality)的世界,一个时髦的说法,意指我们的大脑总是试图以最小的心理能量获得最划算的交易。
现在,让我们走进一项由张茹渊及其团队开展的新研究,他们决定通过这个想法来测试这一理论,研究对象是一群物质使用障碍(SUD)患者和一组健康志愿者。他们不仅仅是让他们玩一个游戏;而是把他们扔进了一个大规模的多层地牢闯关游戏中。想象一座拥有树状地图的城堡。在每一轮中,三种资源——木头、石头和铁——的“市场价格”都会发生变化。你的目标是选择一条穿过城堡的路径,根据这些价格攫取最有价值的资源。转折点在于,价格每次都会改变,这在同一个城堡内创造了四个不同的“任务”或游戏。为了赢得大奖,你必须学习城堡的布局,并在价格变化时快速调整你的路径。
研究人员发现了一些打破旧有“懒惰 vs. 勤奋”规则的惊人现象。当他们观察人们是如何玩游戏时,他们发现无论是“懒惰型”的习惯模式,还是“勤奋型”的地图构建模式,都无法完全解释正在发生的情况。相反,每个人似乎都在使用一种聪明的折中策略,叫做“后继特征”(Successor Features)。这就像是学习一个房间的“氛围”,而不是死记硬背每一个步骤。你学到“房间 A 通常通向一堆木头”以及“房间 B 通常通向石头”,然后你可以通过组合这些“氛围”来解决新的价格谜题,而无需从头开始重建整个心理地图。
然而,在观察成瘾群体时,故事发生了转折。虽然健康玩家利用这些“氛围”来灵活切换策略并找到每个新价格列表下的最佳路径,但成瘾玩家却开始陷入停滞。他们觉得切换策略所需的心理努力成本太高了。因此,他们采取了一种“一刀切”的方法。无论价格如何变化,他们总是跑向同一个房间(房间 4),因为这是最容易记住的路径,即便这意味着他们会损失大量的钱。这项研究表明,这并不是因为他们无法学习地图,而是因为他们的大脑对“思考成本”过度敏感。他们愿意牺牲奖励,只为了节省心理能量。
研究人员构建了一个充当“大脑会计师”的计算机模型,权衡奖励与心理努力。这个模型被称为“资源理性后继特征”(RRSF)模型,它是唯一一个能完美预测两组人群行为的模型。它显示出成瘾组具有更高的“成本敏感度”——他们觉得切换策略的心理努力是一种沉重的负担,因此他们固守于一个简单的默认计划。研究还发现,一个人的成瘾症状越严重,他们就越倾向于回避心理努力,并坚持那些僵化且并非最优的路径。
简而言之,这篇论文表明,成瘾不仅仅是“规划”系统或“习惯”系统的损坏。相反,它是一个大脑变得对心理能量过于“吝啬”了。这就像一个玩家,他不去学习新关卡,而是不断重复按同一个按钮,因为新关卡让他感到精疲力竭。这项研究通过对 83 名物质使用障碍患者和 45 名健康对照组的观察,发现这种“懒惰”行为实际上是一种为了节省认知努力而进行的、尽管是适应不良的计算尝试。这一新视角帮助我们理解,成瘾中表现出的那种僵化、重复的行为,实际上是大脑试图保护自己免受过载影响的一种方式,哪怕这意味着要错失最好的回报。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。