Reinforcement Learning and Consumption-Savings Behavior
本文提出了一种带有神经网络近似的强化学习模型,用以解释适应性学习机制(而非标准的理性预期)是如何同时产生低资产失业家庭的高边际消费倾向,以及在有过去失业经历的个体中观察到的持续性消费“疤痕”现象。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大脑的 GPS 与消费之谜
想象一下,你的大脑就像一个超级智能的 GPS,在混乱的日常生活地形中导航。通常,我们假设人们做财务决策时像完美的数学家一样:他们确切知道明年会赚多少钱,他们计算出今天消费与明天储蓄之间的完美平衡,并且从不出错。这就是“理性预期”观点,也是几十年来经济学家使用的标准地图。但现实生活要复杂得多。我们没有水晶球;我们只有过去的经验。
由此引入强化学习(Reinment Learning)。不要把它想象成一个求解方程的超级计算机,而要把它想象成一个通过试错来学习的游戏玩家。在游戏中,你事先并不知道关卡的规则。你尝试一个动作,获得奖励(或“游戏结束”),然后你的大脑会更新其内部的“什么有效”的地图,以便下次使用。如果你得了高分,你会记住那条路径;如果你输了,你会避开它。这篇论文提出了一个迷人的问题:如果我们的消费习惯不是由完美的数学家计算出来的,而是由这种同样的“尝试、失败、学习”的过程所塑造的呢?它表明,我们的脑海中不断更新着关于“应该”存多少钱的心理模型,这个模型是基于我们过去所遭遇的意外情况,而非对未来的完美预测。
谜题:为什么有些人缺钱时反而花得更多?
经济学家一直在为人们在艰难时期消费行为中的两个奇怪模式感到困惑。
第一个谜团: 在疫情期间,政府发放了纾困金。研究人员发现,那些过去银行账户里几乎没钱的失业者,会将收到的每额外 1 美元中的约 0.53 花掉。但那些过去拥有大量资金的失业者,仅会花掉每额外 1 美元中的 0.29。这很奇怪,因为在收到这笔钱的那一刻,这两组人都并不真正“穷困”,也并非无法借贷。标准经济理论认为,如果你有足够的现金,你不应该对突如其来的意外之财表现得如此渴望消费。为什么一个人过去的匮乏会影响他现在的消费,即便他目前状况良好?
第二个谜团: 另一项研究发现,过去经历过失业的人在随后的几年里往往会存更多钱、花更少钱,即使他们目前已经就业且生活无虞。这被称为“伤痕效应(scarring)”。这就像是一个来自过去的幽灵,阻碍你享受当前的薪水。
核心问题是:能否用一个单一的解释来解决这两个谜团?通常,经济学家必须二选一。“也许他们只是对未来感到恐惧,”或者“也许他们只是不擅长数学。”但本文提出了一个不同的罪魁祸首:强化学习。
实验:教导数字智能体学习
作者布兰登·卡普洛维茨(Brandon Kaplowitz)构建了一个计算机模拟来测试这个想法。他没有给他的数字智能体一张完美的未来地图,而是给了它们一个“神经网络”——一个通过经验学习的简化版大脑。
以下是模拟的工作原理:
- 设定: 智能体从一个关于如何储蓄和消费的粗略猜测开始,类似于完美的数学家所做的那样。
- 游戏: 它们经历 50 个季度(约 12.5 年)的模拟生活。它们获得工作、失去工作并领取薪水。
- 学习: 当智能体遇到意外——比如突然失业时——它们会感受到一种“时序差错(temporal difference error)”。用游戏术语来说,这就像是你预期会得到一枚金币,结果却得到了一块石头。大脑意识到:“哇,我的地图错了!”
- 更新: 智能体的神经网络会微调其内部权重以修正这个错误。它不仅仅是改变一个数字;它是在重塑其对未来储蓄价值的整个理解。
大揭秘: “伤痕”如何改变地图
模拟产生的结果几乎与现实世界的谜题如出一辙。以下是神奇的机制:
当智能体经历失业时,它们的大脑会感受到一种“负面惊喜”。为了修复这一点,神经网络会更新其未来的心理地图。这种更新同时做了两件事:
- 它让地图变得更陡峭: 智能体意识到储蓄比它们之前认为的更加重要。这导致它们的整体消费减少(即“伤痕效应”)。
- 它让地图变得更弯曲: 智能体意识到,随着财富增加,储蓄的价值会迅速下降。这使得它们在获得任何新钱时都表现得极其渴望消费,因为它们感觉到拥有低存款带来的“痛苦”比以前更加剧烈。
结果:
- 伤痕效应: 具有失业史的智能体最终的平均消费较低,正如现实世界的数据所示。
- 高消费狂欢: 当这些相同的智能体获得纾困金时,它们会花掉其中的 0.50(非常接近现实中的 0.53),而只有稳定工作史的智能体仅会花掉其中的 0.34(接近现实中的 0.29)。
这意味着什么(以及并不意味着什么)
本文表明,我们不需要假设人们是“非理性的”或具有“奇怪的心理”来解释这些行为。相反,我们的大脑只是在做它最擅长的事:从过去的意外中学习。
- 这不是关于悲观主义: 作者测试了一个智能体仅仅变得“悲观”(认为失业可能性更高)的版本。该模型失败了。它让人们消费减少,但也让人们在面对意外之财时消费得更少,这与现实生活中的情况相反。强化学习模型是唯一一个既能解释“整体消费减少”又能解释“意外之财消费增加”的模型。
- 这是一个模拟,而非水晶球: 作者谨慎地指出,这些是来自计算机模拟的结果。虽然数字与现实研究相匹配(模拟中的 0.50 对比 0.34,现实中的 0.53 对比 0.29),但这只是一个解释其可能是如何运作的模型,而不是关于人类大脑如何运作的最终证明。
- “黑箱”局限性: 由于智能体通过神经网络进行学习,我们无法轻易询问它们:“你认为被解雇的概率是多少?”该模型通过调整数值来运作,而不是通过计算特定的概率。这既是优势(它很灵活),也是劣势(我们无法看到智能体大脑内部精确的“信念”)。
简而言之,这篇论文为我们看待钱包的方式提供了一种有趣且强大的新视角。它表明,我们的消费习惯是一本活生生的历史书,由我们所遭遇的意外情况书写而成。当我们因失业而感到恐惧时,我们的大脑不仅仅是感到难过;它正在重写游戏的规则,让我们为未雨绸求,同时也让我们在获得意外之财时更快地消费,以防风暴再次袭来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。