Evaluating Machine Learning and Econometric Models for Inflation Forecasting: Evidence from a Sub-Saharan African Panel
本研究评估了针对八个撒哈拉以南非洲经济体的通胀预测所采用的各种机器学习和计量经济模型,并发现由于结构性断裂和高波动性,没有任何复杂模型在统计上优于简单的朴素持久性基准模型,这表明该地区的政策制定者应将简单模型作为活跃的基准。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
伟大的预测竞赛:为什么最简单的猜测往往能胜出
想象一下,你正在尝试预测下周二的天气。你可以动用超级计算机,分析卫星图像,测量风速,并运行复杂的气候模型。或者,你也可以只是看看窗外,然后说:“大概会和今天差不多。”在经济学领域,这就是高科技复杂性与简单常识之间的终极对决。经济学家们几十年来一直在构建庞大、复杂的模型来预测通货膨胀——即面包、燃料和租金等物品价格上涨的速率。他们使用高级数学和机器学习,希望找到隐藏的模式,以帮助政府设定利率并防止家庭失去积蓄。但在这场竞赛中,有一个顽固的、老派的对手:“随机游走”(random walk)。这种观点认为,对明天价格的最佳猜测仅仅是今天的价格。这听起来很傻,就像是在猜测硬币的正反面,但历史表明,这个简单的技巧极其难以被超越,尤其是在经济波动剧烈且难以预测的地方。
本文深入探讨了这场战斗,但加入了一个转折:它在撒哈拉以南非洲地区测试了这些观点,该地区的通胀可能会像钟摆一样剧烈波动。研究人员收集了八个不同国家超过 50 年的数据,创建了一个巨大的数字游乐场,以观察现代“智能”计算机(机器学习和深度学习)是否终于能战胜简单的“看昨天”方法。他们不仅看了谁的误差率更低,还使用了严格的统计检验,以观察任何高级模型是否真正更好,还是仅仅因为运气好。
竞赛:高科技 vs. “昨天”策略
作者设计了一个涉及八个撒哈拉以南非洲经济体的宏大实验:加纳、尼日利亚、肯尼亚、科特迪瓦、南非、塞内加尔、坦桑尼亚和乌干达。他们建立了一个包含 424 个经济生活快照的数据集,时间跨度从 1972 年到 2024 年。可以把这看作是一个大型训练营,他们在那里教了八位不同的“教练”如何预测通胀。
这些教练既有老派也有新派:
- 天真教练(随机游走): 这个教练没有大脑。它只说:“明年的通胀将与今年完全相同。”
- 计量经济学教练: 这些是传统的专家,他们使用基于经济理论的线性方程和固定规则。
- 机器学习教练: 这些是高科技巫师。他们包括 随机森林(决策树团队)、XGBoost(超优化树提升器)和 弹性网络(一种筛选最佳线索的智能过滤器)。
- 深度学习教练 (LSTM): 这是最复杂的,是一种旨在记忆长序列事件的人工智能,就像人类记住一个故事一样。
研究人员将数据分为三部分:训练集(用于教导教练)、验证集(用于调整参数)和测试集(来自 2018 年至 2024 年的最终考试)。他们想看看高级 AI 是否能击败那个简单的“看昨天”教练。
令人震惊的结果:简单教练守住了底线
当最终考试结果出来时,这一结果对“越大越聪明总是更好”的观念造成了巨大冲击。
天真教练(随机游走)在统计学上是不可战胜的。 它实现了最低的误差率,其测试 RMSE(衡量预测偏离程度的指标)为 4.435。更重要的是,当研究人员运行严格的统计检验(称为 Diebold-Mariano 检验)来查看是否有任何其他模型真正更好时,答案是坚定的否。没有任何复杂的模型能够证明它们在统计学上优于简单的“看昨天”的猜测。
以下是其他教练的表现:
- 机器学习巫师(随机森林和 XGBoost): 它们是复杂模型中的佼佼者。随机森林的测试 RMSE 为 4.849,而 XGBoost 为 5.825。虽然它们很接近,但统计检验显示它们与天真教练基本持平。它们没有输,但也并未赢;它们实现了统计上的等效性。随机森林是唯一能声称与简单基准模型达成统计平手的模型,但它并未超越基准。
- 传统专家(汇总 OLS 和面板固定效应): 这些老派线性模型表现不佳。它们明显落后于天真教练,误差分别为 6.781 和 6.612。论文指出,试图将一条直线关系强加于一个动荡、混乱的经济体中,这种做法行不通。
- 深度学习明星 (LSTM): 这是最戏剧性的故事。当 AI 在没有安全制动的情况下训练过久(350 个 epoch)时,它遭受了“过拟合”。它完美地记住了训练数据,以至于在测试中失败了,得分极低的 7.741。然而,当研究人员加入“提前停止”(一种在 AI 变得过于困惑之前停止训练的技术)时,它的得分提高到了 6.162。这是一个巨大的进步,但它仍然没有击败简单的天真教练。它只是变得“在统计上无法区分”——这意味着它足够好,可以打平,但不足以获胜。
为什么智能模型失败了?
作者提出了高科技模型无法破解代码的几个原因。
首先,数据太小且噪声太多。 训练集只有 304 个观测值。对于像 LSTM 这样超级复杂的 AI 来说,这就像是通过只读几页字典来学习一门语言。模型会感到困惑,并开始记忆噪声而非学习规则。
其次,经济体不断改变规则。 测试期(2018-2024 年)包含了新冠疫情和全球大宗商品价格飙升等巨大冲击。简单的模型只是观察最近的一个数字,这使其能对这些冲击做出即时反应。然而,复杂模型试图寻找基于过去的模式(2009 年之前的数据),当世界突然变化时,这些模式就不再适用了。这就像是试图用晴天的地图在暴风雨中航行;地图非常详细,但却是错误的地图。
第三,“线索”可能并不那么有用。 模型被喂入了利率、政府支出和油价等数据。但在这些经济体中,通胀似乎主要由其自身的惯性和汇率驱动,这使得其他线索显得没那么有用。简单模型忽略了所有这些额外的线索,只是顺着惯性前进,事实证明这才是获胜策略。
这对未来意味着什么
论文总结道,对于撒哈拉以南非洲的政策制定者来说,信息很明确:不要仅仅因为有了时髦的新工具就丢弃简单的工具。
虽然复杂的模型(如随机森林和修正后的 LSTM)令人印象深刻,并且可以达到与简单模型相当的表现,但它们尚未证明自己能够超越简单模型。事实上,简单的“持续性”模型如此稳健,以至于它应该作为所有新模型在获得信任之前必须超越的“金标准”或“基准”。
作者建议,如果各国央行想要使用这些高级 AI 工具,应当谨慎行事。他们建议让简单的模型在后台运行,作为一种现实检查。如果一个复杂模型无法在统计学上证明自己比仅仅猜测“明天会和今天一样”更好,那么它可能并不值得投入额外的成本和复杂性。
最后,这项研究为经济学中一个长期存在的谜团增添了新的篇章:在一个充满混沌和突发变化的世界上,有时最聪明的事情就是仅仅看看昨天发生了什么,并假设它会再次发生。在撒哈拉以南非洲动荡的市场中,“简单”并不总是最好的,但目前它是冠军。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。