On the retraining frequency of global models in retail demand forecasting
本文表明,在各种机器学习和深度学习架构中,降低全局预测模型的重训练频率,能够在保持预测准确性的同时显著降低计算成本和能源消耗,从而为大规模零售需求预测提供一种更具可持续性且更高效的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你经营着一家拥有数千种产品的巨型杂货店。每天,你都需要猜测人们会买多少苹果、牙刷或麦片盒,以免缺货或因积压未售出的库存而浪费资金。为了做到这一点,你使用了一个“全局模型”(Global Model)——这是一个超级聪明的计算机大脑,它能从你所有产品的销售历史中同时学习规律,而不是为每件单品单独制定规则。
长期以来,标准的建议一直是:“要不断更新这个计算机大脑。” 每当发生一笔新销售时,你就应该立即重新训练模型,以保持其敏锐度。然而,Marco Zanotti 的论文挑战了这一习惯。他提出了一个疑问:我们真的需要每天都重新训练这个模型吗,还是可以让它休息一段时间?
以下是他研究结果的拆解,使用了简单的类比:
1. “持续训练” vs. “定期检查”
把预测模型想象成一个正在为大考复习的学生。
- 旧方法(持续重新训练): 学生每小时、每天都在学习一点点。每当有一页新内容印出来,他们就立刻重新阅读教科书。这让他们保持了极高的时效性,但非常耗费精力,既昂贵(在时间和能量方面)又容易导致精疲力竭。
- 新方法(定期重新训练): 学生努力学习一周,然后休息一段时间。他们每月才回到教科书前,根据最新的章节更新笔记。
论文的发现: 研究发现,那个每月学习一次的学生,在考试中的表现与那个每小时学习一次的学生一样出色(有时甚至更好)。这个“全局模型”足够聪明,能够学习商店的普遍规律(例如“夏天人们会买更多冰淇淋”),而不需要每天都被重新教导。
2. “绿色”效率的成本
重新训练这些模型并非免费。它需要巨大的计算能力,这会消耗电力并产生碳排放(就像开车一样)。
- 类比: 想象计算机是一台巨大的工厂机器。为了每天重新训练模型而 24/7 全天候运行,需要花费巨额电费。
- 结果: 通过将“每日更新”切换为“每月更新”,研究发现公司可以削减 75% 的计算成本。如果他们完全停止重新训练,只使用一次模型,则可以节省 90% 的成本。
- 代价: 对于最常见的预测类型(猜测售出商品的准确数量),准确度并没有下降。即使模型在“休息”,它依然保持着敏锐。
3. 机器学习 vs. 深度学习
论文测试了两种类型的“大脑”:
- 机器学习模型(Machine Learning Models): 这些是高效、务实的工人。它们擅长遵循规则和模式。研究发现,这些模型从“休息”中获益最多。随着数据量的增大,这些模型在减少重新训练频率时,能节省最多的资金和能源。
- 深度学习模型(Deep Learning Models): 这些是天才艺术家,能够洞察非常复杂且隐藏的模式。它们功能强大,但需要消耗大量能量。虽然它们在减少重新训练频率时也能省钱,但省下的程度不如那些“务实工人”那么多,而且它们似乎存在一个“天花板”,即延长休息时间对它们节省精力的帮助不再显著。
4. “安全网”(概率预测)
有时,你不仅想知道会卖出多少个苹果,还想知道可能的范围(例如:“我们会卖出 100 到 150 个苹果,但也可能达到 200 个”)。这被称为概率预测。
- 发现: 如果你需要这些“安全网”式的预测,模型确实需要更新得稍微频繁一些。然而,即便如此,每两周更新一次通常也就足够了。你并不需要每天更新。
总结
论文认为,传统的“始终保持模型新鲜”的规则已经过时且浪费。
- 对于点预测(确切数字): 你可以每月一次(甚至更久)重新训练模型,就能获得与每日更新相当的准确度,同时节省大量的资金和能源。
- 对于安全库存(范围预测): 你可能需要每两周更新一次,但仍远低于每日更新的频率。
简而言之: 你的全局预测模型就像一名训练有素的运动员。它不需要每小时都进行冲刺来保持体能。它可以跑一场马拉松,休息几周,然后依然赢得比赛。通过让它休息,企业可以在不丧失预测需求优势的同时,节省资金并保护环境。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。