A Predict-then-Correct Loop Based on Few-Shot Continuous Contextual Bandit for Demand Forecasting
本文提出了一种“先预测后修正”的框架,该框架将静态机器学习预测与少样本连续上下文多臂老虎机修正策略相结合,旨在显著提高零售需求预测的准确性并降低库存成本,特别是在标签稀疏且需求模式快速变化的场景下。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图猜测你学校一年一度的烘焙义卖会有多少人参加。你有一个超级聪明的计算机程序,它通过观察去年的数据、天气预报以及纸杯蛋糕的价格来做出预测。这就是科学家所称的“需求预测”,它是确保商店备货充足的核心支柱。但棘手的部分在于:如果今年完全不同了怎么办?也许一种新的病毒式流行趋势让每个人都想要某种特定的口味,或者一场突如其来的暴雨让大家都留在了家里。那个基于去年枯燥数据的旧计算机程序还不知道这些。这就像是一个没有更新最新路况信息的 GPS,它会一直告诉你直行,直到撞上一堵墙。
在零售领域,这是一个巨大的问题。商店有数百万种不同的商品(比如不同口味的苏打水或不同尺寸的鞋子),有时甚至会出现没有任何历史记录的新商品。如果商店猜错了,要么会导致缺货(让顾客生气),要么会导致库存过多(浪费金钱)。传统上,为了修正一个错误的预测,你必须停止一切工作,喂给计算机海量的新数据,并从头开始重新训练它。但这太慢了。等到计算机学会的时候,潮流可能已经过去了。这篇论文探讨了一种更聪明的方法,可以在不按下“重置”按钮的情况下处理这些意外情况。
这项研究背后的研究人员 Zhiwei Lei、Benedict Jun Ma 和 Ilya Jackson 提出了一种巧妙的两步走策略,他们称之为“先预测后修正”(Predict-then-Correct,简称 PtC)。把它想象成拥有一位经验丰富的名厨(第一个计算机模型),他能根据经典食谱做出美味的基础汤品。然后,当顾客要求“再多加一点香料”时,你不需要把汤倒掉重新开始,而是有一个反应敏捷的副厨(修正系统),他尝一下汤的味道,然后实时加入适量的盐或胡椒。
以下是他们的“副厨”是如何工作的。首先,主计算机模型对人们会购买多少产品做出它最好的猜测。然后,一个特殊的“上下文多臂老虎机”(contextual bandit)系统介入。 “上下文”意味着它会观察当前的情况(是节假日吗?是周末吗?),而“老虎机”是一个用于描述尝试不同行动并观察哪种行动更有回报的学习系统的专业术词。在这种情况下,“行动”就是向上或向下调整厨师的预测。系统尝试一个微小的调整,观察实际销量是否匹配得更好,如果对了,它就会获得一个“奖励”。如果错了,它就会学习下次不再这样做。
真正的魔力发生在数据不足以进行学习时,比如推出一款全新的产品时。通常,计算机在仅靠少量新数据进行学习时会感到困惑,并会在尝试学习时忘记以前掌握的知识。这篇论文建议使用一种“少样本”(few-shot)策略,这就像是在只给学生做几道练习题的情况下进行教学。为了实现这一点,系统会寻找与其他产品相似的产品(比如将一种新的辣味苏打水与一种旧的辣味苏打水进行比较)来借鉴一些线索。它还使用了一个“Top-p 掩码更新”(Top-p masked update)规则。想象一下,计算机的大脑里有成千上万个旋钮。这个规则不是一次性转动所有旋钮(否则可能会损坏机器),而是只转动那些需要微调的、敏感的小旋钮,同时保持那些承载主要知识的大型重要旋钮不动。这防止了计算机“忘记”它过去学到的所有东西。
团队使用来自沃尔玛和一家大型饮料公司的真实数据测试了这个想法。他们发现,他们的“先预测后修正”循环是一个明显的赢家。在不同类型的产品中——无论是销售大量稳定商品、少量稳定商品,还是古怪且难以预测的商品——新方法都显著降低了预测误差。在一项测试中,与仅使用原始计算机模型相比,它将平均准确度提高了 9.52%。更重要的是,当他们利用这些更好的预测来决定订购多少库存时,商店最终减少了持有额外库存的支出,也减少了因货架空置而损失的销售额。
论文明确反对这样一种观点,即认为每次市场变化时都需要完全重新训练模型,或者需要海量的新数据来进行修正。他们还表明,如果只是简单地添加一个强化学习层而不注意如何更新模型,实际上会让情况变得更糟,导致不稳定。相反,他们的发现表明,一个轻量级的、能够实时微调现有预测的自适应层才是最佳平衡点。它架起了过去沉重缓慢的学习与现在快速且混乱的现实之间的桥梁,证明了有时修复预测的最佳方式并不是推倒重来,而是倾听反馈并调整旋钮。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。