FreshRetailNet-LT: A Stockout-Annotated Censored Demand Dataset for Latent Demand Recovery and Forecasting in Fresh Retail
本文介绍了 FreshRetailNet-50K,这是首个包含 50,000 条具有精确缺货标注的小时级门店-商品时间序列的大规模基准数据集,它使研究人员能够重建潜在需求,并通过纠正由截断销售数据引起的系统性偏差,显著提高易腐零售产品的预测准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在经营一个繁忙的柠檬水摊。你想确切知道有多少人想买柠檬水,这样你才能制作出最完美的量。如果你做得太多,它会变酸(浪费);如果你做得太少,你就会错失销售机会。
问题是,你的销售记录是个骗子。
问题所在:“空杯”幻觉
在生鲜食品(如草莓、鱼或牛奶)的世界里,商店经常缺货。假设有100个顾客想买草莓,但你只有50个。你在上午11:00就卖光了。
你余下时间的销售记录显示:“销量为0。”
但这并不是事实!需求依然存在,只是你缺货了。这被称为截断数据(Censored Data)。这就像一台相机在电池耗尽的那一刻停止了录制。如果你试图从这个损坏的相机中学习,你会认为:“哦,下午之后没人想买草莓了。”于是你会采取错误的行动,比如第二天订购更少的货。这会形成一个恶性循环,让你不断缺货并损失利润。
解决方案:FreshRetailNet-LT
该论文的作者创建了一个全新的、大规模的数据集——FreshRetailNet-LT,来修复这个“损坏的相机”。你可以把它想象成一本关于生鲜食品销售的“超详细日记”。
以下是它的特别之处,我们使用简单的类比来说明:
1. 高清视频 vs. 每日摘要
大多数旧数据集就像是一份每日摘要笔记:“今天卖了50个苹果。”它们不会告诉你何时断货。
而这个新数据集就像是每小时录制的超高清视频。它能准确显示货架何时变空。它记录了来自18个城市、1000多家门店的2万个不同产品的故事,跨度长达两年。因为它能进行逐小时追踪,所以即使下午2点销量为零,它也能识别出你在上午11点就卖光了草莓。
2. “真实标签”
通常,计算机必须猜测商店是否缺货。而这个数据集附带了经过验证的“缺货标签”。这就像有一位老师在每次货架实际空置时,都会在旁边打上一个金星。这使得研究人员能够教计算机区分“没人想要”(真实的零需求)和“我们卖完了”(被截断的需求)。
3. 上下文线索
该数据集不仅统计销售额,还记录了销售背后的“天气报告”。它包括:
- 促销活动: 我们是否有过五折优惠?(这通常会导致需求的大幅飙升)。
- 天气: 是否在下雨?(人们可能会购买更多新鲜蔬菜在家烹饪)。
- 节日: 是不是农历新年?(人们会购买不同的东西)。
他们是如何测试的:两步修复法
研究人员利用这个新数据集测试了一种修复“谎言销售记录”的两步法:
- 第一步:侦探工作(恢复)
首先,他们利用这些“金星”标签来重建缺失的销售数据。如果货架在上午11点空了,模型会估算如果货架没有空,会有多少人原本会购买草莓。这就像是在填补电影中缺失的帧。 - 第二步:水晶球预测(预测)
其次,他们利用这种“重建后的真相”来教计算机如何预测未来的需求。
测试结果:更清晰的图景
当他们测试这种方法时,结果令人印象深刻:
- 减少猜测: 计算机不再低估需求。在使用该方法之前,它的误差约为 6.7%(即认为人们想要的数量比实际少)。在使用这种新方法后,误差降到了接近于零。
- 更高的准确性: 整体预测准确率提高了 1.63%。在销售数百万美元生鲜食品的世界里,那微小的百分比意味着节省了大量资金并减少了浪费。
为什么这很重要
这篇论文不仅仅关乎数学,它关乎修复一个破碎的系统。通过提供一个承认“我们缺货了”并能准确告知何时缺货的数据集,它有助于商店停止缺货的恶性循环。它让商店能够订购正确数量的易腐品,确保当你去商店时,草莓确实在那里。
作者们已经将这个“超详细日记”及其代码开放给所有人使用,希望帮助科学家和店主共同解决生鲜食品需求的难题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。