Modelling Customer Trajectories with Reinforcement Learning for Practical Retail Insights
本文提出了一种用于建模零售空间内顾客轨迹的最大熵强化学习框架,证明其无需昂贵的现实世界数据收集,即可通过提供更为准确且基于行为学的见解,在店铺布局优化与利润最大化方面优于旅行商问题(TSP)和最近邻算法(PNN)等传统启发式方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一家小型便利店。你的目标很简单:尽可能多地赚钱。你知道人们经常会购买他们原本没打算买的东西——比如一块糖果或一瓶汽水——仅仅因为他们在过道行走时看到了它。这被称为“冲动消费”。
为了让人们购买这些商品,你需要确切知道他们行走的路线。如果你把糖果棒直接放在他们的必经之路上,他们就会顺手拿走;如果你把它藏在他们从不光顾的角落,他们就不会看到。
问题所在:“猜谜游戏”与“昂贵间谍”的对比
为了弄清楚顾客的行进路线,你只有两个糟糕的选择:
- 间谍(真实数据):你雇佣人员带着摄像机和地图跟随顾客。这能提供完美信息,但成本极高且侵犯隐私。大多数小型商店负担不起。
- 猜测(启发式规则):你使用简单的数学规则来推测路线。
- “最短路径”规则(TSP):这假设顾客是机器人,总是选择获取商品的最短绝对路线。
- “最近邻”规则(PNN):这假设顾客有点随机,但总体上仍会选择离他们最近的商品。
该研究发现,这些“猜测”规则有 28% 的时间是错误的。真实的人类是混乱的。他们会游荡,会绕路,并不总是走最短路径。由于这些猜测偏差太大,店主最终会将商品摆放在错误的位置,从而错失销售机会。
解决方案:一名“电子游戏”学生
作者们利用**强化学习(RL)**创造了一种预测顾客路径的新方法。这就像训练一个电子游戏角色(“智能体”)去表现得像一个真实的购物者。
他们不是简单地告诉角色“走最短路径”,而是教给它更具人性化的课程:
- 获取商品:你买到所需物品就能得分。
- 保持一点不可预测性:你探索不同路线(而不仅仅是每次都走同一条无聊的路线)也能得分。
这被称为“最大熵”学习。它迫使计算机认识到人类并非机器人;我们具有“有限理性”。我们会犯错,会分心,即使购买同样的东西也会选择不同的路径。
他们做了什么
他们利用来自一家便利店的真实数据(在那里他们追踪了 3000 多名真实购物者)来训练他们的“电子游戏学生”。然后,他们让这名学生模拟了 10,000 次购物行程。
结果:学生获胜
当他们比较“电子游戏学生”的路线与真实人类路线时:
- “最短路径”规则彻底失败。因为它只寻找最快路线,所以完全忽略了商店的某些区域。
- “最近邻”规则稍好一些,但仍然错过了真实人类那种“游荡”的行为模式。
- RL 学生的匹配度最高。它发现,有时人们即使顶部路线更短,也会穿过商店底部,仅仅因为那是他们喜欢的购物方式。
这对你的钱包为何重要
该论文通过尝试将特定商品(如软饮料)移至新货架以增加利润来测试这一方法。
- 如果你使用最短路径或最近邻的猜测,它们会建议你把商品移到实际上空荡荡且鲜少有人光顾的货架上。这将浪费空间。
- RL 学生则正确识别了真实人类实际经过的繁忙、高人流量货架。
当他们把商品移到 RL 学生建议的位置时,商店获得的额外利润几乎等同于使用了昂贵的“间谍”数据。而简单的猜测规则未能找到正确的位置。
核心结论
这篇论文表明,你不必花费巨资用摄像机追踪每一位顾客来优化你的商店。相反,你可以使用一个智能计算机模型,让它学会像人类购物者一样“思考”。它在“过于简单而不真实”(猜测规则)和“过于昂贵而不实用”(真实数据)之间架起了桥梁,为店主提供了一种廉价且准确的方式来排列货架,以实现利润最大化。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。