这篇论文探讨了一个非常贴近我们日常生活的问题:在线平台(比如淘宝、亚马逊、小红书)应该如何向顾客展示“新品”,才能既学到新品的真实质量,又不至于亏掉太多钱?
想象一下,你是一家大型商场的经理。商场里有很多老款畅销品(比如经典的耐克鞋、畅销书),大家都知道它们好,卖得稳。现在,商场里突然进了一批全新的小众品牌(比如一个不知名的设计师做的鞋子)。
核心矛盾:
- 老款产品:大家都知道好,买的人多,能立刻赚钱。
- 新款产品:没人知道好不好。只有当有人买了并留下好评后,大家才知道它值不值。
- 难题:如果你不展示新品,就没人买,也就没人写评论,你永远不知道它是不是“宝藏”。但如果你把新品放在显眼位置,顾客可能会因为“怕踩雷”而不敢买,或者因为新品太新而选择老款,导致你当下的收入减少。
这篇论文就是为了解决:在有限的展示位(比如网页第一页只能放 10 个商品)中,如何安排新品和老品的比例,才能以最小的代价“试错”,最终找到最好的商品组合。
1. 核心发现:不要“孤注一掷”,要“强强联手”
问题一:应该把新品单独放,还是和老品一起放?
- 直觉误区:很多人觉得,为了让人买新品,应该把新品单独放在一个显眼的位置,这样顾客看到它的概率最大,评论来得最快。
- 论文结论:错! 最优策略是把新品和店里最火、最好的老款产品放在一起。
- 生活类比:
想象你在餐厅点菜。
- 策略 A(单独放):你只给顾客看一道从未见过的“神秘新菜”。顾客可能会因为好奇点它,但也可能因为太陌生而不敢点,或者觉得“这店怎么只卖这个?”
- 策略 B(强强联手):你在菜单上把“神秘新菜”和“招牌红烧肉”、“经典宫保鸡丁”放在一起。
- 为什么 B 更好? 顾客看到招牌菜,觉得这家店靠谱,愿意进店。在点招牌菜的同时,他们更有可能顺手尝试一下旁边的新菜。虽然新菜被招牌菜“抢”了一部分注意力(购买概率降低了),但因为整体客流量和信任度高了,新菜被尝试的总次数反而更多,而且你还没亏掉招牌菜带来的稳定收入。
简单说:不要为了推新品而把老品撤下,要把新品“夹带”在最好的老品里一起推。
2. 核心发现:新品太多时,要“分批上”还是“一起上”?
问题二:如果有 5 个新品,是一次性全放上去,还是一个个慢慢试?
- 直觉误区:
- 要么觉得“贪多嚼不烂”,一次只试一个,稳扎稳打。
- 要么觉得“广撒网”,一次全放上去,总有一个能火。
- 论文结论:这取决于新品的**“潜力”**。
- 如果这些新品看起来都很像“潜力股”(比如都是知名设计师的新作,或者评价预期很高),那么一次性多放几个一起试,效率最高。
- 如果新品看起来都很一般,那就少放几个,或者一个个试。
- 生活类比:
这就好比相亲。
- 如果你有一群非常优秀的相亲对象(高潜力),你当然希望同时安排大家见面,这样能最快发现谁是最适合你的那个“真命天子”。虽然每个人被选中的概率被稀释了,但“发现真爱”的总速度变快了。
- 如果你有一群不太靠谱的相亲对象,你就不需要同时安排,一个个来,避免浪费时间和资源。
- 关键点:论文发现,决定放多少个新品的,不是它们“现在看起来有多好”,而是它们“未来可能有多好”(基于先验概率)。
3. 为什么常用的“智能算法”会失效?
论文还做了一个有趣的实验,测试了两种目前最流行的 AI 算法(UCB 和 Thompson Sampling),发现它们在处理这种“新品展示”问题时,都会犯大错。
结论:现有的通用 AI 算法在这个场景下都不够用,需要专门设计的策略(论文提出的 EFA 算法)来平衡。
总结:给平台经理的“傻瓜指南”
如果要把这篇论文变成给电商运营人员的建议,那就是:
- 别把新品当“孤儿”:永远不要为了推新品而把老爆款撤下。把新品和最好的老品“捆绑”展示,利用老品的流量带动新品,同时保住收入。
- 看“潜力”定数量:如果新品看起来很有希望,就大胆地多放几个一起试;如果新品看起来一般,就少放点。不要死板地“一次只试一个”或者“一次全上”。
- 别迷信通用 AI:别直接用现成的推荐算法,它们要么太激进,要么太保守。要用专门针对“新品学习”设计的策略。
一句话比喻:
这就好比带一群孩子去游乐场。
- 不要只带那个最调皮(新品)的孩子去,让他自己玩(单独展示),他可能会迷路。
- 也不要因为怕他闯祸,就只让他在家待着(不展示)。
- 最好的办法是:让他和几个最听话、最熟悉环境的孩子(老爆款) 一起进去。这样既保证了安全(收入),又能让他最快熟悉环境(获得评论),甚至可能发现他其实是个隐藏的“游乐天才”(爆款)。
这篇论文题为《新产品的最优探索与品种选择决策》(Optimal Exploration of New Products under Assortment Decisions),由 Jackie Baek、Atanas Dinev 和 Thodoris Lykouris 撰写。文章研究了在线平台在容量受限的品种选择(Assortment)决策下,如何通过社交学习(Social Learning)机制来探索新产品质量的问题。
以下是该论文的详细技术总结:
1. 问题背景与定义
- 核心场景:在线市场(如 Amazon、Airbnb)每天引入大量新产品(Entrants),但缺乏交易历史。消费者依赖评论和评分来评估质量,而平台需要通过展示新产品来促使购买,从而生成评论以揭示质量。
- 探索与利用的权衡:
- 探索(Exploration):将新产品放入展示列表(Assortment)以获取购买和评论。这是昂贵的,因为消费者倾向于选择已知的高质量老产品(Incumbents),展示新产品会挤占老产品的曝光,导致短期收入损失。
- 利用(Exploitation):展示已知的高质量老产品以最大化短期收入。
- 关键挑战:平台需要在有限的展示位(容量 c)下,决定如何组合新产品和老产品,以最小化长期遗憾(Regret,即相对于已知所有产品最优策略的收入损失)。
- 具体研究问题:
- 应该单独展示新产品,还是将其与老产品搭配展示?
- 当有多个新产品时,应该同时探索多个,还是逐个探索?
- 经典的 Bandit 算法(如 UCB, Thompson Sampling)在此场景下是否有效?
2. 模型设定
- 选择模型:采用多项式 Logit (MNL) 模型。每个产品 i 有一个吸引力参数 wi。
- 老产品:wi 已知。
- 新产品:wi 未知,服从先验分布 F。在未被购买前,其名义吸引力为 h(F)(如均值)。
- 学习机制:一旦新产品被购买,其真实吸引力参数 wi 立即被揭示(无噪假设,即一次购买完全揭示质量)。
- 目标:在无限时间视界下,最小化累积遗憾。遗憾定义为最优已知策略的收入与当前策略收入之差。
- 约束:每次展示的产品数量不超过 c。
3. 主要贡献与核心结果
3.1 单个新产品的最优策略 (Section 3)
- 发现:当只有一个新产品需要探索时,最优策略是将该新产品与吸引力最高的 c−1 个老产品一起展示。
- 直觉与反直觉:
- 直觉上,单独展示新产品(只放它一个)能最大化其被购买的概率,从而最快获得评论。
- 然而,论文证明这是次优的。虽然搭配老产品会降低新产品的购买概率(由于替代效应),但它显著提高了每一轮的期望收入。
- 数学推导:遗憾可以分解为“探索期间的轮数”与“每轮收入损失”的乘积。由于 MNL 模型的无关选项独立性(IIA)性质,外部选项(不购买)被选中的概率与搭配的老产品无关。因此,最小化遗憾等价于最大化探索期间的总轮数(即推迟购买直到获得信息),这要求最大化分母中的吸引力总和,即搭配最强的老产品。
- 结论:无论先验分布如何,只要新产品有成为最优产品的可能性,**“搭配最强老产品”**总是最优的。
3.2 多个新产品的最优策略 (Section 4)
- 算法提出:提出了**“虚构品种选择”探索算法 (Exploration with Fictitious Assortments, EFA)**。
- 核心机制:
- 定义“虚构品种选择” St(ℓ):包含 c−ℓ 个已知最强产品,以及 ℓ 个第 (c−ℓ+1) 强已知产品的副本。
- 计算每个 ℓ(同时探索的新产品数量)对应的虚构收入 αt(ℓ)。
- 阈值规则:计算当前时刻的期望事后最优收入 OPTt。选择最大的 ℓ,使得 OPTt≥αt(ℓ)。
- 如果 OPTt 大于当前已知产品的最优收入,则探索 ℓ 个新产品,并搭配 c−ℓ 个已知最强产品。
- 结果:
- 最优的同时探索数量 ℓ 具有简单的阈值结构。
- ℓ 随着新产品的潜在价值(相对于老产品)增加而增加。
- 有趣的是,ℓ 的选择不依赖于单个新产品的具体购买概率,而是取决于先验分布的整体特征。
3.3 经典 Bandit 算法的失效 (Section 5)
- UCB (Upper Confidence Bound):倾向于过度探索(Over-explore)。在特定实例下,UCB 会展示所有新产品,导致短期收入极低,遗憾随先验概率 q→0 而发散。
- Thompson Sampling (TS):倾向于探索不足(Under-explore)。TS 采样可能导致其认为新产品吸引力低而不展示,或者在展示时未能有效利用老产品来平衡收入,导致获取信息的速度过慢。
- 简单启发式:
- “尽可能多探索”(ExploreAll):表现极差(同 UCB)。
- “一次只探索一个”(ExploreOne):表现次优,遗憾可能是最优策略的 c/2 倍。
- 意义:证明了在涉及容量约束和替代效应的 Assortment 问题中,直接套用经典 Bandit 算法是行不通的,需要针对结构设计的专用策略。
3.4 扩展模型 (Section 6)
- 异质奖励:当老产品和新产品的单位收益不同时,最优策略调整为搭配那些“缩放后中间遗憾”(Scaled Interim Regret)为负的老产品。
- 异质先验:当两个新产品的先验分布不同时,最优策略取决于先验的具体形态(如均值、尾部),并不总是优先探索“期望值更高”的产品。
- 噪声观测:即使购买后只能获得噪声信号(如 Beta 分布更新),最优策略的结构(搭配最强老产品)依然保持。
4. 方法论与证明技术
- Epoch 分解:将时间轴划分为“Epoch",每个 Epoch 从开始直到一个新的未知产品被购买(或获得新评论)为止。
- Epoch 遗憾最小化:证明了全局最优策略等价于在每个 Epoch 内最小化该 Epoch 的期望遗憾。
- 虚构品种选择 (Fictitious Assortments):这是论文的核心技术工具。通过构造包含已知产品副本的虚构集合,将复杂的组合优化问题转化为寻找满足特定不等式条件的 ℓ 值的问题。
- 归纳法与动态规划:利用归纳法证明策略在任意历史状态下的最优性,并展示了遗憾仅依赖于已知产品的吸引力参数集合,而非具体的历史路径。
5. 意义与启示
- 理论贡献:
- 将 Assortment Optimization 与 Multi-armed Bandit 问题结合,提出了一个新的框架。
- 揭示了在存在替代效应(Substitution Effect)和容量约束下,探索策略的结构性质与经典 Bandit 问题截然不同。
- 证明了“搭配最强已知产品”这一看似保守的策略在加速信息获取和减少遗憾方面是最优的。
- 实践指导:
- 为电商平台提供了明确的指导:在引入新品时,不要将其孤立展示,也不要盲目同时展示所有新品。
- 应利用已知的高流量老产品作为“载体”来带动新品的曝光,利用老产品的流量来分摊探索成本。
- 同时探索的新品数量应根据其相对于现有产品的潜在提升幅度动态调整,而非固定不变。
总结
这篇论文通过严谨的数学推导,解决了在线平台在容量受限下如何平衡新产品探索与现有收入的问题。其核心发现是:最优的探索策略并非最大化新产品的即时购买概率,而是通过搭配最强的老产品来最大化单位时间的信息获取效率与收入的平衡。 这一结论挑战了直觉,并指出了经典 Bandit 算法在此类结构化问题中的局限性,为平台算法设计提供了重要的理论依据。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。