← 最新论文
📊 statistics

Data-Driven Dynamic Assortment in Online Platforms: Learning about Two Sides

本文介绍了一种针对双边未知选择参数的双边动态组合问题的数据驱动算法,通过在最大化平台收益的同时同步学习客户和卖家的偏好,实现了具有最优速率的对数级遗憾。

原作者: Rahul Roy, Nur Sunar, Jayashankar M. Swaminathan

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Rahul Roy, Nur Sunar, Jayashankar M. Swaminathan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营着一个繁忙的数字市场,就像一个高科技版的农贸市场或交友软件。你有两组人群:客户(想要购买服务的人)和卖家(想要提供服务的人)。你的工作是决定向每个走进门来的客户展示哪些卖家。

这篇论文探讨了一个非常棘手的问题:你不知道任何人的喜好。

核心问题: “盲约”市场

在大多数在线平台中,系统会尝试猜测客户想要什么。但在本文描述的情景中,平台在两个方面都是“盲目”的:

  1. 它不知道客户想要什么: 有些客户喜欢太阳能安装商;另一些人则偏好自由撰稿人。平台不知道下一个到来的客户属于哪种类型。
  2. 它不知道卖家想要什么: 即使客户选中了一位卖家,那位卖家也可能会说“不,谢谢”。也许这位卖家讨厌与特定类型的客户合作。平台同样不知道这些偏好。

这就像是一个盲约场景,媒人既不知道男方喜欢什么,也不知道女方喜欢什么。如果男方选了女方,女方仍可能拒绝他。如果媒人只了解男方的喜好而忽略了女方的喜好,他们就会不断地安排糟糕的约会。

事件循环

论文描述了这个市场运作的一个特定节奏:

  1. 到达: 一位客户到达。
  2. 菜单: 平台向他们展示一份小名单(即“组合/ assortments”)。
  3. 提议: 客户从名单中选择一位卖家(或不选)。
  4. 审核: 卖家收到一批提议。每隔几天(一个“周期”),卖家会进行审核,并最多选择一位客户进行合作。
  5. 奖励: 只有当客户选择了卖家卖家也选择了客户时,平台才能获得收益(或达成一次“匹配”)。

挑战:在实践中学习

平台管理者必须在不知道未来情况的情况下,现在就做出决策。他们必须弄清楚:

  • “客户类型 A 喜欢哪些卖家?”
  • “卖家类型 B 接受哪些客户类型?”

如果平台只是不断展示那些热门卖家,它就永远无法得知一个新卖家是否实际上是某个特定客户类型的绝佳搭档。但如果展示太多随机的卖家,就会浪费时间和金钱在糟糕的匹配上。这就是经典的“探索与利用”(Exploration vs. Exploitation)困境。

解决方案:“双向学习”算法

作者创建了一个聪明的计算机程序(算法),称为 TWL-UCB。把它想象成一个超级敏锐的媒人,他为每一对可能的组合都保留着一个“置信度分数”。

  1. 猜谜游戏: 算法开始猜测客户和卖家对彼此的喜爱程度。
  2. “如果……会怎样”测试: 算法使用了一种叫做“上置信界限”(Upper Confidence Bound, UCB)的数学技巧。想象算法在稳健行事的同时也在进行有风险的尝试。它会想:“我有 90% 的把握认为客户 A 喜欢卖家 X,但我对卖家 Y 的把握只有 50%。让我们试试卖家 Y,看看能不能成,因为如果我猜对了,那将是一个巨大的胜利!”
  3. 双重检查: 与以往只观察客户行为的方法不同,该算法会同时观察双方
    • 每当客户做出选择时,它都会更新关于客户喜好的预测。
    • 每当卖家接受或拒绝提议时,它都会更新关于卖家喜好的预测。
  4. 结果: 随着时间的推移,该算法变得极其擅长预测完美的匹配,从而最大限度地减少了失败约会的次数(遗憾值/regret)。

重大发现

作者通过数学证明和计算机模拟证明了三件事:

1. 它进步神速(“多项式对数级”的胜利)
作者证明了他们的算法学习效率极高,以至于其产生的“错误”随时间增长得非常缓慢。用数学术语来说,误差的增长速度类似于对数的平方(一条非常平缓的曲线)。

  • 类比: 想象一个学生在考试。大多数学习方法产生的错误会像陡峭的山丘一样堆积;而这个算法产生的错误则像平缓的斜坡一样堆积。它学习规则的速度比任何人都快。

2. 你无法做得更好(“下界”证明)
作者还证明了没有任何其他可能的策略能比他们的算法学得更快。他们表明,即使是“完美”的算法,在最坏的情况下也会产生类似数量的错误。

  • 类比: 他们证明了他们的算法是“金牌得主”。你无法跑得比它更快,因为赛道本身的极限就在那里。

3. 规模并非越大越好(“菜单大小”的惊喜)
他们进行了模拟实验,观察展示巨大的卖家名单(大菜单)与较小名单之间的区别。

  • 发现: 一旦菜单达到一定规模(在他们的模拟中约为 30 个卖家),再扩大规模也不会带来太大帮助。
  • 类比: 想象一家餐厅的菜单。如果你有 5 道好菜,再增加 50 道平庸的菜并不会让顾客更开心;只会让他们感到困惑。无论菜单是大是中等规模,平台获得的成功匹配次数几乎是一样的。

为什么这很重要

这篇论文首次解决了在不知道任何一方喜好的情况下,如何同时学习市场两端的难题。它表明,通过将问题视为“双向”学习挑战而非仅仅是“客户选择”挑战,平台可以做出更聪明、更快速且更具盈利能力的决策。

简而言之:要运营一个成功的双边市场,你不能只猜买家想要什么,你还必须学习卖家想要什么。如果你能用正确的数学方法同时做好这两点,你就赢了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →