← 最新论文
📊 statistics

Experimental Assortments for Choice Estimation and Nest Identification

本文提出了一种使用 O(logn)O(\log n) 个组合的结构化非自适应实验设计,该设计不仅在估计各种选择模型方面优于现有方法,还使一种能够准确识别嵌套 Logit 模型中项目嵌套的新算法成为可能,该框架已通过在 Dream11 上的大规模部署得到了成功验证,提升了样本外预测能力并提供了具有管理实践意义的见解。

原作者: Xintong Yu, Will Ma, Michael Zhao

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Xintong Yu, Will Ma, Michael Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位店主,正试图弄清楚顾客到底更喜欢哪些饮料。你的菜单上有 72 种不同类型的饮料。为了了解他们的选择,你需要观察从货架上撤掉一些饮料时会发生什么。

如果你只是每天随机决定撤掉哪些饮料,你可能会走运,也可能会感到困惑。例如,如果你在同一天撤掉了“苹果汁”和“橙汁”,你就无法判断是想喝苹果汁的人转向了橙汁,还是他们直接回家没买东西了。

这篇论文提出了一种聪明且在数学上近乎完美的方案,来运行这些“味觉测试”(实验),让你能以最少的实验天数获取最多的信息。

以下是他们解决方案的详细拆解:

1. “二进制代码”菜单策略

与其随机挑选要撤掉的饮料,作者建议给每种饮料一个秘密的二进制代码(就像由 0 和 1 组成的条形码)。

  • 类比: 假设你有 8 种饮料。你给它们分配代码,如 000001010 直到 111
  • 实验: 与其测试所有可能的组合(那会耗费太长时间),你只需要进行 6 次特定的测试(外加一天提供所有饮料的情况)。
    • 测试 1: 提供所有代码第一个位置为 1 的饮料。
    • 测试 2: 提供所有代码第一个位置为 0 的饮料。
    • 测试 3 & 4: 对第二个位置进行同样的操作。
    • 测试 5 & 6: 对第三个位置进行同样的操作。

为什么这很神奇: 因为每种饮料都有唯一的代码,对于你选出的任意两种饮料,都保证至少有一次测试中,其中一种在货架上,而另一种被隐藏了。这让你能够准确观察撤掉某一种特定饮料是如何影响另一种饮料的销售额的。

论文证明,对于 nn 个项目,你只需要大约 logn\log n 次测试。所以,即使你有 1,000 个项目,你也不需要 1,000 次测试;你只需要大约 10 或 11 次。这是极其高效的。

2. 寻找“秘密家族”(嵌套识别)

一旦通过这些智能测试获得了销售数据,你就会想知道:哪些饮料是“近乎替代品”?

  • 问题: 如果撤掉了“苹果汁”,人们是转向了“橙汁”(因为它们都是果汁),还是转向了“牛奶”(因为它们都是早餐饮品)?
  • “提升”线索: 作者观察了一个“提升因子”(Boost Factor)。如果拿走一种饮料,其“好朋友”(即近乎替代品)的销售额会大幅跳升。而不相关的饮料销售额只会轻微跳升。
  • 推导:
    • 小幅跳升: 如果撤掉饮料 B 时,饮料 A 的销售额仅轻微上升,那么它们不属于同一个家族。
    • 大幅跳升: 如果撤掉饮料 B 时,饮料 A 的销售额翻了一倍,那么它们很可能属于近乎替代品(处于同一个“嵌套”中)。

论文引入了一种像侦探一样的算法。它观察这 6 次测试中所有的“跳升”情况,并逻辑地推导出整个产品的家族树。它仅通过这 6 次测试就能理清 72 个项目的正确分组,这在理论上如果靠随机测试则需要成千上万次。

3. 现实世界测试:幻想体育巨头

作者不仅在计算机模拟中进行研究。他们与 Dream11 合作,这是一个拥有 7,000 万用户的印度大型幻想体育平台。

  • 设定: Dream11 有数百种不同的“竞赛”(比如不同类型的游戏)供用户加入。管理者并不知道哪些竞赛是彼此互为替代品的。
  • 行动: 他们针对“二进制代码”实验运行了 21 天。他们向不同的用户群体展示不同的竞赛组合,每次都会根据数学计算隐藏大约一半的竞赛。
  • 结果:
    • 他们成功识别出了用户视为可互换的竞赛“嵌套”。
    • 这些基于数据的分组,在预测用户未来选择方面,比管理者基于简单特征(如报名费)的直觉判断做得更好。
    • 这些分组在管理者看来也非常合理:例如,他们发现用户将“赢家通吃”的高额奖金竞赛视为一个家族,无论具体的报名费是多少,因为它们的结构(奖金分配方式)是相同的。

总结

这篇论文解决了两个大问题:

  1. 如何测试: 不要靠猜测。使用二进制代码系统来测试少量的特定组合,这些组合能保证你学到所需的一切。
  2. 如何学习: 利用这些测试的结果,自动将项目归类为“家族”(替代品),而无需询问客户或根据产品特征进行猜测。

这就像是在尝试弄清楚巨大的钥匙串中哪些钥匙能打开哪些锁。你不需要尝试每一把钥匙去开每一个锁(那太慢了),而是使用一种特定的尝试模式,保证能以最短的时间找到匹配项。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →