← 最新论文
💻 computer science

Bayesian Rational Search Engine User

本文提出了一种搜索引擎用户的贝叶斯理性模型,将他们的最优停止行为刻画为依赖于后验信念的“突出规则”,从而能够推导出检查深度分布以及一种新颖的、可微分的排序学习似然函数。

原作者: Shichao Ma

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Shichao Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正穿行于一座巨大而迷雾笼罩的图书馆,寻找一本特定的书。图书管理员(即搜索引擎)递给你一份书单,但这份书单并非按真实质量排序,而是凭直觉排列的。排在首位的书可能是最好的,但管理员的直觉充满噪音。

你并不知道图书馆里这些书实际上有多好。你只知道管理员认为排在首位的那本是最好的。要确认一本书是否优秀,你必须把它从书架上取下来,阅读封底,并查看价格。这需要时间和努力(即一种“成本”)。

本文精确地建模了一位明智且理性的个体如何决定何时停止搜索,并直接选择迄今为止找到的最佳书籍。

以下是利用简单类比对该论文发现的拆解:

1. “突出”规则:何时停止

大多数人认为,当你找到“足够好”的东西时就会停止搜索。但本文指出,这并不完全正确。你停止搜索的时机是:当你目前的最佳发现远远优于你预期在列表其余部分能找到的东西,以至于继续寻找不再值得付出努力。

  • 类比:想象你在钓鱼。你钓到了一条鱼。只要你认为下一条鱼可能会更大,你就会继续钓。但 eventually,你钓到了一条巨大的金枪鱼。你看着池塘的其余部分心想:“即使水里满是鱼,钓到比这条金枪鱼更大的东西的概率也低到让我觉得继续浪费鱼饵毫无意义。”
  • 规则:一旦你的“最佳捕获”明显优于你对池塘其余部分的“平均预期”,你就停止搜索。论文将此称为**“突出”规则**。

2. 搜索的双重任务

每当你检查一本书(或点击一个链接)时,你同时在完成两件事:

  1. 寻找奖品:你可能会找到比你手中那本更好的书。
  2. 绘制地图:即使那本书很差,检查它也能让你对整个图书馆有所了解。如果排在首位的书很糟糕,你会意识到:“哦,这座图书馆里全是垃圾。”如果首位的书令人惊叹,你会想:“哇,这座图书馆质量很高。”

论文表明,由于你每次检查一个项目时都在了解整个列表,因此你应该始终按顺序(从上到下)进行检查。跳着检查毫无帮助;这就像跳过悬疑小说的前几页直接看结局一样。最明智的做法是按顺序逐一查看。

3. 停止的三个原因(“单点击”之谜)

在现实生活中,人们经常只点击一个链接就立即离开。搜索引擎看到这种情况会疑惑:“他们是找到了想要的东西,还是放弃了?”

本文指出,单次点击会话背后有三种不同的原因,而对计算机而言,它们看起来完全一样:

  • 信任机制:用户对管理员的信任度极高,以至于在点击之前就知道排在首位的项目会是好的。他们点击只是为了确认,随后便停止。(他们在开始之前就已满意)。
  • 承诺机制:用户原本愿意继续寻找,但第一个项目如此完美,以至于查看任何其他项目都是浪费时间。(他们找到了赢家)。
  • 止损机制:用户原本愿意寻找,但第一个项目如此糟糕,以至于他们意识到整个列表都是垃圾。他们停止是为了节省时间。(他们放弃了)。

关键点:如果你只看到“一次点击”,你无法分辨这三种情况中的哪一种发生了。你需要知道他们是否实际上购买了该商品或阅读了文章(即转化),才能判断他们是满意还是失望。

4. 搜索引擎的“赢家诅咒”

这里有一个令人惊讶的反转:如果搜索引擎变得过于出色,它可能会让自己陷入缺乏数据的困境。

  • 类比:想象一位厨师变得如此擅长烹饪,以至于他们做的每一道菜都是 10 分满分。
  • 结果:顾客会吃完第一道菜,非常喜欢,然后离开。他们绝不会点第二道菜来看看是否也同样美味。
  • 问题:厨师(即搜索引擎)永远无法获得关于第二、第三或第四道菜的反馈。他们不知道那些菜实际上是否糟糕,还是仅仅被第一道菜的完美所掩盖。论文将此称为**“赢家诅咒”**:排名变得越好,系统能从中学习的数据就越少,因为用户停止搜索得太快了。

5. A/B 测试的陷阱

公司经常通过运行短期实验(A/B 测试)来测试新功能。本文警告说,这些短期测试可能会产生误导。

  • 场景:假设一家公司提高了其搜索结果的质量。
  • 短期:用户习惯了旧的、较低的质量。当他们看到新的、稍好一些的结果时,可能会感到惊讶,并比平时更早停止搜索,因为与他们的低预期相比,第一个项目看起来很棒。测试显示“点击量减少”,这看起来像是一次失败。
  • 长期:一旦用户习惯了新的高质量,他们会再次深入查看,因为他们知道列表是优质的。
  • 教训:“点击量”或“滚动量”的短期下降实际上可能意味着产品变得更好了,而不是更差。论文指出,在判断测试结果之前,必须等待用户“适应”新的现实。

6. 训练搜索引擎的新方法

最后,论文提出了一种训练搜索引擎以更好排序的新方法。

  • 旧方法:“如果用户没有点击,那该项目就是坏的。”(这过于简单)。
  • 新方法:“如果用户停留在第 3 个项目,这意味着第 1 和第 2 个项目不够好,不足以让他们停止,但第 3 个项目足够好,足以让他们停止。”
  • 数学原理:论文将这种逻辑转化为一个复杂的几何形状(多面体)。它计算用户的行为轨迹落入该形状内部的概率。这使得搜索引擎能够从每一次点击和每一次停止中学习,即使不知道项目的确切“分数”,也能通过理解用户决策的几何结构来实现。

总结

论文认为,用户并非盲目的点击者;他们是聪明的学习者。当用户目前的最佳发现明显优于剩余内容的“平均水平”时,他们就会停止搜索。这种行为在数据中创造了隐藏的模式:单次点击可能意味着满意或失望,而一个变得过于出色的搜索引擎可能会无意中将其自身的错误隐藏起来。理解这些隐藏机制有助于构建更优秀的搜索引擎,并更准确地解读用户数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →