← 最新论文
📊 statistics

Logging Policy Design for Off-Policy Evaluation

本文提出一个统一框架,用于设计日志策略以最小化离线策略评估误差,该框架通过刻画基本的奖励覆盖权衡,并在不同信息情境下推导最优策略,从而指导企业在高风险实验中选择干预策略。

原作者: Connor Douglas, Joel Persson, Foster Provost

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Connor Douglas, Joel Persson, Foster Provost

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位厨师,正在决定新食谱(目标策略)是否比当前的更好。你不能明天就为所有人烹制新菜,因为如果它不好,人们会不高兴。因此,你希望利用过去用餐的笔记(日志数据)进行“离线”测试,以预测新食谱的效果会有多好。

问题在于:你是如何记录那些过往用餐情况的?

如果你的旧笔记只记录了当你在抛硬币决定菜单时(均匀记录策略)人们吃了什么,那么你的数据就会很混乱。你有成千上万条人们吃了他们讨厌的东西的记录,而关于好东西的记录却很少。试图用这种混乱的数据来猜测新食谱的表现,就像试图通过看一张模糊的单张照片来预测天气一样。

本文旨在设计一种更好的记录笔记的方法,以便在尚未向所有人提供新食谱之前,就能准确地评估它。

核心问题:“覆盖率”与“奖励”之间的拉锯战

作者指出,设计这种笔记(记录策略)需要在两个目标之间进行微妙的平衡:

  1. 覆盖率(安全网):你需要记录足够的多样性。如果你的新食谱建议了一道你过去从未记录过的菜,你就无法评估它。你需要确保拥有新食谱可能建议的内容的数据。
  2. 奖励(好东西):你想要记录人们真正享受的餐食。如果你只记录那些无聊、安全的餐食,你的数据就会很乏味。如果你只记录那些罕见、惊人的餐食,你可能会错过人们通常饮食的背景。

类比:想象你是一名侦察兵,试图为未来的探险家(目标策略)寻找最佳的隐藏宝藏地点(高奖励)。

  • 如果你只在你认为有宝藏的地方寻找,你可能会错过探险家决定去访问的地方。
  • 如果你随机地到处寻找,你就会浪费时间在空坑里挖掘,而且你关于“好”地点的地图会非常不可靠,因为你在正确的地方挖掘得不够深。

本文的主要发现是,最好的笔记既不是探险家的计划,也不是随机的混乱。它是一种特定的、经过计算的混合体,既倾向于好地点,又密切关注探险家可能选择的地点。

三种知识情境

本文根据你在开始记录之前所掌握的知识,将如何设计这本完美的笔记分解为以下三种情境:

1. “盲目”情境(我们一无所知)
如果你完全不知道新食谱是什么,也不知道人们喜欢什么,最稳妥的做法是平等地记录所有内容(随机采样)。这效率不高,但这是唯一能保证你完全不会遗漏任何内容的方法。

2. “水晶球”情境(我们知晓一切)
如果你确切知道新食谱是什么,也确切知道人们喜欢什么,你就不只是遵循新食谱。你实际上会做一些更聪明的事情:

  • 你重点关注新食谱喜欢的物品。
  • 但是,你会提高记录那些极有可能被喜爱的物品的概率,即使新食谱并不经常选择它们。
  • 神奇的结果:本文证明,如果你使用这种“超级智能”的笔记,你实际上可以比直接让新食谱向人们实时提供服务获得更准确的预测。此外,在编写笔记的过程中,人们实际上会更开心,因为你为他们提供的食物比新食谱提供的更好!

3. “模糊水晶球”情境(我们有猜测)
在现实世界中,你通常对人们喜欢什么有一个猜测(机器学习模型),但这个猜测是有噪声的。

  • 陷阱:如果你直接利用你带有噪声的猜测来决定记录什么,你可能会出错并浪费时间。
  • 解决方法:作者建议一种称为**“后验收缩”**的技术。将其想象为一个“安全过滤器”。如果你的猜测说一道菜很棒,但你不是百分之百确定,你就将该猜测拉回平均值。这就像说:“这看起来很棒,但让我们先不要把所有赌注都押在上面。”这种简单的调整会使你的笔记更加可靠。

实用建议:“软贪婪”方法

本文承认,在现实世界中,公司并不总是能够构建完美的、复杂的数学笔记。它们受到各种限制。

因此,他们建议一种更简单、更实用的方法,称为**“软贪婪”**。
与其进行完美的计算,不如想象一个你可以调节的旋钮:

  • 将其完全转到“随机”:你平等地记录所有内容。(安全,但不准确)。
  • 将其完全转到“贪婪”:你只记录你知道的绝对最好的物品。(高效,但如果你遗漏了什么,风险很大)。
  • 将其转到“甜蜜点”:你主要记录好东西,但也为其他事物留出一小部分空间。

本文表明,通过正确调节这个旋钮(基于你拥有的数据量),你可以获得几乎与完美数学解决方案相当的结果,而无需超级计算机来计算出这一点。

总结

本文教导我们,我们如何收集数据与数据本身同样重要。通过精心设计我们选择记录的内容(记录策略),平衡对看到“好东西”的需求与对看到“新计划可能做什么”的需求,我们可以在不冒实时尝试风险的情况下,就新策略做出更好的决策。它将混乱的实验过程转变为精确的科学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →