Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits
本文提出了一种新颖的跨领域离策评估与学习框架,该框架利用来自目标域和源域的历史数据集来克服诸如少样本数据、确定性日志策略以及新动作等关键挑战,从而在现有方法因高方差或有限探索而失效的情景下,实现有效的策略评估与优化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位正试图在暴风雨中航行的船长,但你从未航行过这条特定的航线。你有一张记录了你当前船只过往航程的地图(即“日志数据”),但这张地图并不完整。也许是前任船长过于谨慎,只在平静的水域航行,从而留下了未被测绘的危险礁石;又或者,因为船只太小无法探索整个海洋,导致地图完全缺失。在计算机科学的一个被称为机器学习的领域中,这是一个被称为**上下文多臂老虎机(Contextual Bandits)**的常见问题。它描述了计算机如何根据情况(即“上下文”)来做出决策——例如推荐一部电影、建议一种药物或展示一条广告——而无需在现实世界中尝试每一个选项(因为那可能既昂贵又危险)。
为了解决这个问题,科学家们使用了一种名为**离策评估(Off-Policy Evaluation, OPE)**的技术。你可以把 OPE 想象成一个用于决策的“飞行模拟器”。与其在真实的人身上测试新策略(这很冒险),不如利用旧数据在计算机中运行,看看它在实际操作中表现会如何。问题在于,如果旧数据过于枯燥(比如船长只做了一件事),或者新策略想要尝试旧船长从未尝试过的选项,大多数模拟器就会失效。如果旧数据中没有特定动作的记录,模拟器就无法猜测会发生什么,从而导致荒谬的猜测或彻底失败。这篇论文探讨了这种棘手的场景:即旧数据过于有限、过于僵化,或者完全缺失了关键的新选项。
这时,来自博报堂(Hakuhodo DY Holdings)和康奈尔大学的研究人员提出了一个巧妙的新方法来修复这个损坏的模拟器。他们称之为跨域离策评估与学习(Cross-Domain Off-Policy Evaluation and Learning)。想象一下,你正试图在一个全新的、未知的海洋中学习冲浪(“目标域”),但你所在的本地海滩(“源域”)有着不同的波浪模式。如果你只观察自己的海滩,当看到一个从未在你那里出现过的巨浪时,你可能会感到困惑。但是,如果你还能观看一段在邻近海洋冲浪的视频呢?即便水流略有不同,波浪的物理特性可能是一致的。
作者提出,与其受困于当前情境下那些枯燥或不完整的资料,你可以借鉴来自其他相似情境(其他“领域”)的见解。他们意识到,虽然每个医院、每个国家或每组用户都是独特的,但它们通常共享一些底层模式。例如,某种治疗方法在两家不同的医院中效果可能相似,即使患者的人口统计特征略有差异。该论文介绍了一种名为 COPE(跨域离策评估)的新方法。它的工作原理是将“奖励”(好的结果)拆分为两个部分:一个是在相似群体中通用的共享部分(类似于波浪的一般物理特性),以及一个仅针对你所在群体的独特部分(类似于当地的风向)。
通过利用来自其他领域的数据来确定“共享部分”,COPE 可以填补由于在你的特定数据中从未尝试过某些动作而留下的空白。这就像是利用邻近城市的地图,来推断出你所在城镇中地图遗漏的一条街道的布局。研究人员在视频分享应用(KuaiRec)的真实数据上测试了该方法,并发现当目标数据稀缺、旧数据过于僵化(确定性强)或存在全新的动作尝试时,他们的方法比传统方法准确得多。他们证明了,通过结合来自多个来源的数据,同时小心地处理它们之间的差异,我们可以更有效地评估和学习新的策略。他们展示了在以往方法会直接放弃或产生巨大误差的情况下,我们的方法依然表现出色。
在实验中,他们模拟了以下场景:新动作占所有可能选择的 80%,或者旧数据极其有限,以至于每个动作只有一个数据点。在这些极端情况下,他们的新方法显著降低了误差,优于标准方法。他们还表明,这种方法不仅适用于“评估”(检查一个策略),也适用于“学习”(寻找最佳策略)。该论文指出,通过将不同的数据源视为一个相互关联的家族而非孤立的岛屿,我们可以构建出更聪明、更安全且更具适应性的决策系统,尤其是在我们缺乏从零开始学习所需的数据时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。