← 最新论文
🤖 machine learning

Information-Directed Sampling for Causal Bandits

本文针对具有不可操纵变量的上下文因果多臂老虎机问题,提出了贝叶斯汤普森采样和信息导向采样算法,建立了依赖于熵的次线性遗憾界限,并通过有效利用共享因果机制来加速高回报决策的识别,证明了其相对于基准算法的优越性能。

原作者: Muhammad Qasim Elahi, Murat Kocaoglu, Mahsa Ghasemi

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Qasim Elahi, Murat Kocaoglu, Mahsa Ghasemi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名试图破解谜团的侦探,但你不能随心所欲地询问嫌疑人任何问题。有些线索被锁在玻璃后面——你能看到它们,却无法触碰它们。这就是“因果多臂老虎机”(causal bandits)的世界,它是人工智能的一个分支,其中计算机通过实验来学习如何做出最佳决策。在标准游戏中,如果你尝试一个动作并获得奖励,你只能学到关于那个特定动作的信息。但在现实世界中,行动像多米诺骨牌一样相互连接;推倒其中一个可能会撞倒好几个其他的。因果多臂老虎机利用这些隐藏的联系来更快地学习:如果你学会了一个多米诺骨牌是如何倒下的,你就可以在甚至不去触碰它的情况下,预判下一个多米诺骨牌会如何倒下。然而,当其中一些多米诺骨牌是“不可操纵的”时,一个重大问题就出现了。你可能可以推动一个杠杆(一个动作),但你无法改变患者的年龄或天气(不可操纵的变量),尽管这些因素极大地影响着结果。挑战在于,当最重要的线索中有一些是你无法控制的时候,如何找出最佳策略来进行学习。

这篇论文通过引入两种更聪明的、让 AI 玩这场游戏的方法,解决了这个精确的难题。作者们在已知事物如何连接的“地图”这一理念基础上,提出了一种方法,让 AI 将系统中未知的部分视为一个充满概率的神秘盒子。AI 不仅仅是瞎猜,而是使用了一种叫做“信息导向采样”(Information-Directed Sampling, IDS)的技术。把 IDS 想象成这样一位侦探:他不仅会挑选那个他认为现在就能破案的线索,还会挑选那个能让他对整个谜团了解得最深刻的线索,即便这个线索现在还不能直接破案。论文表明,通过使用这种方法,AI 可以比旧方法更好地在不同的实验之间共享信息。

研究人员开发了两种具体的策略。第一种是“汤普森采样”(Thompson Sampling)的一种变体,这就像是通过抛一枚加权硬币来决定下一步进行哪项实验,而硬币的权重是基于该实验成为最佳选择的可能性。他们从数学上证明了这种方法会随着时间的推移变得越来越好,其犯下的“错误”增长得非常缓慢。第二种是更复杂、也是他们提出的新版 IDS 策略。由于在计算机上完美解决 IDS 的数学计算极其困难,他们不得不使用一种“蒙特卡洛”(Monte Carlo)方法——基本上,是在脑海中运行数千次模拟场景,以获得一个良好的估算。论文的大发现是,即使使用了这些估算,该方法仍然表现得极其出色。他们证明了这些模拟所引入的误差是微小且可控的。在针对虚构场景的测试中,这些新方法击败了既有的因果方法和非因果方法,这表明当你无法触及一切时,最好的学习方式是仔细选择哪些实验能让你对全局有最深刻的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →