← 最新论文
🤖 machine learning

Robust Counterfactual Policy Optimisation via Nondeterministic Causal Models

本文通过形式化区分潜在混杂因素与固有随机性的概率非确定性因果模型,为序列决策中的鲁棒反事实策略优化提出了一种新颖框架,并通过包含隐藏混杂因素的脓毒症治疗模拟进行了验证。

原作者: Jessica Lally, Milad Kazemi, Nicola Paoletti, David Watson, Sander Beckers

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jessica Lally, Milad Kazemi, Nicola Paoletti, David Watson, Sander Beckers

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何开车,但你手里只有一段别人开车的视频。你想问:“如果机器人当时转了另一个弯会怎样?”这就是**反事实推理(counterfactual reasoning)**的核心:回顾过去,并基于不同的选择去想象一个不同的结果。在人工智能领域,这对于安全性至关重要,尤其是在医疗保健等领域,我们不能为了观察结果而对真实患者进行危险的实验。

为了实现这一点,科学家们使用马尔可夫决策过程(MDPs),它就像是描述系统如何根据动作(如给药)改变状态(如患者健康状况)的规则书。传统上,研究人员假设只要知道了所有的隐藏秘密(称为潜变量/隐变量),这些规则书就是完全可预测的。他们认为:“如果我们知道患者隐藏的基因代码,我们就能精确预测未来。”然而,现实生活是混乱的。有时,事情纯粹是随机发生的——比如一次硬币投掷或机器的一次故障——无论有多少隐藏知识都无法预测。这篇论文探讨了这样一个棘手的中间地带:当隐藏的秘密和纯粹的随机性共同塑造未来时,我们该如何做出最佳决策?


侦探的困境:破解缺失变量之谜

想象你是一名正在使用“如果……会怎样”机器来破解谜团的侦探。你有一段患者病重的视频,你想知道:“如果我们当时给予了不同的治疗方案,他们是否能幸存下来?”

在过去,侦探们假设“如果……会怎样”机器就像一个完美的发条玩具。他们相信,如果他们知道每一个隐藏的齿轮(比如患者未被诊断出的糖尿病),他们就可以倒转时间,看到究竟会发生什么。但本文的作者杰西卡·拉利(Jessica Lally)及其团队意识到,现实生活并不是一个发条玩具。有时,齿轮会随机卡住,或者一阵风吹倒了一排多米诺骨牌。这就是内在随机性(inherent randomness)

论文指出,我们不能仅仅因为缺少某些信息就假装世界是完美可预测的。相反,我们需要一种新的侦探工作方式,这种方式要承认:“我们不知道隐藏的齿轮,而且即使我们知道了,未来仍可能带给我们一些惊喜。”

新工具:“最坏情况”安全网

该团队引入了一种名为**鲁棒反事实策略优化(Robust Counterfactual Policy Optimisation)**的新方法。你可以把它看作是决策过程中的一个安全网。

通常,当我们试图猜测原本会发生什么时,可能会出错,因为我们不知道“隐藏的混杂因素”(例如患者的糖尿病状态)。作者提出的框架不仅仅是猜测一个结果,而是为可能出现的最坏结果做好准备。

他们使用了**敏感性分析(sensitivity analysis)**的概念。想象你在预测天气。如果你百分之百确定,你会说“会下雨”。如果你不确定,你会说“可能会下雨,也可能不会”。作者增加了一个“旋钮”(称为 Δ\Delta),用来控制隐藏的秘密在多大程度上干扰我们的预测。

  • 如果你将旋钮转到 1,你假设没有任何隐藏的秘密在干扰事物。
  • 如果你把旋钮调高,你假设隐藏的秘密可能导致任何事情发生。

目标是找到一个即使在隐藏秘密尽可能棘手的情况下也能表现良好的策略(一套行动规则)。他们称之为寻找一个**鲁棒(robust)**策略。这就像为徒步旅行准备背包:你不仅要为晴天做准备,还要为雨天、泥泞和突如其来的暴风雨做准备,以防万一。

实验:脓毒症模拟器

为了测试他们的想法,团队使用了一个脓毒症治疗的计算机模拟。在这个游戏中,患者有四个生命体征(心率、血压、血氧和血糖),这些体征可以是低、正常或高。医生(或 AI)必须决定开启或关闭三种不同的治疗方案。

这里有一个陷阱:模拟器中有一个隐藏变量。有些患者是糖尿病患者,有些则不是。这个糖尿病状态就是“隐藏的混杂因素”。它会影响患者对治疗的反应,但 AI 只能看到生命体征,看不到糖尿病状态。在这个模拟中,20% 的患者患有糖尿病。

研究人员在模拟器上运行了他们的新型“安全网”方法。他们问道:“即使我们不知道谁患有糖尿病,我们能否找到一个比我们在数据中看到的更好的治疗方案?”

他们的发现

结果令人鼓舞,但也带有一些限制。

  1. 比单纯猜测更有效: 当他们在包含完整且完美信息的模拟版本(即他们确实知道谁患有糖尿病)上测试新策略时,他们找到的策略通常比原始的次优策略要好得多。对于糖尿病患者,新策略将结果提高了平均 7.4 分(在一个死亡为 -10、康复为 10 的量表中)。
  2. “代理”略显谨慎: 团队必须仅通过可见的生命体征来猜测隐藏问题的程度(Δ\Delta 旋钮)。对于糖尿病患者,这个猜测非常精准。但对于非糖尿病患者,该方法显得过于谨慎了。它假设隐藏的问题比实际情况更严重。这就像气象预报员在实际晴朗时说“可能会下雨”。虽然这会导致模拟中的得分略低,但它确保了决策的安全性。
  3. “先知”测试: 作者将他们的法与“先知(Oracle)”进行了比较——“先知”是一个知道真实隐藏问题水平的完美版本。他们发现,即使在不知道真相的情况下,他们的方法找到的策略也非常接近“先知”的最佳选择。

核心结论

这篇论文并不声称已经永久解决了隐藏变量之谜。相反,它提供了一种在既神秘又随机的世界中询问“如果……会怎样”的更安全的新方式。

通过将“隐藏的秘密”(如糖尿病)与“纯粹的随机性”(如随机故障)区分开来,并通过为最坏情况做准备,作者表明我们仍然可以做出聪明、鲁棒的决策。他们的方法表明,即使在面对隐藏因素处于“盲飞”状态时,我们仍然可以找到比仅仅遵循旧有的、不完美的资料更优秀的治疗方案。这是向着一种能够谦逊地承认自身未知、并足够聪明地应对意外的 AI 迈出的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →