← 最新论文
📊 statistics

Generalized Linear Markov Decision Process

本文介绍了 GRASP-MDP,这是一个用于纵向研究的离线强化学习新颖框架,该框架通过将奖励建模与转移建模分离,解决了二元/有界奖励以及部分奖励观测带来的挑战,从而在无需填补的情况下利用所有可用的转移数据,进而提供有限样本保证并提升经验性能。

原作者: Sinian Zhang, Kaicheng Zhang, Ziping Xu, Zongqi Xia, Jue Hou, Tianxi Cai, Doudou Zhou

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Sinian Zhang, Kaicheng Zhang, Ziping Xu, Zongqi Xia, Jue Hou, Tianxi Cai, Doudou Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何通过迷宫。在理想世界中,机器人在每走一步后都会得到一份完美的评分表:“你向左转了,你发现了一枚金币,+10分!”但在现实世界中——比如在医院或社交媒体应用中——情况要复杂得多。机器人可能会看到接下来的确切情况(它向左转并撞到了墙),但那次特定移动的评分表可能是缺失的、延迟的,或者只在少数幸运的转弯中才可用。这就是“离线强化学习”(offline reinforcement learning)所面临的挑战,即我们尝试利用旧的、记录好的数据来教导人工智能,而不是让它通过实时试错来进行学习。

为了让这种学习成为可能,科学家们经常使用一种被称为“线性马尔可夫决策过程”(Linear Markov Decision Process)的数学捷径。你可以将其理解为假设迷宫是由简单的直线构成的:如果你知道起点和方向,你就能轻松预测下一个位置以及你会得到的积分。如果“奖励”(points)是简单的数字,这效果很好。但如果奖励是某种棘手的变量,比如只能在0到10之间波动的患者健康评分,或者是二元的“是/否”结果呢?这些奖励并不遵循简单的直线;它们会弯曲和扭曲。此外,如果我们丢弃所有缺少评分卡的数据,我们就会失去关于迷宫实际布局的宝贵信息。本文解决了在规则呈曲线变化且评分卡不完整的情况下如何教导机器人的问题。

由 Sinian Zhang 及其同事领导的研究团队引入了一种名为 GRASP-MDP 的新方法。你可以将它看作是一种解决迷宫问题的巧妙的两部分侦探策略。GRASP-MDP 不尝试去猜测缺失的评分卡(因为这可能导致错误的猜测),而是将谜团拆分为两个截然不同的线索:世界是如何移动的以及奖励是什么

首先,该方法研究“移动”部分。即使我们不知道特定转弯的得分,我们仍然可以看到机器人从一个位置移动到另一个位置。GRASP-MDP 利用所有这些移动记录——无论是否附带分数——来构建一张完美的迷宫地图。它将移动规则视为简单且线性的,这使得数学计算变得简单且可靠。

其次,它处理“奖励”部分。由于像健康评分或二元结果这类奖励是弯曲且复杂的,该方法使用一种称为“广义线性模型”(Generalized Linear Model)的特殊工具来拟合这条曲线。至关重要的是,它仅使用那些确实记录了分数的数据来确定这条曲线。它不会试图为缺失的数据发明一个分数;它只是承认:“我们不知道这里的分数,但我们确切知道迷宫是如何运作的。”

通过将这两个线索分开,GRASP-MDP 避免了猜错分数的陷阱。它说:“我们知道路径是通畅的,因为我们看到了移动过程,即便我们错过了分数。”论文从数学上证明,这种方法比那些要么忽略缺失数据、要么试图用假设来填补空白的旧方法效果更好。

为了测试他们的想法,团队通过包含简单和复杂奖励的计算机模拟进行了实验。他们发现,GRASP-MDP 始终能比以往的方法学到更好的策略,尤其是在奖励数据不完整的情况下。他们还将该方法应用于一个涉及 4,295 名多发性硬化症(MS)患者的真实医疗数据集。在这种情景下,“迷宫”是患者的治疗历程,而“奖励”是他们的残疾评分(EDSS),该评分仅在某些就诊时进行检查。该方法成功地利用了大量的治疗历史(移动数据),即使在残疾评分缺失的情况下,也能推荐更好的治疗方案。结果表明,通过保留“缺失分数”的数据用于学习移动规则,人工智能可以做出比丢弃这些数据更明智的决策。

简而言之,GRASP-MDP 是一种从杂乱的现实世界数据中学习的更聪明的方式。它尊重这样一个事实:我们通常知道发生了什么(转移过程),即使我们不知道结果有多好(奖励),并且它利用这些知识来构建更好、更可靠的决策系统,而不会编造虚假数字。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →