← 最新论文
📊 statistics

Near-Optimal Sample Complexity Bounds for Constrained Average-Reward MDPs

本文通过提出一种在松弛可行性与严格可行性设置下均能达到极小极大最优率的模型预测算法,为生成模型下受约束平均奖励马尔可夫决策过程(MDP)中学习 ϵ\epsilon-最优策略建立了近乎最优的样本复杂度界限,从而填补了该领域的一个重要理论空白。

原作者: Yukuan Wei, Xudong Li, Lin F. Yang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yukuan Wei, Xudong Li, Lin F. Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,机器通过与环境互动来学习如何做出决策,就像孩子学习如何在房间里穿行一样。它们会因为好的行为而获得奖励,并因为坏的行为而受到惩罚,从而逐渐建立起一套旨在实现长期成功最大化的策略。这种被称为强化学习的过程,已经推动了从玩复杂游戏到控制机械臂等各个领域的突破。然而,现实世界的应用对高分的要求不仅仅是如此;它们还需要安全性和公平性。例如,一架送货无人机不仅必须快速到达目的地,还必须保持在特定的电池预算之内。医疗人工智能必须推荐既有效又不会超过患者风险承受能力的治疗方案。这些场景被建模为约束决策问题,即智能体必须在严格遵守资源、风险或时间规则的同时,找到尽可能好的路径。

几十年来,研究人员一直致力于教机器如何高效地学习这些安全策略,尤其是在环境复杂且规则适用于长期而非仅仅是下一步时。挑战在于如何在追求高额回报与保持在严格限制内之间取得平衡,同时机器在没有任何世界先验地图的情况下,必须通过试错来进行学习。复旦大学和加州大学洛杉盟分校的研究人员的一项新研究正面应对了这一难题,他们确定了机器学习安全、最优策略所需的精确信息量。他们已经确定了解决这些问题所需的精确数据量,并证明了难度取决于环境的两个特定特征:系统稳定进入稳定模式所需的时间,以及长期回报对策略微小变化的敏感程度。

研究人员专注于这样一种设定:学习智能体可以使用模拟器,该工具允许它询问:“如果我在这种情况下采取这个行动,接下来会发生什么?”并立即得到答案,而无需等待现实世界的事件展开。这种被称为生成模型的设置消除了在现实世界中进行风险探索的需求,使研究人员能够纯粹专注于学习过程的数学效率。他们调查了一种特定类型的问题,其目标是最大化无限未来的平均回报,而非仅仅是一个短暂、固定的时期。这对于管理电网或车队等应用至关重要,因为这些应用的目标是稳定的长期表现,而非一次性的短期获胜。

该团队开发了一种新的算法,作为学习智能体的引导。该算法通过不断调整回报欲望与遵守约束之间的平衡来工作。它通过解决一系列简化的、带有折扣的版本(即未来的回报比即时回报略微不那么值钱)来完成,然后将这些解转化回长期平均值。他们工作中的一个关键创新是控制在从有限样本中学习时不可避免产生的统计噪声的方法。他们证明,通过仔细选择测试哪些策略以及如何组合它们,该算法可以避免过度拟合随机波动带来的陷阱。

该研究最重要的发现是对样本复杂度(即保证获得近乎完美解所需的数据点数量)的精确计算。研究人员发现,所需的数据量直接与状态空间和动作空间的大小相关,并乘以一个代表系统行为“跨度”及达到稳定状态所需时间的因子。他们区分了两种情景:一种是允许智能体轻微违反规则,另一种是智能体必须完全遵守规则。在宽松的情景下,数据需求随所需精度的平方增长。然而,在严格的情景下(即智能体绝不能违规),数据需求显著增加,这取决于可行区域中存在多少“回旋余地”的特定度量。

为了证明他们的算法尽可能高效,研究人员构建了一系列旨在欺骗任何学习算法的困难假设环境。这些极端案例表明,任何学习算法如果不失败,其学习速度都不可能超过他们的算法。他们证明了严格安全性所需的额外数据并非其方法的缺陷,而是约束下学习的一个基本规律。结果确立了一个清晰的界限:如果一个智能体需要绝对的安全,它必须在数据收集方面付出更高的代价,而这种代价是不可避免的。

这项工作提供了关于学习安全长期策略统计极限的第一个完整图景。它证实了虽然高效学习这些复杂行为是可能的,但严格安全性的成本是真实且可量化的。研究结果为构建高风险环境AI系统的开发者提供了路线图,告诉他们需要收集多少数据才能确保其智能体既有效又安全。通过定义这些极限,该研究使该领域从猜测可行性转向了解精确的需求,从而确保未来的智能系统能够充满信心地部署在现实世界中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →