← 最新论文
🤖 machine learning

It's a matter of timescale: non-linear utility in successor features and multi-objective planning and learning

本文认为,当前的多元目标强化学习方法(SER 和 ESR)以及后继特征(successor features)是不充分的,因为它们未能考虑到在单个决策问题中,发生在不同时间尺度上的非线性效用效应同时存在的情况。

原作者: Liam P. H. Mertens, Lucas N. Alegre, Florent Delgrange, Diederik M. Roijers, Ann Nowé, Peter Vamplew

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Liam P. H. Mertens, Lucas N. Alegre, Florent Delgrange, Diederik M. Roijers, Ann Nowé, Peter Vamplew

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,机器通常被教导通过追求单一目标来做出决策,比如一个扫地机器人清洁地板,或者一个程序赢得国际象棋比赛。但现实世界很少如此简单。通常,一个智能体必须同时处理多个相互竞争的目标,例如一辆自动驾驶汽车既要快速到达目的地,又要保持安全并节省能源。当这些目标发生冲突时,机器需要一种方式来决定哪一个更重要。此外,决策的后果可能会在不同的时间跨度内显现。一个小错误可能会导致眼前的问题,而一系列小错误可能在数月后才累积成一场灾难。多年来,研究人员开发了不同的数学工具来处理这些情况,但他们通常将每个时间框架视为一个独立的问题,即为即时风险选择一种方法,为长期平均值选择另一种方法。

一项新研究挑战了这种分离,认为现实世界的决策通常要求智能体同时关注即时的、中期的和长期的后果。这些研究人员来自比利时、巴西和澳大利亚的多个机构,他们证明了如果仅依赖于这些传统方法中的一种,在涉及多个时间尺度时,会导致危险或低效的结果。通过模拟一个涉及工人暴露于有毒物质的情景,他们展示了:一种旨在保护长期平均暴露水平的策略,可能会意外地牺牲一名工人在短期的危险峰值中;而一种专注于即时安全的策略,则可能会忽略缓慢积累的健康危机。他们的工作表明,为了构建真正安全且有效的智能,我们需要新的思维方式,能够同时平衡这些不同的时钟。

问题的核心在于我们如何衡量智能体的“幸福感”或“效用”。在许多标准的AI系统中,机器会计算它预期在长期内获得的平均奖励,并试图使这个数值最大化。这对于每天处理数千个视频文件的工厂非常有效;如果平均功耗和速度都很好,那么即使某个特定文件处理时间过长,系统也被认为是成功的。然而,当单个糟糕的结果是灾难性的时,这种方法就会失效。想象一下一名正在接受医疗治疗的患者。该患者只会经历一次治疗。他们并不关心成千上万其他患者的平均结果;他们关心的是自己的特定结果。如果治疗具有非线性风险——即剂量的微小增加会导致危险度的剧烈跳升——那么平均值的计算就会掩盖真实的风险。患者需要的是一个评估其单次旅程特定结果的系统,而不是许多次旅程的平均值。

还有第三种看待时间的方式,即关注紧接着的下一步。想象一辆车撞上墙壁。受伤的危险程度取决于撞击的力量,且具有非线性关系。一次剧烈的撞击比一次轻微的撞击要危险得多,而且风险并不会随着时间简单累加;一百次轻微的碰撞并不等于一次剧烈的撞击。在这种视角下,系统必须在每一刻发生时评估风险,并在出现危险因素组合时立即施加惩罚。几十年来,研究人员一直将这三种视角——长期平均值、单次旅程结果以及即时的步进式风险——作为针对不同任务的独立工具。本文作者认为,这种分离是一种缺陷。他们提出,许多复杂的问题要求智能体同时关注这三个时间尺度。

为了证明这一点,研究人员创建了一个简化的模拟实验,涉及三名员工和三项不同的任务,每项任务都有不同的毒性水平。目标是在为期一个月的时间内分配这些工人执行任务,同时确保他们的安全。工作的毒性不仅仅是一个简单的数字,它的效应取决于测量的时间点。存在着单日内高剂量暴露的即时风险、月度总暴露量的中期风险,以及跨越数月的累积损伤的长期风险。团队使用三种传统方法分别运行了模拟,然后尝试将它们结合起来。

当系统仅关注长期平均值时,它发现了一种策略,通过不断轮换来保证两名经验丰富的工人安全,但它实际上牺牲了第三名经验较少的工人,将其反复分配到最危险的任务中。其逻辑是,由于小组的平均风险较低,系统便忽略了其中一人正面临过载的情况。当系统仅关注单次旅程的结果时,它学会了频繁轮换工人,以确保没有人面对该月内过高的总剂量。这让每个人都相对安全,但导致了大量的切换,这可能并不高效。当系统仅关注即时的步进式风险时,它避免了更换工人,倾向于让工人留在与其技能水平相匹配的任务上,这是一种安全但僵化的做法。

最令人警醒的结果出现在研究人员尝试同时优化这三个时间尺度时。他们使用了一种将即时、月度及长期风险合并为一个目标的策略。最终的策略是其他策略的混合体,但它揭示了一个在试图平衡这些竞争性时钟时存在的关键缺陷。系统再次倾向于牺牲经验最少的工人,将他们分配给最艰巨的任务,以保护其他人免受即时峰值和长期累积的影响。模拟显示,仅仅试图对不同的时间尺度进行平均化是行不通的;风险的非线性特征意味着,保护一个时间尺度的做法可能会在无意中危及另一个时间尺度。研究人员发现,那些在单一时间尺度上表现良好的策略,在综合考虑所有尺度时往往是最差的选择。

这一发现凸显了当前人工智能研究的一个重大空白。虽然我们拥有处理长期平均值或即时风险的强大工具,但我们缺乏一种能够同时处理它们的综合方法。作者建议,未来的系统需要学习可能结果的分布,不仅要理解平均结果,还要理解在不同时间窗口内可能发生的完整范围。他们承认这是一个困难的挑战,因为为了改善某一时间尺度的安全性而改变策略,可能会恶化另一时间尺度的安全性,从而创造出一个复杂的权衡景观。然而,他们认为开发这些结合性的方法对于现实世界的应用至关重要,例如在医学中的放射治疗管理,或在商业中的客户服务优化,在这些领域,个人的安全与满意度必须与整体的效率达成平衡。

研究结论指出,我们目前教导机器进行决策的方式过于狭隘。通过将时间视为单一维度,或者在其他视角中择其一,我们面临着创造出理论上安全但在实践中危险的系统的风险。前进的道路需要新的算法,使智能体能够同时兼顾多个时间尺度,确保智能体不仅是最大化一个平均值或避免一个糟糕的日子,而是真正理解其行为在整个生命周期中所承载的全部重量。这不仅仅是一个技术上的调整,更是为了确保人工智能能够应对人类生活的复杂、多层次现实所必须进行的进化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →