← 最新论文
🤖 machine learning

Adaptive Multi-Horizon Reinforcement Learning

本文提出了一种自适应多时界强化学习方法,该方法通过动态选择并结合不同的时间时界来克服固定折扣因子的局限性,从而增强在复杂、变化的环境及持续学习场景中的参数效率与适应能力。

原作者: Manoosh Samiei, Doina Precup, Paul Masset

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Manoosh Samiei, Doina Precup, Paul Masset

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教会一个机器人如何在世界中导航。为了做出好的决策,机器人需要知道应该在多大程度上关注未来与当下。在计算机科学领域,特别是一个被称为“强化学习”(即智能体通过试错进行学习)的领域中,这种平衡通常由一个单一且不可改变的设置来控制,称为“折扣因子”。你可以把它想象成一副带有固定色调的眼镜:如果色调太深,机器人只能看到鼻尖前的景象,而忽略了几个步骤之外发生的一切;如果色调太浅,机器人会被遥远的各种可能性分散注意力,以至于忘记躲避眼前的即时障碍。长期以来,科学家们一直认为一个固定的设置对于整个学习过程就足够了。但如果你观察人类和动物是如何思考的,你会发现他们似乎聪明得多。他们可以放大以专注于眼前的危险,也可以缩小以规划一段长途旅程,根据情况切换他们的心理“眼镜”。这篇论文提出了一个简单但强大的问题:我们能否构建一个能够随时更换自己的“眼镜”,而不是被困在仅有一副眼镜上的机器人?

研究人员 Manoosh Samiei、Doina Precup 和 Paul Masset 提出了一种名为“自适应多时界强化学习”的新方法。他们并没有强迫机器人只选择一种看待未来的方式,而是给了它一整套不同的“视觉设置”(或规划时界)。想象一下一个专家顾问团队,其中一位顾问痴迷于接下来的五分钟,另一位在思考接下来的一个小时,而第三位则在为接下来的天进行规划。机器人的大脑就像一个聪明的经理,倾听所有这些顾问的意见,但会更多地关注那个在当前情况下建议最合理的顾问。如果机器人在一个奖励散布在各处的迷宫中,它会更多地听取长期规划者的意见;如果它处于一个需要快速行动的陷阱中,它会更多地听取短期规划者的意见。

该论文在几种类似于电子游戏的各种环境中测试了这个想法。首先,他们展示了在简单的谜题中,观察未来的“最佳”方式取决于布局。有时短视角的观察效果最好;有时长视角的观察效果最好。接着,他们观察了奖励的“稀疏度”——即寻找好东西的难度。他们发现,当奖励分布得既广又远时,机器人需要更长的视角才能成功;而当奖励频繁且靠近时,较短的视角效果更好。这证明了单一、固定的设置无法完美胜任每一项工作。

最后,他们将这种新的“多顾问”系统应用于一个持续学习的场景中,即机器人必须连续切换执行三个不同的任务。结果非常令人期待。该系统不仅学会了每个任务,还自动弄清楚了对于每个新挑战应该信任哪种“视觉设置”。当任务从收集散落物品转变为到达特定目标时,机器人的内部经理转移了对正确顾问的注意力。在最后一个最复杂的任务中,机器人成功学会了抓取一个大型的时限奖励,然后收集较小的奖励,而那些拥有单一、固定设置的机器人往往无法做到这一点。作者认为,这种方法使学习更加高效且具有适应性,就像生物大脑处理混乱、多变的现实世界的方式一样。虽然论文指出,结果是在模拟中测量的,并且会根据随机的初始条件表现出一些差异,但核心观点是成立的:赋予智能体灵活结合不同时间维度的能力,是提高决策能力的强大方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →