← 最新论文
🤖 machine learning

Information-Based Exploration via Random Features for Reinforcement Learning

本文介绍了随机特征信息增益(Random Feature Information Gain, RFIG),这是一种用于深度强化学习的可扩展且具有理论依据的探索方法,它利用随机傅里叶特征来近似不可数空间中的信息增益,从而提供与黑盒神经网络方法相比具有竞争力的性能和更优越的可解释性。

原作者: Waris Radji, Odalric-Ambrym Maillard

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Waris Radji, Odalric-Ambrym Maillard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在巨大的、大雾弥漫的迷宫中导航。机器人的目标是找到出口,并沿途尽可能多地收集闪亮的硬币。这就是**强化学习(Reinforcement Learning)的世界——在这里,智能体通过尝试、犯错并获取奖励来学习。但棘手之处在于,机器人面临着一场被称为探索与利用权衡(exploration-exploitation tradeoff)**的持久拉锯战。“利用(Exploitation)”意味着坚持那些它目前已知能带来硬币的路径;“探索(Exploration)”则意味着走进那些充满迷雾、未知的角落,那里可能藏着宝箱,也可能只是死胡同。如果机器人从不探索,它就会困守在仅有的少量硬币中;如果它过度探索,则会浪费大量时间在迷雾中。

多年来,科学家们一直试图通过给机器人一个“好奇心奖励”来解决这个问题——即为访问它不太熟悉的地点提供额外积分。在简单的小型迷宫中,这很容易实现:你只需要计算机器人访问某个位置的次数即可。但在现实世界中,“迷宫”通常是一个连续且无限的空间,机器人可能永远不会两次经过完全相同的地点。计数变得不再可能。为了解决这个问题,现代人工智能使用巨大的、复杂的神经网络(数字大脑)来猜测一个位置有多“不确定”。但这些数字大脑就像黑盒一样:它们难以理解,对参数设置的微小变化非常敏感,有时还会莫名其妙地失效。这篇论文提出了一个简单的问题:我们能否构建一个既能像这些复杂大脑一样出色,又具有透明度、数学严谨性,且不需要博士学位水平进行调优的好奇心系统?

本文的作者 Waris Radji 和 Odalric-Ambrym Maillard 给出了肯定的回答。他们引入了一种名为**随机特征信息增益(Random Feature Information Gain, RFIG)**的新方法。与其使用庞大且不透明的神经网络来猜测不确定性,他们使用了一个涉及“随机特征”和“核方法(kernel methods)”的巧妙数学技巧。你可以这样理解:想象你想知道一个公园有多拥挤,但你无法统计出每一个人的数量。与其建立一个庞大的监控系统(神经网络),不如向空中随机投掷一把彩色飞镖。通过观察飞镖落下的位置以及它们的聚集方式,你可以在从未看清人群的情况下,从数学上估算出人群的密度。

在论文中,研究人员展示了这种“掷飞镖方法”(随机特征)可以近似表示“信息增益(Information Gain)”——这是一个描述访问某个地点能获得多少新知识的专业术语。他们从数学上证明了这种近似是准确的,并且即使随着数据量的增加,误差也会保持在很小的范围内。他们通过将这种方法植入标准的机器人学习算法(PPO)中进行了测试,让它玩各种游戏,从平衡木杆到在复杂的迷宫中导航。结果令人印象深刻:RFIG 的表现与顶尖的神经网络方法不相上下,在某些情况下甚至更胜一筹。至关重要的是,与神经网络不同,RFIG 不需要通过反复试错的精细调优过程就能奏效;它既稳定又可靠。

本文认为,我们并不总是需要通过让 AI 变得更复杂、更难理解来使其变得更“聪明”。有时,像 RFIG 这样更简单、在数学上透明的方法同样可以高效地完成繁重任务。作者指出,这种方法可以成为让 AI 探索变得更可靠、更易于信任的游戏规则改变者,它提供了一个清晰的闭式解(closed-form solution),避免了深度学习的“脆弱性”。虽然他们也指出,仍需更多研究来观察该方法如何扩展到大规模的图像处理任务,但他们的模拟表明,对于许多控制和导航问题,这种“随机特征”方法是替代那些黑盒巨头的、功能强大且具有理论基础的选择。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →