← 最新论文
🤖 machine learning

Distributional Active Inference

本文提出了一种将主动推理集成到分布强化学习框架中的形式化抽象,从而使机器人系统能够在无需显式建模转移动力学的情况下,实现样本高效的最优控制。

原作者: Abdullah Akgül, Gulcin Baykal, Manuel Haußmann, Mustafa Mert Çelikok, Melih Kandemir

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdullah Akgül, Gulcin Baykal, Manuel Haußmann, Mustafa Mert Çelikok, Melih Kandemir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人如何在混乱且不可预测的世界中导航。为了做好这件事,机器人需要两种超能力:它必须能够将大量的感官数据(如视觉和听觉)组织成有用的信息,并且它必须能够进行长远的规划,以做出明智的决策。几十年来,强化学习 (Reinforcement Learning, RL) 一直是教机器如何进行规划的主流方法。可以将强化学习想象成一名通过试错来学习的学生,通过猜测哪些行动能带来最佳回报,从而实现得分最大化。然而,这个学生通常效率低下;它需要尝试数百万次才能学会,并且当世界复杂到无法在脑中完美模拟时,它就会感到力不从心。

主动推理 (Active Inference) 理论应运而生,这一理论的灵感源于生物大脑的工作方式。不同于仅仅进行猜测,大脑被视为一台预测机器,不断尝试最小化其所经历事物的“惊奇度”(surprise)。它通过想象不同的未来,并选择那个感觉最“确定”或最不令人意外的未来来进行规划。虽然这听起来功能强大,但传统的主动推理一直处于困境之中:它通常要求机器人先构建一个关于世界运作方式的完美且详细的模型(即“世界模型”)。构建这些地图在计算上非常昂贵,且在处理复杂任务时往往是不可能的。科学家们一直在追问的问题是:我们能否在不承担构建完美世界模型这一沉重负担的前提下,获得主动推理那种智能的规划能力?

本论文介绍了一种名为分布主动推理 (Distributional Active Inference, DAIF) 的新方法,它回答了这个问题:“可以”。研究人员提出了一个巧妙的捷径。DAIF 不再试图精确预测下一步会发生什么(例如特定的温度或位置),而是专注于同时预测整个可能未来的范围及其概率。他们称之为“分布式”学习。想象一下,与其猜测明天是否会下雨,不如学习完整的天气预报:20% 的概率是细雨,50% 的概率是晴天,以及 30% 的概率是暴风雨。通过学习这种可能性的全景图,机器人无需了解控制降雨的精确物理定律,也能进行有效的规划。

论文指出,通过将分布式学习的“全景图”方法与主动推理的“最小化惊奇度”逻辑相结合,机器人可以学习得更快、更高效。作者在计算机模拟中测试了这一想法。在简单的网格世界游戏中,他们发现他们的新方法 DAIF 能够解决其他方法无法解决的问题,尤其是在问题变得更难且需要更远期预判时。在涉及软体机器人和基于视频控制的更复杂、更接近现实世界的模拟中,DAIF 始终优于当前最先进的方法,能够以更少的尝试次数学会控制这些系统。结果表明,这种方法允许智能体在计算能力有限的情况下处理复杂的环境,就像人类大脑一样,通过高效地组织信息而非通过暴力破解来构建完美的现实模拟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →