Online Generalised Predictive Coding
本文介绍了在线广义预测编码(ODEM),它是动态期望最大化的一种扩展,通过分离时间尺度,实现在动态环境中对潜在状态的在线推断、模型参数的学习以及不确定性估计的同步进行,并证明了即使在生成模型不匹配或混沌的情况下,该方法仍具有鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象你的大脑是一位试图实时破解谜案的侦探。每一秒,新的线索(感官数据)都会抵达,侦探必须立即更新其对正在发生之事的推测,学习游戏规则,并判断在多大程度上可以信任自己的感官。
本文介绍了一种名为ODEM(在线动态期望最大化)的新数学工具,它能帮助计算机完成侦探所做的这一切。这是一种让机器能够“猜测”周围世界隐藏成因、从错误中学习并调整其置信度的方法,且这一切都在世界持续运转的过程中完成。
以下是其工作原理的分解,辅以简单的类比:
1. 侦探的三项工作(三重估计)
大多数计算机程序试图一次只做一件事。而 ODEM 试图同时完成三件事,作者称之为“在线三重估计”:
- 追踪隐藏状态:确定事物此刻的位置(例如:“那只鸟是向左飞还是向右飞?”)。
- 学习规则:弄清楚世界是如何运作的(例如:“鸟通常沿曲线飞行,而非直线”)。
- 估计不确定性:决定在多大程度上信任数据(例如:“雾气很大,所以我的视力不可靠;我应该更信任我对鸟类飞行模式的记忆”)。
本文认为,要真正实现“在线”运作,系统不能等待看到所有数据后再做决定。它必须做出猜测,立即更新,然后进入下一秒的数据,不再回头。
2. “平滑”技巧(广义坐标)
想象你试图预测一秒钟后汽车的位置。
- 旧方法:你只观察汽车此刻的位置。如果汽车突然转弯,你的预测可能会滞后。
- ODEM 的方法:它观察汽车的位置、速度、加速度,甚至加速度变化的快慢(加加速度)。
本文将这种使用称为“运动广义坐标”。这就像一台电影摄像机,它不仅拍摄汽车的位置照片,还记录其速度以及驾驶员踩油门的力度。通过了解运动的“平滑度”,即使汽车以混乱、不可预测的方式移动,系统也能更好地预测未来。
3. 速度陷阱(时间尺度分离)
在这项“侦探工作”中,最大的挑战之一是某些事物变化很快,而某些变化很慢。
- 快:移动物体的位置(每毫秒都在变化)。
- 慢:游戏规则或空气中的噪声水平(在几分钟或几小时内变化)。
ODEM 使用了一个巧妙的技巧,称为时间尺度分离。它将“快速”更新(追踪物体)和“慢速”更新(学习规则)视为以不同速度进行的两个不同任务。
- 快速任务:像反射一样不断更新。
- 慢速任务:像学习新习惯一样偶尔更新。
这防止了系统陷入混乱。它不会在鸟每次扇动翅膀时就试图重写物理定律;只有当某种模式在长时间内持续存在时,它才会更新这些定律。
4. 测试:“错误”的地图
为了证明其系统有效,研究人员设置了一项高难度测试。
- 现实:他们使用一种名为广义洛特卡 - 沃尔泰拉(Generalised Lotka-Volterra)的数学模型创建了一个复杂、混乱的世界(可以将其想象为三种动物相互作用并争夺食物的模拟)。
- 侦探:他们给 ODEM 系统提供了一张基于完全不同的数学模型(称为洛伦兹系统,通常用于模拟天气模式)的“地图”。
通常,如果你试图用城市地图在丛林中导航,你会迷路。然而,由于 ODEM 使用了“平滑运动”技巧(广义坐标)和“速度陷阱”技巧(时间尺度分离),即使其内部地图对其所处世界的类型存在根本性错误,它仍然出人意料地很好地追踪了动物的运动。
5. 结果:更优秀的侦探
本文表明,ODEM 能够:
- 即使在世界混乱时,也能准确追踪隐藏状态。
- 随着时间的推移学习正确的“规则”(参数),即使它最初使用的是错误的规则。
- 根据数据的噪声程度调整其置信度(不确定性)。
作者得出结论,这种方法为机器提供了一种受生物学启发的实时学习和适应方式,就像人脑一样,无需在每次有新数据到达时停下来重新分析整个事件历史。
简而言之:ODEM 是一个聪明、快速学习的系统,它通过观察事物如何平滑运动来猜测未来,缓慢地学习规则,并知道何时信任眼睛而非记忆——而这一切都在世界持续运转的过程中完成。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。