State-Dependent Observation Noise Reintroduces Epistemic Value in Linear-Gaussian Active Inference
本文表明,在线性高斯主动推理模型中引入状态依赖型观测噪声可以恢复认识价值,因为这使得后验协方差和有效卡尔曼增益具有动作依赖性,从而在不需要乘性控制动力学的情况下,重新建立起寻求信息的驱动行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
好奇心的科学:为什么迷失方向可能是最好的学习方式
想象一下,你正在尝试教一个机器人如何在黑暗、多雾的迷宫中导航。在人工智能的世界里,有两种主要的方法来教机器如何行动。第一种是“奖励猎手”:机器人被告知,“去拿金币!”于是它会不惜一切代价去抓取奖品,忽略其他所有事物。第二种是“好奇探索者”:机器人的程序设定是想要学习、减少困惑并弄清楚自己所处的位置,即使眼前并没有金币。这种第二种行为被称为主动推理(Active Inference)。这一理论认为,智能体不仅仅是在追逐奖励,它们还在追逐信息,因为不确定性对它们的内在大脑来说是极其“昂贵”的。
长期以来,科学家们一直在使用被称为**线性高斯模型(Linear-Gaussian models)**的简单、可预测的世界来测试这个想法。你可以把这些模型想象成一个完美平滑、笔直的走廊,机器人在其中做直线运动,其传感器提供的是一张虽然略显模糊但始终如一的世界图像。在这些简单的世界里,发现了一个著名的难题:机器人的“好奇心开关”会被卡在关闭状态。无论机器人做什么,它预期能获得的各种新信息的量都保持不变。这就像一个学生认为:“无论我翻到哪一页,读这本书都不会教给我任何新知识,”因此他们停止了尝试学习,而仅仅专注于寻找正确答案。这篇论文提出了一个简单但深刻的问题:是否存在一种微小且现实的改变,可以让我们机器人的好奇心开关重新开启?
发现:当传感器具有“距离依赖性”时
本文的作者 Daniel Corva 发现了一种非常简单的方法,可以让这些“乏味”的线性机器人重新焕发好奇心。他们发现,问题不在于机器人的目标或其运动方式,而在于机器人的眼睛是如何工作的。
在旧有的、“失效”的模型中,机器人的传感器被假设为在任何地方都同样模糊。无论机器人是站在离墙很近的地方,还是在角落里远离物体,相机的模糊程度(称为噪声)都是一样的。由于模糊度从未改变,机器人意识到靠近物体并不会让它的图像变得更清晰。它没有理由为了学习而移动;它只会为了获取金币而移动。
作者提出了一个微小的调整:如果传感器的模糊程度取决于机器人的位置呢?想象一个相机,当你靠近物体时,画面变得非常清晰;而当你远离物体时,画面变得非常粗糙和模糊。这被称为状态相关观测噪声(state-dependent observation noise)。在现实世界中,这正是我们的感官工作的方式:当你靠近一个标牌时,很容易看清它;但从街对面看,它几乎无法辨认。
“双重效应”:为了看得更清而移动
当作者将这种“距离依赖型”模糊引入机器人的模型时,神奇的事情发生了。机器人突然意识到,它的行动可以改变它对未来的感知能力。
如果机器人向墙壁靠近,其传感器的噪声就会下降,它对世界的内部地图也会变得更加清晰。如果它停留在远处,地图则保持模糊。这产生了一个双重效应:机器人的动作(移动)同时完成了两件事。首先,它改变了机器人的位置(这是显而易见的部分)。其次,也是最关键的新部分,它改变了机器人对自身位置的确定性。
由于机器人现在可以选择移动到一个能学到更多信息的地点,它大脑中的“好奇项”被唤醒了。机器人开始像一个好奇的探索者一样行动。它会选择走向墙壁,不仅是因为它想触摸墙壁,还因为靠近墙壁会让它的视觉变得更清晰,从而帮助它更好地理解迷宫。
这对人工智能意味着什么
这篇论文从数学上证明了,这种微小的改变足以打破这种“卡死”的行为。在此之前,科学家们认为,在简单的直线世界中,除非让机器人的运动变得极其复杂或者改变其目标,否则好奇心是不可能实现的。这篇论文表明,你不需要改变目标或运动规则。你只需要承认:传感器会随着距离的增加而恶化。
作者不仅写下了方程,还开发了一个名为 cpomdp 的软件工具来证明这一点。他们创建了一个虚拟机器人,并展示了当给予它一个“聪明”的传感器(随距离而模糊)时,机器人会开始做出收集信息的选择。而当给予它一个“愚笨”的传感器(在任何地方都同样模糊)时,机器人便停止了好奇,仅仅跟随路径去寻找奖励。
总结
核心结论是:简单 AI 智能体的好奇心源于“你所处的位置”与“你观察世界的能力”之间的关系。 如果你的学习能力取决于你的位置,你自然会想要移动到最佳的学习点。如果你的学习能力在任何地方都一样,你就没有理由去探索。
这篇论文否定了“简单的线性机器人注定缺乏好奇心”的观点。它认为,“线性高斯坍缩”(即好奇心消亡的时刻)只有在我们假定传感器是完美且恒定不变的情况下才会发生。一旦我们承认传感器会随距离而退化,学习的驱动力就会回归。作者对此非常有信心,因为他们提供了数学证明和一个演示其原理的运行程序。他们证明了“行动即关注”——通过移动身体来集中注意力,是任何已知其传感器并不完美的智能体所具备的、天生的内置特征。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。