从单个细菌到人类,每一个生命体都存在于一个不断的感知与行动的循环之中。它观察世界,处理信息,然后通过移动来改变世界,而世界的改变又反过来影响了它下次所见。这个被称为“感知-行动环”(percept-action loop)的循环,是生存与学习的引擎。几十年来,科学家们一直理解,预测未来的能力是这一循环中的强大工具。如果你能预判接下来会发生什么,你就能为此做好准备,从而节省能量并规避危险。这一理念在生物学和人工智能领域如此核心,以至于许多人认为,实现高效的最佳方式是成为一个完美的预测者,即记住过去的每一个细节,以便精准地预报未来。
然而,一项来自因斯布鲁克物理学家团队的新研究挑战了这一长期以来的信念。他们提出了一个基本问题:一个与环境互动的智能体,其能量效率的绝对极限是多少?为了回答这个问题,他们研究了信息的热力学。简单来说,热力学是研究能量如何移动和转化形式的学科。热力学第二定律告诉我们,能量既不会凭空产生,也不会凭空消失,只能发生转化,且每一个过程都会产生一些废热。当一个智能体处理信息时——比如大脑记忆一个模式或计算机计算一步走法——它必须支付能量成本。研究人员想知道,在遵守这些严格的物理定律的前提下,一个智能体能从其环境中提取多少有用的功。
该团队开发了一个数学框架,将智能体及其环境建模为相互传递信息的通道。他们定义了一个新概念,称为“功容量”(work capacity),它代表了一个智能体预期从周围环境中提取能量的最大速率。在他们的模型中,智能体不仅仅是一个被动的观察者;它积极地影响环境,而环境也会做出响应。这创造了一个反馈循环,其中智能体的行动改变了它接收到的数据本身。通过对不同类型的智能体进行模拟,他们发现了一个令人惊讶的权衡关系。在智能体的行为直接影响未来观测值的场景中,最高效的能量利用策略并不是记住一切。
研究发现,在这些交互式循环中,试图成为完美预测者的智能体,其表现反而不如那些会“遗忘”的智能体。为了在能量效率上达到巅峰,智能体必须平衡预测与遗忘。这是因为,为了做出完美预测而保留过去的每一个细节,可能会使智能体陷入一种僵化的模式,从而阻碍其产生提取能量所需的随机性。研究人员表明,在某些环境下,最擅长预测未来的智能体集合与最擅长获取能量的智能体集合是完全不同的。事实上,他们证明了在这些特定条件下,一个智能体无法同时做到既具有最大预测性,又具有最大效率。
这一发现标志着对以往理论的一次重大偏离,以往的理论通常基于“磁带设置”(tape setting)模型,即智能体只是读取一段预先存在的、不随其行为而改变的数据流。在那种被动场景下,成为一个完美的预测者确实是最有效的路径。但在现实世界中,行动会改变环境,规则便不同了。这项研究表明,在预测的驱动力与能量效率的驱动力之间,存在着一种根本性的张力。为了实现高效,智能体必须平衡其记忆,准确地知道何时该放下过去。这表明,我们在自然界或人工智能中所看到的那些看似在“遗忘”或表现出不可预测性的行为,实际上可能是一种节省能量的高级策略。这项工作为理解生物系统及未来的机器如何在宇宙严格的能量限制下运行,提供了一个全新的视角。
技术摘要:智能体的信息热力学:具有记忆通道的工作容量
问题陈述
预测未来观测值是机器学习、生物学和经济学中的一个核心范式,通常基于诸如变分自由能原理等原则。虽然被动观测(例如,智能体处理预存符号序列的“磁带设置”)的热力学极限已有深入研究,但通过感知-行动循环与环境进行交互的主动智能体的热力学意义研究仍较少。在这些循环中,智能体的行动会影响未来的感知,从而产生一种反馈机制。
本文旨在解决的核心问题是:在感知-行动循环中,适应性信息处理的能量极限是什么,以及在这些约束下应如何设计智能体? 具体而言,作者调查了在被动观测(以预测为关键)中优化做功提取的设计原则,是否同样适用于智能体主动影响环境的情况。
研究方法
作者开发了一个结合了随机热力学和隐马尔可夫模型信息论的框架。
建模框架:
- 智能体与环境: 两者都被建模为隐马尔可夫通道(具有记忆的有限状态通道)。环境通道 (νS∣Aenv) 将行动 (A) 映射到感知 (S),而智能体通道 (ηA∣Sagt) 将感知映射到行动。
- 感知-行动循环: 交互过程由智能体和环境组成的元组定义,形成一个全局随机过程。作者证明了智能体记忆、行动、感知和环境隐状态的联合过程构成了一个有限状态齐次马尔可夫链,确保了良好的渐近动力学特性(收敛至循环平稳过程)。
热力学假设(等温信息处理 - IIP):
- 信息处理被建模为一个作用于耦合到温度为 T 的热库之上的信息载体的物理协议。
- 该协议在势能景观上是等温且循环的,确保做功提取仅受限于信息处理的内在成本(熵的变化),而不受内部能量或外部控制装置变化的影响。
- 在这些假设下,逻辑操作提取的期望功 W 受限于非平衡自由能的变化,这可以简化为熵界限:W≤H(Xout)−H(Xin)。
关键指标:工作容量 (Cwork):
- 作者将做功速率定义为每轮提取功的渐近平均值:W(agtM,env)=⟨H(At∣Mt)−H(St∣Mt)⟩t。
- 工作容量定义为在给定环境通道下,所有可能的兼容智能体模型(具有有限记忆)所能达到的做功速率的上确界。它代表了智能体从环境中提取功的最大速率。
预测差距 (Predictive Gap):
- 为了分析预测的作用,作者定义了预测差距为条件互信息 I[A0:t+1S0:t;St∣Mt]。零预测差距意味着智能体的记忆包含了从过去中提取的所有相关信息,足以预测当前的感知。
主要贡献与结果
1. 工作容量的性质
作者确定了任何环境通道下工作容量的基本性质:
- 存在性: 由于底层有限状态马尔可夫链的收敛特性,工作容量是存在的。
- 界限: 0≤Cwork(env)≤log2∣S∣。
- 次可加性: 对于两个通道的级联,级联的做功容量小于或等于单个工作容量之和 (Cwork(env2∘env1)≤Cwork(env1)+Cwork(env2))。
2. 主动循环中预测与效率的背离
这是对被动观测(磁带设置)热力学的最显著发现:
- 磁带设置: 在被动设置中,做功高效的智能体必须是具有预测性的(最小化预测差距)并使行动随机化。
- 感知-行动循环: 在具有真实反馈的主动设置中,预测与做功效率可能相互排斥。
- 作者证明(定理 3),存在某些环境,使得做功高效智能体集合 (Aeff)、最大化预测智能体集合 (Apred) 以及最大熵行动智能体集合 (Amea) 是互斥的。
- 具体而言,在这些环境中,一个最大化预测的智能体为了预测未来,会保留关于其过去行动的完整信息。然而,这种信息的保留会降低智能体的行动熵 (H(At∣Mt)),而行动熵是做功速率方程中的正项。因此,预测型智能体的做功速率会比那些“遗忘”其过去行动特征的智能体更低(甚至为负)。
3. 预测与遗忘之间的权衡
在感知-行动循环中,做功高效的智能体必须在预测(最小化 H(St∣Mt))与遗忘(最大化 H(At∣Mt))之间取得平衡。
- 保留信息以预测未来感知通常要求智能体根据历史记录来约束其行动,从而降低行动熵。
- 相反,最大化行动熵(以提取功)可能会阻碍智能体学习环境的统计结构,从而增加感知的确定性。
- 最优策略通常涉及一个非零的“预测差距”,这意味着智能体会刻意遗忘过去的某些细节,以维持较高的行动熵。
4. 说明性示例
作者分析了一个具有反馈参数 r∈[0,1] 的特定环境:
- r=0(磁带设置): 环境忽略行动。在此情况下,预测型智能体是做功高效的。
- 0<r<1(主动循环): 存在反馈。数值优化显示,随着 r 的增加,最优做功高效智能体会偏离最大化预测智能体。最优智能体的预测差距表现出不连续跳跃,表明其记忆机制发生了定性变化(在不同的“设想/ansatz”设计之间切换),以平衡这种权衡。
- r=1(确定性): 环境变得完全取决于行动。此时,预测型智能体重新获得最优性。
意义与主张
本文声称提供了一个用于分析感知-行动循环中信息处理热力学的基本框架。其主要意义在于挑战了“预测总是最优”这一关于适应性系统的假设。
- 理论转向: 本文证明了在主动学习系统中,预测(最小化关于未来的不确定性)与能量效率(最大化做功提取)的目标可能存在冲突。
- 设计原则: 这表明对于在反馈丰富的环境中运行的智能体,最优设计可能需要战略性遗忘,而非最大限度的记忆保留。
- 背景: 作者将这些发现置于生物智能和人工智能的更广泛背景下,指出在这些系统中,看似在预测方面并非最优的行为(例如,刻意的遗忘)实际上可能反映了旨在最大化能量效率的底层热力学约束。
本文并未提出具体的实验设置或直接应用,而是建立了在热力学定律约束下,与环境交互的智能体的理论极限和设计原则。
每周获取最佳 nonlinear sciences 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。