想象一下,你正在教一个机器人如何成为一个乐于助人的室友。机器人需要回答诸如“鲍勃的笔记本电脑在哪里?”或“人们通常把笔记本电脑放在哪里?”之类的问题。
为了做好这一点,研究人员构建了一个拥有模仿人类记忆的大脑的机器人,但有一个转折:他们不只是存储原始数据,而是将机器人的大脑组织成三个截然不同的“房间”,每个房间都使用知识图谱(将其想象为一个巨大的、相互关联的事实与关系网络)。
以下是机器人记忆的工作原理,分解为简单的概念:
1. 三个记忆房间
机器人有三个特定的地方来存储信息,就像人类一样:
- 短期房间(“工作台”):
这是一个微小、快速的空间,机器人用它来存放它刚刚看到的最新事物。这就像你刚把邮件带进来时放在厨房台面上的地方。它的空间非常有限。如果它满了,机器人必须决定如何处理台面上最旧的那件物品。
- 情景房间(“相册”):
这是用来存储具体的、个人的故事。它记得谁在何时、何地做了什么。
- 示例:“周二下午 2 点,鲍勃把他的笔记本电脑放在了书桌上。”
- 这就像一本相册,每张照片都附有日期和名字。
- 语义房间(“百科全书”):
这是用来存储通用世界知识的。它忘记了“谁”和“何时”,只保留一般事实。
- 示例:“笔记本电脑通常可以在书桌上找到。”
- 这就像一本字典或百科全书。它不在乎鲍勃是谁;它只知道一般规则。
2. 机器人的重大决策
这篇论文的核心挑战是教导机器人如何管理它的短期房间。
每当机器人看到新事物时,它都会将其放在“工作台”上。当工作台满了时,机器人必须对最旧的那件物品做出瞬间决定:
- 扔掉它(完全遗忘)。
- 放入相册(将其保存为特定事件的记忆)。
- 放入百科全书(将其转化为一般规则)。
研究人员使用了一种称为深度 Q 学习的技术(一种通过试错来学习的人工智能)来教导机器人哪种选择能带来最佳结果。每当机器人正确回答问题时,它都会获得一个“奖励分”。随着时间的推移,它学会了某些事情属于相册(比如鲍勃的笔记本电脑此刻在哪里),而另一些事情属于百科全书(比如笔记本电脑通常在哪里)。
3. 测试:“房间”
为了测试这一点,研究人员创建了一个名为“房间”的虚拟世界。
- 想象一个有 64 个人和 16 种不同物体(如笔记本电脑、碗、汽车)的房间。
- 这些人按照自己的习惯移动物体。有时他们会把东西放在合乎逻辑的地方(把碗放在橱柜里),有时则放在奇怪的地方(把碗放在衣柜里)。
- 机器人四处游荡,一次窥视一个人。它看到一个物体移动,然后被问到一个问题:“爱丽丝的碗在哪里?”
- 如果机器人记得正确,它就得分;如果它忘记了,就得零分。
4. 他们的发现
实验揭示了一些有趣的结果:
双重力量: 同时拥有“相册”和“百科全书”的机器人,其表现远优于只拥有其中之一的机器人。它可以使用相册处理具体问题(“鲍勃的笔记本电脑在哪里?”),并使用百科全书处理一般问题(“笔记本电脑通常放在哪里?”)。
“预训练”优势: 研究人员测试了两类机器人:
- 白板: 从一个空的百科全书开始。
- 知识渊博者: 从一个已经填满了常识事实(来自名为 ConceptNet 的数据库)的百科全书开始。
“知识渊博”的机器人学得更快,得分更高。它意识到:“我已经知道一般规则了,所以我不需要浪费百科全书的空间去重新学习它们。我应该专注于在我的相册中保存具体的、奇怪的事件。”
“白板”机器人试图从头开始学习一般规则,有时会犯错(比如认为笔记本电脑放在厨房里),这导致它失分。
5. 结论
这篇论文证明,赋予机器一种类似人类的记忆结构——将具体事件与一般事实分开——使其在变化的环境中回答问题时变得更加聪明。
机器人学会了一种“记忆管理策略”:它明白自己不应该试图永远记住所有事情。相反,它学会了要有选择性,将最有用的通用事实放在一个地方,将最重要的具体故事放在另一个地方,同时放下其余的内容。
简而言之: 机器人学会了,要变得聪明,就需要区分“今天发生在鲍勃身上的事”和“世界通常是如何运转的”,并且需要为每种情况准备不同的文件柜。
技术摘要:具备短期、情景和语义记忆系统的机器
问题陈述
当前的机器学习智能体(包括搜索引擎和虚拟助手)擅长检索事实性常识知识(语义记忆),但缺乏回忆特定过去事件或个人经历(情景记忆)的能力。此外,标准的强化学习(RL)智能体通常在部分可观测性和灾难性遗忘方面面临困难。作者认为,模仿人类显式的记忆架构——特别是通过短期缓冲介导的语义记忆(通用世界知识)与情景记忆(个人、有时限的经历)之间的区分——可以使智能体更好地管理有限的记忆容量,并更有效地回答多样化的问题。
方法论
环境:“房间”
为了验证这一假设,作者设计了一个与 OpenAI Gym 兼容的离散事件仿真环境。
- 设置:该环境包含 Nhumans(64 个)、Nobjects(16 个)和 Nlocations(28 个)。人类遵循固定的例行程序,将物体放置在“常识性”(例如,碗放在橱柜上)或非常识性的位置,概率为 pcommonsense=0.5。
- 观测:智能体部分观测环境,每次观察一个人。观测被记录为四元组 $(h, r, t, timestamp)$,分别代表头实体、关系、尾实体和时间戳。
- 任务:在每一步,智能体被要求回答一个形式为三元组 (h,r,?) 的问题。正确答案奖励 +1;错误答案奖励 0。每个回合持续 128 步。
记忆架构
该智能体被建模为具有三个不同的记忆系统,每个系统均表示为知识图谱(KG):
- 短期记忆 (Mo):一个有界缓冲区,最初将所有观测存储为四元组 $(h, r, t, timestamp)$。
- 情景记忆 (Me):一个有界长期记忆,存储特定的、有时限的事件,形式为四元组 $(h, r, t, timestamp)$。
- 语义记忆 (Ms):一个有界长期记忆,存储通用事实,形式为四元组 $(h, r, t, strength)。此处,h被泛化(例如,“笔记本电脑”而非“鲍勃的笔记本电脑”),strength$ 表示存储的频率。
记忆管理策略:
当短期记忆已满时,智能体必须决定最旧观测的命运。它有三个动作可选:
- 遗忘:完全丢弃该观测。
- 存储至情景:将观测移至 Me。
- 存储至语义:将观测移至 Ms(泛化实体并增加强度)。
检索策略是确定性的且基于规则(算法 1):
- 对于特定问题,智能体首先检查 Me 中最近的相关事件。
- 如果不存在情景匹配,则检查 Ms 中强度最高的相关通用事实。
- 如果两者均未给出答案,则智能体回答该问题失败。
学习算法
记忆管理策略(决定存储位置或是否遗忘)是使用深度 Q 学习 (DQN) 学习的。
- 状态表示:状态 s 由 Mo、Me 和 Ms 的当前内容组成。
- 输入处理:为了将知识图谱输入神经网络,作者将记忆转换为知识图谱嵌入 (KGE)。四元组按顺序排序(情景/短期记忆按时间戳,语义记忆按强度)并进行嵌入。对于涉及人类的情景/短期记忆,在嵌入前将人类姓名和物体名称连接起来,以捕捉个体特征。
- 网络架构:Q 网络利用 LSTM 层处理记忆嵌入序列,随后通过多层感知机 (MLP) 输出三个动作的 Q 值。
- 训练变体:训练了两种类型的智能体:
- 语义从零开始 (Semantic Scratch):从空的语义记忆开始。
- 语义预训练 (Semantic Pretrained):从 Ms 中预填充的通用世界知识(来自 ConceptNet)开始。
主要贡献
- 显式记忆建模:本文受认知科学理论(Tulving 1983, 1985)启发,明确建模了一个具有短期、情景和语义记忆系统的智能体,每个系统均构建为知识图谱。
- 新颖环境:发布了“房间”,这是一个定制的强化学习环境,旨在测试智能体在部分可观测条件下编码、存储和检索记忆以回答问题能力。
- 习得的记忆管理:证明了基于 DQN 的智能体可以成功学习管理记忆的策略(在遗忘、情景存储或语义存储之间做出选择),以最大化回报。
结果
实验在不同记忆容量下进行(总容量 ∣Me∣+∣Ms∣ 范围从 2 到 64)。
- 性能与基线对比:同时具备情景和语义记忆系统的智能体显著优于三个基线:(1) 仅情景记忆,(2) 仅语义记忆,以及 (3) 随机动作选择。表现最佳的智能体(带有预训练语义记忆的 RL)在 128 分中获得了 116.5 的平均总奖励,而“从零开始”版本为 109.1,基线得分更低。
- 预训练的影响:“语义预训练”智能体比“语义从零开始”智能体学习得更快,并收敛到更高的最优值。预训练智能体学会了保留其初始通用知识,仅将特定的、不可泛化的事件存储到情景记忆中。相反,从零开始的智能体试图从头学习通用知识,偶尔会犯错(例如,错误识别火车的位置),从而降低了其最终奖励。
- 容量扩展:
- 仅情景智能体随容量增加表现出线性提升,当容量达到 64 时,最终能回答所有 128 个问题。
- 仅语义智能体在低容量下表现良好,但一旦容量超过 32,性能便趋于平稳(约 92 分奖励),因为通用知识三元组已足以应对该任务。
- 组合智能体利用两个系统实现了最高的整体性能。
意义与主张
本文主张,为机器配备类人的显式记忆系统,使其能够在需要通用知识和特定事件回忆的环境中,优于不具备此类结构的智能体。作者强调,他们的方法通过强化学习成功学习了一种记忆管理策略,有效地决定了在不同记忆系统中遗忘什么和保留什么。
这项工作架起了认知架构(模拟人类心智理论)与现代机器学习(专注于解决部分可观测性)之间的桥梁。作者指出,虽然他们当前的环境是离散仿真,但该框架设计为可扩展至未来工作中更复杂的、多模态的场景和自然语言查询。他们得出结论,其智能体证明了在强化学习智能体中使用知识图谱来管理记忆约束并改善决策的可行性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。