← 最新论文
💻 computer science

A Machine with Short-Term, Episodic, and Semantic Memory Systems

受人类认知科学启发,本文提出了一种配备短期、情景和语义记忆系统的深度 Q 学习智能体,这些系统被建模为知识图谱,结果表明,该结构使智能体能够在名为“房间”的定制强化学习环境中有效学习记忆管理策略,并优于不具备该架构的智能体。

原作者: Taewoon Kim, Michael Cochez, Vincent François-Lavet, Mark Neerincx, Piek Vossen

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Taewoon Kim, Michael Cochez, Vincent François-Lavet, Mark Neerincx, Piek Vossen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何成为一个乐于助人的室友。机器人需要回答诸如“鲍勃的笔记本电脑在哪里?”或“人们通常把笔记本电脑放在哪里?”之类的问题。

为了做好这一点,研究人员构建了一个拥有模仿人类记忆的大脑的机器人,但有一个转折:他们不只是存储原始数据,而是将机器人的大脑组织成三个截然不同的“房间”,每个房间都使用知识图谱(将其想象为一个巨大的、相互关联的事实与关系网络)。

以下是机器人记忆的工作原理,分解为简单的概念:

1. 三个记忆房间

机器人有三个特定的地方来存储信息,就像人类一样:

  • 短期房间(“工作台”):
    这是一个微小、快速的空间,机器人用它来存放它刚刚看到的最新事物。这就像你刚把邮件带进来时放在厨房台面上的地方。它的空间非常有限。如果它满了,机器人必须决定如何处理台面上最旧的那件物品。
  • 情景房间(“相册”):
    这是用来存储具体的、个人的故事。它记得何时何地做了什么
    • 示例:“周二下午 2 点,鲍勃把他的笔记本电脑放在了书桌上。”
    • 这就像一本相册,每张照片都附有日期和名字。
  • 语义房间(“百科全书”):
    这是用来存储通用世界知识的。它忘记了“谁”和“何时”,只保留一般事实。
    • 示例:“笔记本电脑通常可以在书桌上找到。”
    • 这就像一本字典或百科全书。它不在乎鲍勃是谁;它只知道一般规则。

2. 机器人的重大决策

这篇论文的核心挑战是教导机器人如何管理它的短期房间

每当机器人看到新事物时,它都会将其放在“工作台”上。当工作台满了时,机器人必须对最旧的那件物品做出瞬间决定:

  1. 扔掉它(完全遗忘)。
  2. 放入相册(将其保存为特定事件的记忆)。
  3. 放入百科全书(将其转化为一般规则)。

研究人员使用了一种称为深度 Q 学习的技术(一种通过试错来学习的人工智能)来教导机器人哪种选择能带来最佳结果。每当机器人正确回答问题时,它都会获得一个“奖励分”。随着时间的推移,它学会了某些事情属于相册(比如鲍勃的笔记本电脑此刻在哪里),而另一些事情属于百科全书(比如笔记本电脑通常在哪里)。

3. 测试:“房间”

为了测试这一点,研究人员创建了一个名为“房间”的虚拟世界。

  • 想象一个有 64 个人和 16 种不同物体(如笔记本电脑、碗、汽车)的房间。
  • 这些人按照自己的习惯移动物体。有时他们会把东西放在合乎逻辑的地方(把碗放在橱柜里),有时则放在奇怪的地方(把碗放在衣柜里)。
  • 机器人四处游荡,一次窥视一个人。它看到一个物体移动,然后被问到一个问题:“爱丽丝的碗在哪里?”
  • 如果机器人记得正确,它就得分;如果它忘记了,就得零分。

4. 他们的发现

实验揭示了一些有趣的结果:

  • 双重力量: 同时拥有“相册”和“百科全书”的机器人,其表现远优于只拥有其中之一的机器人。它可以使用相册处理具体问题(“鲍勃的笔记本电脑在哪里?”),并使用百科全书处理一般问题(“笔记本电脑通常放在哪里?”)。

  • “预训练”优势: 研究人员测试了两类机器人:

    1. 白板: 从一个空的百科全书开始。
    2. 知识渊博者: 从一个已经填满了常识事实(来自名为 ConceptNet 的数据库)的百科全书开始。

    “知识渊博”的机器人学得更快,得分更高。它意识到:“我已经知道一般规则了,所以我不需要浪费百科全书的空间去重新学习它们。我应该专注于在我的相册中保存具体的、奇怪的事件。”

    “白板”机器人试图从头开始学习一般规则,有时会犯错(比如认为笔记本电脑放在厨房里),这导致它失分。

5. 结论

这篇论文证明,赋予机器一种类似人类的记忆结构——将具体事件与一般事实分开——使其在变化的环境中回答问题时变得更加聪明。

机器人学会了一种“记忆管理策略”:它明白自己不应该试图永远记住所有事情。相反,它学会了要有选择性,将最有用的通用事实放在一个地方,将最重要的具体故事放在另一个地方,同时放下其余的内容。

简而言之: 机器人学会了,要变得聪明,就需要区分“今天发生在鲍勃身上的事”和“世界通常是如何运转的”,并且需要为每种情况准备不同的文件柜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →