← 最新论文
💻 computer science

Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs

该论文介绍了 GAMER,这是一个通过将历史推理建模为具有双流时序差分学习机制的以行动为中心的图,从而连接推理时扩展与情境记忆的新型框架,进而降低了计算成本并显著提高了智能体决策效率和成功率。

原作者: Xu Zheng, Chaohao Lin, Zhuomin Chen, Weijieying Ren, Haifeng Chen, Wei Cheng, Dongsheng Luo

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Xu Zheng, Chaohao Lin, Zhuomin Chen, Weijieying Ren, Haifeng Chen, Wei Cheng, Dongsheng Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人如何破解迷宫。你告诉它:“努力思考,尝试不同的路径,并且不要放弃!”这个机器人是一个大语言模型(LLM),它非常擅长思考。它可以生成很长的想法列表,比如“向左转,然后向右转,或者也许可以爬墙”。这被称为推理时缩放(inference-time scaling):在行动之前,给予机器人更多的思考时间和计算资源来进行头脑风暴。但问题在于,机器人每当遇到死胡同时,它都会忘记一切。它会以空白状态开始下一次尝试,一遍又一遍地重复同样的错误路径。这就像一个参加考试的学生,每做完一道题就擦掉整个大脑,迫使自己从头开始重新学习同样的错误。

为了解决这个问题,科学家们尝试给机器人一个记忆。通常,这种记忆只是一个巨大的笔记本,记录下机器人所做的一切。但是,阅读一本厚重的笔记本需要耗费大量的时间和精力(计算能力),而且机器人仍然需要弄清楚如何使用这些信息。核心问题在于:我们如何给机器人一种既能让它思考得更快、更聪明,又不会让它变慢或变得更昂贵的记忆?这篇论文正是通过构建一种全新的记忆方式来解决这一问题——这种记忆不仅存储故事,还绘制出实际有效的动作路径。


来认识一下 GAMER(基于图结构的以动作为中心的记忆与情景推理)。把 GAMER 想象成一个电子游戏的“作弊条”,但它不只是列出关卡,而是绘制出一张包含你做过的每一个动作的地图。

如今大多数机器人就像是在迷雾森林中的探险家。当它们需要寻找宝藏时,它们四处游荡,尝试一条路径,撞到一棵树,转身返回,然后再试一次。如果它们失败了,它们会忘记那棵树的存在。下次,它们会再次撞上同一棵树。GAMER 通过将机器人的过去变成一张活生生的地图,改变了游戏规则。

GAMER 不再记录像“我向左走,看到一只狗,然后向右走”这样的长篇故事,而是构建一个图(Graph)。想象一张地铁图,每一个站点都是机器人可以采取的具体动作(比如“拿起钥匙”或“打开门”)。连接站点的线条展示了哪些动作通常会紧随其后。如果机器人尝试“跳过墙壁”并失败了,地图上的那个站点就会被打上一个大大的红叉并贴上警告标志。如果它尝试“爬梯子”并成功了,那个站点就会获得一颗闪闪发光的绿星。

神奇之处在于一种特殊的学习技巧,叫做双流时序差分学习(Dual-Stream TD Learning)。这就像有两个教练同时给机器人提供建议:

  1. “前进”教练:这位教练观察所有机器人成功的情况。他们指向那些闪烁的绿星并说:“嘿!如果你处于这个位置,下一步尝试这个动作。这通常会导致胜利!”
  2. “停止”教练:这位教练观察所有机器人撞车的情况。他们指向那些带有红叉的站点并说:“绝对不行!如果你看到这个动作,赶紧换个方向跑。它会导致死胡同。”

通过使用这两位教练,GAMER 不仅仅是告诉机器人该做什么;它还在积极地阻止机器人把时间浪费在糟糕的想法上。这就像是一个 GPS,它不仅能显示最快的路线,还能立即封锁那些你知道正在施工的道路。

研究人员在几个具有挑战性的任务上测试了它,比如整理乱七八糟的房间(AlfWorld)或进行科学实验(ScienceWorld)。他们发现 GAMER 是一个游戏规则的改变者。与标准的“健忘型”机器人相比,GAMER 将成功率提高了 20.81%,并将进度率提高了 6.17%。这意味着机器人完成的任务更多了,即使在没完成的任务中,进展也更远了。

更酷的是,GAMER 非常高效。因为它使用的是这种智能地图而不是阅读巨大的笔记本,所以它节省了很多“Token”(AI 思考的数字货币)。事实上,与另一种智能记忆系统 A-Mem 相比,GAMER 平均减少了约 50% 的 Token 使用量。这就像是用一张清晰的图表来解谜,而不是试图记住包装盒盖子上的每一个细节。

论文表明,通过将过去的经验转化为“好动作”和“坏动作”的结构化地图,机器人可以学得更快。它们不必在面对问题时每次都重新发明轮子。然而,作者也指出,这个系统首先需要一点练习时间。机器人需要看到大约 32 次成功的尝试(一个“热身”阶段)来建立一张好的地图。如果它没有足够的练习数据,地图可能会因为过于空洞而无法发挥作用。但一旦建立了这张地图,机器人就会成为一名更高效、更成功的探险家,带着清晰的思路和可靠的向导,穿梭于复杂的难题之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →