Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner
本文介绍了 DG-Mem,一种受互补学习系统启发、具有双粒度特征的非参数化智能体记忆框架,它通过在线概念分类器和基于 Shapley 的上下文归因,在无需梯度更新的情况下,增强了冻结的多模态大语言模型在科学与数学推理方面的能力,并在多种基准测试中实现了持续的提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能已经达到了能够观察照片并进行描述,或阅读图表并总结其趋势的水平。这些被称为多模态大语言模型的系统在感知方面表现得非常出色。然而,当被要求解决复杂的科学问题或棘手的数学谜题时,它们往往会陷入困境。它们能看到拼图的碎片,却难以将它们组装成一个连贯的解决方案。修复这一问题的标准方法是重新训练模型,向其输入数以千计的示例,使其学习正确的模式。但这种方法有一个重大缺陷:它需要访问模型的内部代码,而这些代码通常被锁定在专有系统中,或者仅仅因为体积过大而无法在个人设备上运行。此外,如果一个模型今天解决了某个问题,标准的重新训练过程并不能保证它明天仍能记住这一教训;每一个新问题都被视为模型从未见过的第一次。
为了弥补这一差距,研究人员正在探索一种不同的策略:给人工智能一个外部记忆。与其改变模型的“大脑”,不如为它附带一个它可以阅读的“笔记本”。挑战在于要在笔记本中写下什么。如果笔记本只是过去问题及其答案的列表,模型可能会因为过于具体的细节而感到困惑。如果笔记本只是通用规则的列表,它可能缺乏理解新颖、陌生情况所需的具体案例。人类最高效的记忆系统似乎平衡了这两者的需求,既存储具体的经验,也存储从中衍生的通用原则。一种名为 DG-Mem 的新框架试图为人工智能智能体复制这种平衡,使它们能够在无需从头开始重新训练的情况下,从过去的问题中学习。
这项工作的研究人员来自加州大学默塞德分校和上海交通大学,他们构建了一个可以与“冻结模型”(即无法被更改或更新的模型)协同工作的系统。他们创建了一个记忆库,该记忆库使用一组训练问题构建一次,并在模型面临新挑战时进行调用。这种记忆被分为两个截然不同的部分,就像人类可能会同时保留一份具体事件的日记和一本通用建议的手册一样。第一部分是“范例记忆”(exemplar memory),它存储具体的、已解决的示例。这些不仅仅是旧问题的原始副本;它们是经过提炼的记录,捕捉了解决特定类型问题的逐步策略以及需要避免的具体错误。第二部分是“模式记忆”(schema memory),它包含通用的规则,以简单的“如果-那么”语句形式呈现。这些规则描述了某一类问题的底层逻辑,例如如何计算特定视觉排列中的物体数量,或如何解读数据图表,而不会陷入单个实例的细节之中。
该系统的一个关键设计选择在于如何创建这两类记忆。研究人员确保通用规则绝不是通过直接观察具体示例而生成的。相反,系统首先生成一个关于已解决问题的临时、抽象的反射(reflection)。只有从这个抽象的反射中,才会合成出通用规则。这防止了系统在无意中记住了单个问题中的特定数字或名称,并将其错误地作为普遍规律应用。例如,如果一个问题涉及计数黄色方块,系统学到的规则是“计数所有特定颜色的物体”,而不是“计数黄色方块”。这种分离使得模型能够将通用原则应用于涉及红色方块的新情境,即使它以前从未见过红色方块。
为了使该系统有效运作,研究人员还必须解决如何组织记忆的问题。在过去,系统通常依赖于固定的类别列表,如“几何”或“代数”,这些类别可能过于宽泛或过于狭窄。新系统使用一种在线分类器,随着进程构建自己的类别列表。随着系统处理新问题,它会根据潜在概念将问题归入新兴的类别中,从而使记忆能够增长并适应其遇到的特定问题类型,而无需预定义的地图。
这项工作最具创新性的方面在于系统如何决定哪些记忆片段是真正有用的。当模型检索出一组规则来辅助解决问题时,它通常会得到几个看似相关的规则。研究人员开发了一种方法来确定究竟是哪条规则对正确答案做出了贡献。他们将规则视为团队游戏中的选手,通过测试不同规则的组合来观察哪些组合能带来成功。通过分析每条规则在加入群体后对结果的提升程度,系统为每条规则分配了一个“效用得分”(utility score)。这个得分并非基于该规则看起来与当前问题的相似度,而是基于它在历史上帮助模型获得正确答案的频率。当模型面对新问题时,它会利用这个得分来优先考虑最有用的规则,从而有效地学习该信任哪些建议。
团队在四个不同的 AI 模型上测试了该框架,涵盖了从开源系统到强大的专有模型,并在三个涉及数学和科学推理的挑战性基准测试上进行了评估。结果显示出一致的改进。配备了双粒度记忆的模型比没有任何记忆的相同模型解决了显著更多的题目。它们也优于那些仅依赖单一类型存储或没有排名规则有用程度方法的记忆系统。在某些情况下,这种改进是非常巨大的,系统在某些困难测试上的正确率提升了超过 12%。
研究还表明,这两类记忆承担着不同的功能。当研究人员移除具体的范例时,系统在处理需要视觉细节的问题(例如区分圆和圆弧)时会遇到困难。当他们移除通用规则时,系统在处理需要将宽泛策略应用于新视觉设置的问题时会失败。两者的结合至关重要,这证明了系统既需要具体范例提供的落地感,也需要抽象规则提供的灵活性才能取得成功。
这种方法为在不进行大规模重训成本的情况下改进人工智能提供了一条切实可行的路径。由于该系统不需要对模型的内部权重进行任何更改,因此它可以部署在封闭系统上,甚至可以部署在对隐私和效率要求极高的个人设备上。研究人员承认该系统存在局限性,特别是在为规则分配得分时如何处理计算机计算的随机性,但结果表明,结构化的双层记忆可以显著增强人工智能的推理能力。通过将具体经验与通用原则分离,并使用衡量建议价值的方法,这一框架为人工智能智能体如何更有效地学习、进化并解决复杂问题提供了一种稳健的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。