← 最新论文
🤖 machine learning

A Storage-Retrieval Gap in Parametric Knowledge Graph Memory

本文表明,虽然将知识图谱编译为特定实体的 LoRA 适配器能够实现事实知识的高效、零上下文成本的参数化存储,但由此产生的权重缺乏基于语义相似度的可检索性,从而确立了对一种学习到的、以查询为条件的机制来选择并组合正确适配器的必要性。

原作者: Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Volker Tresp

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Volker Tresp

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大型语言模型是强大的工具,可以回答问题和撰写文本,但它们有一个根本性的局限:它们只知道在初始训练期间学到的知识。如果一个模型需要了解某个特定的、最新的事实——比如一部新电影的演职人员表或某件工业机械的规格参数——它通常必须在被提问的时刻被给予这些信息。实现这一目标的标准方法被称为检索增强生成(retrieval-augmented generation)。在这个过程中,系统从数据库中找到相关事实,将它们粘贴到对话中,并要求模型阅读这些内容并提供答案。虽然这种方法可行,但它有两个缺点。首先,将大量文本粘贴到对话中会占用有限的空间,即上下文窗口(context window),这会减慢速度并增加成本。其次,这需要将原始数据发送到运行模型的计算机上,如果这些数据是敏感或专有的,可能会带来安全风险。

研究人员一直在探索另一种想法:与其每次都将事实粘贴到对话中,是否可以将事实直接“植入”模型的记忆中?想象一下,模型就像一座图书馆。标准方法是在每次有人提问时递给管理员一本书。而新方法则是在询问是否可以在图书馆内为每一个主题永久安装一个特定的书架,这样管理员就可以直接取出对应的书架并从中阅读,而无需看到书本本身。这篇论文研究了这种方法对于知识图谱(knowledge graphs,即关于事物及其关系的结构化事实地图,如电影、人物及其关系)是否可行。研究人员想知道,他们能否提取这个地图的一小块,将其转化为模型内部设置的一组微小的调整,并将其存储在那里。如果成功,模型只需“穿戴”上正确的内部调整,就能在从未见过该电影数据的情况下,回答关于特定电影的问题。

团队使用一个电影信息数据集测试了这个想法。他们提取了单部电影的细节——例如导演、上映年份和演员——并将这些事实转换为文本。然后,他们使用了一种称为低秩自适应(low-rank adaptation)的技术,为每部电影训练了一组专门的、微小的权重。可以将这些权重视为一种独特的、微观的“指纹”,它能微调模型的行为,使其恰好了解该特定电影的细节。他们创建了一个由这些“指纹”组成的库,每个电影对应一个,共涵盖了150部不同的电影。关键的测试在于:当模型“穿戴”着某部电影的指纹时,即使没有向它展示该电影的文本或任何其他信息,它能否回答关于该电影的问题。

结果表明,这种方法在存储知识方面是有效的。当模型获得正确电影的指纹时,即使在测试期间从未见过该电影的数据,它也能高准确度地回答关于该电影的问题。事实上,对于像导演或上映年份这样的单一事实问题,模型的表现从几乎为零跃升到了极高的成功率。这证明了模型确实学习了这些事实,并将其存储在了自己的结构内部,而不是仅仅学会了在事实存在时进行阅读。知识是针对特定电影的:如果给模型一个不同电影的指纹,它就无法回答问题;如果给它一个随机的、未经训练的指纹,它的表现甚至比之前更差。这证实了信息确实被锁定在特定的调整之中。

然而,这项研究也揭示了一个重大障碍。虽然知识可以被存储,但却无法被轻易找到。研究人员试图通过观察问题来确定应该使用哪个指纹。他们尝试根据文本含义将问题与最相似的电影进行匹配,也尝试根据数学形状将问题与最相似的指纹进行匹配。两种方法都完全失败了。系统的表现并不比随机猜测好。原因在于知识是局部存储的,且不具备迁移性。即使两部电影非常相似——例如它们由同一位导演制作或属于同一类型——它们的指纹也是完全不同的。一部电影的指纹并不包含回答另一部电影问题的答案,即使它们在电影界是近邻。指纹之间的数学距离确实反映了电影之间的相似性,但它并不能告诉你哪个指纹持有特定问题的答案。

这造成了存储与检索之间的鸿沟。研究人员证明,你可以将知识存储在模型的权重中,而不会占用对话空间,但你目前无法在不知道需要哪一个的情况下,自动找到正确的存储单元。在一个现实世界的系统中,你仍然需要一个单独的工具来查找正确的电影名称并选择正确的指纹,但一旦完成这一步,模型就可以在无需再次看到原始数据的情况下提供答案。这为隐私和效率提供了潜在优势,因为原始数据无需在对话期间发送给模型。然而,这种方法并非解决所有问题的万灵药。它需要一次性的成本来创建指纹,且指纹所需的存储空间远大于它们所代表的文本。它最适用于那些会被频繁询问的稳定数据集,而非不断变化的信息。

研究结论指出,尽管我们可以成功地将知识图谱转化为参数化记忆,但如何针对复杂问题自动选择并组合正确的记忆片段,这一挑战仍未得到解决。对于关于单个项目的简单问题,该方法效果良好;但对于需要跨不同项目链接信息的问题,系统目前还无法判断应该组合哪些记忆。研究人员建议,下一步应当开发一种学习机制,使其能够决定使用哪些指纹以及如何将它们混合在一起,而不是依赖简单的相似性。在这一问题得到解决之前,一个携带自身事实库的模型所展现出的前景仅实现了一半:书已经在书架上了,但管理员仍然需要一本索引手册才能找到它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →