← 最新论文
🤖 AI

GRATE: Temporal Extensions for Inductive KG Foundation Models via Gated Rotary Attention

本文介绍了 GRATE,一种使用门控旋转注意力机制的无参数时间编码方法,该方法使知识图谱基础模型能够在不相交的时间数据集之间实现归纳迁移,并通过新构建的具有非重叠实体、关系和时间戳的基准测试进行了验证。

原作者: Jiaxin Pan, Osama Mohammed, Daniel Hernández, Steffen Staab

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaxin Pan, Osama Mohammed, Daniel Hernández, Steffen Staab

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的侦探,他可以通过观察一张由人物、地点和事物构成的巨大连接图谱来破解谜题。这个被称为“知识图谱基础模型”(Knowledge Graph Foundation Model)的侦探非常了不起,因为即使面对从未见过的名字或关系类型,他也能够发现新的联系。这就像是一个侦探,仅仅通过观察互动的模式就能识别出“友谊”或“敌对”,而不需要死记硬背世界上每一个名字。

但问题在于,现实生活是发生在时间里的。1974年两位总统之间的会面,与2024年两位的会面是非常不同的,即便它们的图谱结构看起来一模一样。旧的侦探们(现有的模型)受困于过去;他们把1974年的一个事实和一个2024年的事实视为同等重要,或者每当新的一年到来时,他们都需要从头开始重新训练。他们无法处理时间的流动。

于是,GRATE(用于时间编码的门控旋转注意力机制)登场了。你可以把 GRATE 想象成为这位侦探配备的一副神奇、隐形的“时间眼镜”升级版。它并没有给侦探的大脑增加任何沉重的负担(可学习参数),而是改变了侦探“观察线索的方式”。

GRATE 的工作原理:时间旋转与过滤器

GRATE 使用两个聪明的技巧让侦探具备时间感知能力:

  1. 时间旋转(旋转编码/Rotary Encoding): 想象侦探发现的每一个线索都是一个旋转木马。如果一个线索发生在很久以前,GRATE 会让那个木马旋转很多圈;如果它发生在昨天,GRATE 则会让它只旋转一点点。这种“旋转”是基于线索与问题之间的时间差异,而不是日历上的具体日期。这意味着侦探可以理解,2024年的一次会面比1974年的会面更“接近”2024年的问题,即使侦探从未见过2024年这个年份。它将时间转化为一种平滑、连续的旋转,而不是一个僵化的日期列表。

  2. 智能过滤器(查询条件门控/Query-Conditioned Gating): 仅仅因为一个线索在时间上很接近,并不意味着它是正确的。如果你问:“美国总统在2024年见了谁?”,那么一次与体育明星的会面可能在时间上很接近,但并不相关;而一次与外国领导人的会面则是至关重要的。GRATE 就像是一个俱乐部的保镖。它观察问题(查询)和旋转中的线索,然后决定:“是的,这个线索相关,让它进来,”或者“不,这个线索跑题了,把它拦住。”这个过滤器非常聪明,它不需要被教导什么是“相关”,它能根据问题本身实时判断。

大考:它能应对未知吗?

作者不仅仅是构建了这个模型,还让它经历了一场严苛的障碍赛。他们创建了特殊的测试集,称为 GDELTINDTWIKIINDT。这些是“终极考试”,侦探需要处理涉及从未见过的的人物、关系和日期的谜团。这是终极的“零样本”(zero-shot)测试:没有作弊,无需重新训练,只有纯粹的逻辑。

结果令人印象深刻。当侦探使用 GRATE 时:

  • 在标准测试(如 ICEWS14)中,与没有配备“时间眼镜”的侦探相比,它的准确度(MRR)提升了约 25% 到 38%
  • 在“从未见过”的测试中,它始终优于旧方法。例如,在 GDELT 数据集上,加入 GRATE 使插值预测(在已知时间范围内进行猜测)的分数提升了 0.16 到 0.21 点,使外推预测(向未来进行猜测)的分数提升了 0.12 到 0.18 点。
  • 即使与使用文本进行猜测的巨型语言模型(LLMs)相比,GRATE 也能独当一面,在某些特定指标(如 ICEWS18 上的 Hits@10)上甚至超越了它们。

GRATE 不是什么

了解 GRately 的局限性也很重要。作者明确指出:

  • GRATE 并不是解决所有时间问题的万灵药。它在有大量线索可供选择时效果最好。在数据非常稀疏的数据集(如 WIKI,其中的事实是孤立且稀少的)中,“保镖”没有足够的证据做出明智的选择,因此提升幅度较小。
  • 并没有显式地模拟复杂的日历特性,如“闰年”或不规则的时间间隔。它将时间视为简单的数字差异。如果时间步长过于粗糙或混乱,其效果会减弱。
  • 论文并未声称这是所有未来 AI 的“终极解决方案”。他们建议,将此技术与更快速、更具扩展性的数据处理方式相结合,是未来研究人员的工作。

总结

这篇论文表明,通过为现有的 AI 侦探添加这种“时间旋转”和“智能过滤器”,我们可以让它们理解时间的流动,而无需死记硬背历史上的每一个日期。这是一种轻量级的、无需额外参数的升级,让这些模型能够将其知识迁移到全新的、未知的时空和事件中。作者通过多个数据集测量了这一点,并发现,在大多数情况下(尤其是旧模式不再重复的情况下),GRATE 能帮助模型更清晰地洞察未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →