← 最新论文
🤖 machine learning

Link Prediction or Perdition: the Seeds of Instability in Knowledge Graph Embeddings

本文揭示了高性能知识图谱嵌入模型在随机种子和超参数配置方面存在显著的不稳定性,这对当前基于排名的评估指标的可靠性以及链路预测结果的鲁棒性提出了挑战。

原作者: Guillaume Méroué, Fabien Gandon, Pierre Monnin

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Guillaume Méroué, Fabien Gandon, Pierre Monnin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《知识图谱嵌入中的预测还是败絮:不稳定性之源》(Link Prediction or Perdition: the Seeds of Instability in Knowledge Graph Embeddings)的解析,通过简单的概念与日常类比进行了拆解。

大局观:这个“魔力水晶球”问题

想象你拥有一部庞大但不完整的百科全书(知识图谱)。它知道“巴黎是法国的首都”,但不知道某个特定国家的现任总统是谁。

为了填补这些空白,科学家使用知识图谱嵌入模型(KGEMs)。你可以把这些模型想象成魔力水晶球。你问水晶球:“谁是总统?”它会查看它所知道的所有事实,进行一些复杂的数学运算,然后预测出答案。

论文指出,虽然这些水晶球在平均意义上能得到“正确”的答案,但在处理具体细节时却极其不可靠。如果你向同一个水晶球询问同一个问题两次,但通过投硬币来决定启动过程的方式(即“随机种子”),你可能会得到两个完全不同的候选名单,尽管水晶球声称两次都同样自信。

核心问题:“分数相同,故事不同”

在机器学习领域,我们通常用一个单一的分数来衡量这些模型,例如 MRR(平均倒数排名)。你可以把这个分数看作是成绩单上的等级

  • 论文的发现: 如果你用不同的随机种子训练一个模型五次,它们都能拿到“A”(高 MRR 分数)。
  • 陷阱在于: 尽管它们都拿到了“A”,但它们给出的具体答案却完全不同。

类比:餐厅评论
想象三位美食评论家(模型)在评价一家餐厅。

  • 评论家 1、2 和 3 都给这家餐厅打了 5 星好评(高 MRR 分数)。
  • 然而,当你询问他们最喜欢的 3 道菜时:
    • 评论家 1 说:牛排、沙拉、汤。
    • 评论家 2 说:披萨、塔可、寿司。
    • 评论家 3 说:汉堡、薯条、冰淇淋。

如果你是一名仅根据 5 星好评来决定点什么的顾客,你会认为他们达成了一致。但实际上,他们推荐的食物完全不同。如果你是一名试图寻找疾病治疗方案的医生(论文中提到的一个现实应用场景),因为一次随机的硬币投掷而得到一份“汉堡”而不是“药物”的清单,这是非常危险的。

调查研究:是什么导致了混乱?

作者们像侦探一样,试图找出这些模型为何会改变主意。他们隔离了训练过程中的“随机成分”:

  1. 初始化(Initialization): 模型如何开启它的“大脑”(类似于通过掷骰子来设定初始权重)。
  2. 三元组排序(Triple Ordering): 模型阅读事实的顺序(类似于从第 1 页读到第 100 页,还是从第 100 页读到第 1 页)。
  3. 负采样(Negative Sampling): 模型如何学习什么是“错误”的(类似于老师给你错误的答案以进行纠正)。
  4. Dropout: 在训练期间随机关闭模型的部分“大脑”(类似于学生在考试时闭上一部分眼睛)。
  5. 硬件(Hardware): 运行模型的实际计算机芯片(GPU)。

令人震惊的发现:
论文发现,仅仅改变其中一种成分就足以导致巨大的不稳定性。

  • 类比: 想象你在烤蛋糕。如果你更换了面粉的品牌、烤箱的温度,或者改变了搅拌鸡蛋的顺序,你最后得到的蛋糕可能味道一模一样(相同的 MRR 分数),但质地或形状却完全不同。
  • 硬件的转折: 他们甚至发现,使用不同品牌的计算机芯片(GPU)所造成的混乱程度,与改变随机种子的程度相当。这意味着,如果你在一个模型在纽约训练,然后在东京的电脑上运行它,即使你使用了完全相同的代码,你也可能会得到不同的结果。

“投票”修复法:有效吗?

作者测试了一种常见的解决方案——投票法(Voting)。这就像是询问五位不同的评论家谁的菜品最好,然后取其多数意见。

  • 结果: 投票法确实有一点帮助。它让模型变得稍微一致了一些。
  • 局限性: 它并没有完全解决问题。模型在许多细节上仍然存在分歧。此外,训练五个模型而不是一个模型,需要花费更多的时间和金钱。

底层逻辑:性能 \neq 稳定性

最重要的启示是:高分并不保证可靠性。

  • 旧方式: “这个模型的得分最高,所以它是最好的。”
  • 新现实: “这个模型的得分很高,但它是一场赌博。今天它可能会给你正确的答案,明天它可能会给你一个完全不同的(但同样‘高分’的)答案。”

论文结论认为,我们不能只盯着“成绩单等级”(MRR)看,而应该开始检查模型是否具有稳定性。如果我们使用这些模型来做出现实世界的决策(如寻找药物治疗或完善知识库),我们需要知道模型是否不会在每次运行时都在进行随机猜测。

一句话总结

仅仅因为一个知识图谱模型在测试中获得了高分,并不意味着它是值得信赖的;训练过程中微小的随机变化会导致它给出完全不同的答案,这使得将其用于重要决策时具有风险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →