Generalized Rank-based Evaluation for Knowledge Graph Completion: Perspectives, Framework, and Analyses
本文介绍了 PROBE,这是一个针对知识图谱补全的广义评估框架,它通过一种新颖的秩变换器(rank transformer)和聚合器,解决了被忽视的预测锐度(predictive sharpness)和流行度偏差鲁棒性(popularity-bias robustness)问题,从而提供了比现有指标更具理论依据且更可靠的模型性能评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在挑选最佳候选人的招聘经理。你有两名申请人:爱丽丝(Alice)和鲍勃(Bob)。
- 爱丽丝是一名“短跑选手”。她在 50% 的测试中获得第一名(排名 #1),但在另外 50% 的测试中,她垫底。
- 鲍勃是一名“马拉松选手”。他从未获得过第一名,但他每次都能稳定地排在前 5 名。
谁才是更好的员工?答案完全取决于你需要什么样的工作。
- 如果你需要一名药物研发科学家,你需要的是短跑选手。一个错误的猜测可能是危险的,所以你需要立即得到最准确的答案。你会想要惩罚鲍勃,因为他虽然通常表现不错,但没能拿到第一。
- 如果你需要一个用于电影 App 的推荐引擎,你可能会更倾向于马拉松选手。只要用户能得到前 5 名中的一个好电影,是否是第 1 选并不重要。你希望奖励鲍勃,因为他表现得非常可靠且稳定。
问题所在:旧的尺子坏了
多年来,知识图谱补全(Knowledge Graph Completion,本质上是教计算机填补缺失的事实,例如“法国总统是谁?”)领域一直使用一把单一、僵化的尺子来衡量性能。这把尺子被称为 MRR(平均倒数排名)。
论文指出,这把旧尺子是有缺陷的,因为它表现得就像它只关心短跑选手一样。它会严厉惩罚任何未能获得第一名的候选人。此外,它还忽略了一个隐藏的偏见:它喜欢那些出名的(热门的)候选人,却忽略了那些稀有但重要的候选人。
Moon、Kang 和 Ko 提出:“我们需要一把可以根据工作进行调整的新尺子。”
解决方案:PROBE(可调节的尺子)
他们引入了一个名为 PROBE 的新框架。你可以将 PROBE 想象成不是一把单一的尺子,而是一个智能的、可调节的卷尺,上面有两个旋钮。
旋钮 1:预测锐度(“严格程度”旋钮)
这个旋钮控制你对“必须是第 1 名”与“表现还不错”的重视程度。
- 调高(高锐度): 你是一个严厉的老板。如果你不是第 1 名,你会受到巨大的惩罚。这适用于医疗等高风险领域。
- 调低(低锐度): 你是一个宽容的老板。如果你在前 5 或前 10 名,你会得到一个不错的评分。这适用于推荐电影或新闻等领域。
论文显示,现有的指标(如 MRR)其“严格程度”旋钮始终处于调到最高的锁定状态。它们不公平地惩罚了那些虽然很少完美、但表现始终如一的模型。PROBE 让你可以旋转这个旋钮,以匹配你的实际需求。
旋钮 2:流行度偏差鲁棒性(“名气”旋钮)
现实世界的数据很奇特。有些事实超级常见(例如“巴黎在法国”),而有些事实则非常罕见(例如“这种特定的罕见疾病影响了这种特定的基因”)。
- 问题所在: 旧的尺子热爱常见的知识。它们通过正确回答容易的、热门的问题来获得高分,却忽略了稀有的、重要的知识。这就像一个学生因为知道“1+1=2”就拿到了 A+,却没能学会新的、复杂的科学发现。
- PROBE 的解决方法: 这个旋钮让你能够告诉尺子:“我不在乎那些著名的事实;我关心的是那些稀有的事实。”
- 如果你调高这个旋钮,尺子会为答对稀有、晦涩的事实给予更多分数,而为答对常见事实给予较少分数。
- 这有助于寻找那些真正聪明、能够发现新的、隐藏的联系的模型,而不是仅仅靠死记硬背最热门的内容。
它是如何运作的(幕后的魔法)
论文将评估过程分为三个简单的步骤:
- 预测: 计算机猜出一个答案并得到一个排名(例如,“我认为答案是第 42 位”)。
- 转换(锐度旋钮): 系统将该排名转换为一个分数。如果你想要高锐度,第 42 名会得到一个极低的分数。如果你想要低锐度,第 42 名会得到一个不错的分数。
- 聚合(名气旋钮): 系统会汇总所有分数,但会进行加权。如果问题涉及一个罕见的事实,它的权重就更高;如果问题涉及一个著名的事实,它的权重就较低。
他们的发现
作者在六个不同的现实世界知识库(例如巨大的事实数据库)上,针对六种不同的计算机模型测试了这个新尺子。
- “一刀切”的谎言: 他们发现,旧的尺子(MRR)经常选出“错误”的赢家。一个在旧尺子上看起来表现优异的模型,实际上可能在寻找稀有事实方面表现糟糕,或者在实际应用中过于不稳定。
- 流行度陷阱: 在旧尺子看来是冠军的模型,往往只是“追逐名气”的人。它们擅长回答关于热门事物的问题,但在被问及稀有、重要事物时却表现得一塌糊涂。
- 一致性: 当他们在“完美世界”(所有事实已知)与“现实世界”(事实缺失)中进行测试时,旧的尺子会感到困惑并改变判断。PROBE 则保持了一致性。 无论信息缺失多少,它都能正确识别出表现最好的模型。
核心结论
论文认为,我们不能再仅仅使用一个标准分数来评判 AI 模型了。就像你不会用一把设计用来测量短跑选手的尺子去评判马拉松选手一样,我们也不应该使用一个“严苛且崇尚名气”的指标去评判需要灵活性和公平性的模型。
PROBE 让研究人员和开发者能够说:“对于这项特定的工作,我需要一个对第 1 名要求严格的模型,”或者“对于这项工作,我需要一个能够发现稀有、隐藏事实的模型。”它让评估变得公平、灵活,并且在现实生活中真正有用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。