When Correct Edges Cannot Be Verified: A Provenance Gap in Incomplete KGQA and a Provenance-Favoring Completion Policy
本文揭示了在不完全知识图谱问答中,文本可验证性是边正确性的一个较差的代理指标,因为普遍存在有效事实缺乏支持文本的情况,由此提出了 TGComplete,一种偏好溯源的策略,该策略优先考虑仅承认可验证的边,以确保审计性而非最大化召回率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图利用一本巨大的数字百科全书(知识图谱)和一个非常聪明但有时会产生幻觉的侦探(大语言模型)来解决一个复杂的谜题。
通常情况下,侦探会在百科全书中穿行,沿着事实的痕迹寻找答案。但有时,百科全书会缺失页面。痕迹断了,侦探就会陷入困境。
为了解决这个问题,侦探可以尝试根据自己的记忆“猜测”缺失的事实,或者去图书馆(文本)中寻找证据。核心问题在于:如果侦探在书中发现了一个提到该事实的内容,这是否意味着该事实是真的?
作者说:不一定。 以下是简单的解释。
1. “缺失页面”问题
在现实世界中,知识图谱是不完整的。想象一张城市地图,其中一些街道被擦除了。如果你的 GPS(推理模型)试图从 A 点开车到 B 点,它会撞上死胡同。
- 旧方法 (GoG): 侦探根据自己“记得”的内容直接猜测缺失的街道名称。它可能猜对了,也可能完全是幻觉。
- 新想法: 在接受猜测之前,先去图书馆(文本)看看是否有人写过那条街道。如果图书馆有一本书提到了它,我们就认为这个猜测是安全的。
2. 大惊喜:“溯源鸿沟” (The Provenance Gap)
作者通过实验进行了测试:他们拿了一张完美的地图,秘密地删除了其中 20% 到 40% 的街道,并观察发生了什么。他们准确知道哪些街道是“真实的”缺失街道,因为那是他们亲手删除的。
反直觉的发现:
他们发现,即使穷尽所有书籍进行搜索,76% 到 96% 的正确缺失街道也无法在图书馆书籍中找到。
类比:
想象你在寻找一个特定且冷门的知识点:“1994 年某个小村庄的市长是谁?”
- 事实: 这是 100% 正确的。
- 图书馆: 你搜遍了所有的报纸、传记和历史书。
- 结果: 图书馆并没有在同一句话里同时提到这位市长和那个村庄的名字。这个事实是真的,但在文本中是“隐形”的。
作者将此称为溯源鸿沟 (Provenance Gap)。
- 可验证性 (Verifiability): 我能否找到一本书说出这件事?
- 正确性 (Correctness): 这件事实际上是真的吗?
- 鸿沟: 仅仅因为你找不到一本书证明它,并不意味着它是错的。同样,仅仅因为你能找到一本书,也不保证它就是完整的真相。数据库中的大多数事实就像那位不起眼的市长——它们确实存在,但它们不会以“头实体 + 关系 + 尾实体”的形式出现在书中的单个句子内。
3. 解决方案:TGComplete(“谨慎的侦探”)
由于我们不能依赖寻找书籍来证明一个事实是正确的,作者构建了一个名为 TGComplete 的新系统。
TGComplete 不再追求完美,而是改变了目标。它问的是:“我应该将这个事实纳入我的推理,还是应该承认我没有证据?”
它是如何工作的:
- 停止: 当路径中断时,它会停下来。
- 搜索: 它在图书馆中寻找证据。
- 验证: 它检查证据是否强烈支持该猜测。
- 决定:
- 如果有强有力的证据?采纳该事实并继续前进。
- 如果没有证据?弃权(停止并说“我不知道”)。它不会进行猜测。
4. 权衡:精确率 vs. 召回率
这就是“风险管理”部分。
- 代价: 因为 TGComplete 拒绝在没有证据的情况下进行猜测,它会错过一些正确的答案。它会拒绝大约 24% 到 50% 的正确缺失事实,因为这些事实没有书籍证据。
- 收益: 然而,它所采纳的事实要可靠得多。它过滤掉了那些“虚假”的猜测。
- 神奇之处: 令人惊讶的是,尽管它拒绝了许多正确的事实,但最终答案的准确度(得到问题的正确答案)与使用猜测的方法相比保持不变。
为什么?
作者发现,大多数缺失的事实(即使是正确的那些)在因果关系上是冗余的 (Causally Redundant)。
- 类比: 想象你在解迷宫。你需要先左转,再右转,再左转。那个“缺失的事实”是第二次“左转”。
- 作者发现,在 95%–97% 的案例中,即使忽略那个特定的缺失转弯,迷宫仍然可以被解开,因为侦探的内在知识或其他路径足以到达出口。
- 因此,拒绝那个缺失的事实并没有损害最终得分,但它确实防止了侦探自信地陈述一个虚假的事实。
5. 底线
论文得出结论,我们需要改变看待 AI 中“检查”事实的方式。
- 旧观念: “如果我在文本中找不到它,那它很可能是错的。”
- 新现实: “如果我在文本中找不到它,它可能仍然是真的,但我无法证明它。”
TGComplete 是一个关于可审计性 (Auditability) 的工具。它并不承诺找到每一个正确的答案。相反,它承诺它给出的每一个答案都是有据可查的。 它用“只说我能证明的事”交换了“找到所有事”的能力。
在一个我们需要信任 AI 的世界里,这篇论文表明:拥有一个会说“我不知道”的系统,比拥有一个即便这意味着会错过一些正确猜测、却依然自信地撒谎的系统,要好得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。