← 最新论文
💬 NLP

GPTKB 2.0: Browsing, Querying, and Auditing a Disambiguated LLM-Derived Knowledge Base

本文介绍了 GPTKB 2.0,这是一个基于 Web 的演示系统,它展示了一个源自大型语言模型的大规模、消歧后的知识库,使用户能够浏览、查询并审计 160 万个规范实体中的 3840 万个三元组,同时能够完全透明地了解其上下文引导的消歧过程及事实溯源。

原作者: Yujia Hu, Tuan-Phong Nguyen, Simon Razniewski

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yujia Hu, Tuan-Phong Nguyen, Simon Razniewski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大的、混乱的图书馆,每一本书都由不同的作者编写,有时两本书甚至拥有完全相同的书名,却讲述着截然不同的故事。在人工智能的世界里,“大语言模型”(LLMs)就像是读遍了这座图书馆几乎所有书籍的超级聪明图书管理员。它们能够回答问题、编写故事并解决问题,因为它们已经记住了所有这些文本的模式。然而,这里有一个陷阱:这些 AI 图书管理员并不总是知道你所说的“慕尼黑”(Munich)究竟是指哪一个——是著名的德国城市,还是 2005 年的那部电影。它们还可能把“纽约”(New York)和“大苹果”(The Big Apple)视为两个完全不同的地方,尽管它们其实是同一个地方。这种困惑被称为“歧义消除”(disambiguation)问题。多年来,科学家们一直试图将 AI 杂乱无章的内部记忆转化为一张清晰、有序的事实地图,但这就像是在尝试整理一堆没有包装盒上图片的混合拼图碎片。

现在,一个研究团队构建了一个名为 GPTKB 2.0 的新工具来解决这个分类问题。你可以把它想象成一本由 AI 为自己构建的、具有神奇自我修正能力的百科全书,但它有一个特别之处:它不仅列出事实,还保留了一份关于它如何判定什么是事实、什么是错误的详细日记。它不再只是简单地说“慕尼黑是一个城市”,而是会询问:“哪个慕尼黑?欧洲的那个,还是电影里的那个?”然后为每一个分别创建清晰的条目。它还能意识到“大苹果”和“纽约市”是同一件事,并将它们合并为一个完美的条目。其结果是一个包含关于 160 万个独特事物的 3800 多万条事实的庞大且有序的数据库。然而,真正的魔力不仅在于规模,更在于透明度。研究人员创建了一个网站,任何人都可以观察 AI 的大脑内部,查看它向自己提出了哪些具体问题,观察它是如何决定合并或拆分事实的,甚至可以用通俗易懂的英语向它提问。它将 AI 隐藏的知识转化为了一个公开、可检查的藏宝图,你可以探索、查询并信任它,因为你可以看到每一个事实是如何被发现的。

核心理念:一个自我修正的 AI 百科全书

本文的核心是构建 GPTKB 2.0,这是一个完全构建自大语言模型“大脑”的庞大知识库(一个结构化的事实集合)。与以往那些仅仅抓取出现词汇的旧方法(这会导致像“城市中的慕尼黑”和“电影中的慕尼黑”这类同形异义词产生混淆)不同,这个新系统会在运行过程中进行歧义消除。它就像一个侦探,每当它发现一个新事实时,都会询问:“这到底是谁?”并在记录下来之前检查上下文。

论文展示了一个网页演示版,使这一过程完全可视化。你可以浏览数据库,追踪事实之间的链接,而且最重要的是,你可以审计每一个事实的“溯源性”(provenance)。这意味着你可以看到 AI 看到的表面词汇、它考虑过的候选匹配项,以及它做出合并两个名称(同义词)或保持它们独立(同形异义词)的具体决策。

工作原理:递归侦探

GPTKB 2.0 的构建是一个递归的、由上下文引导的流水线。想象一下 AI 从一个单一的种子实体开始,比如“布达佩斯”(Budapest)。它向 LLM 请求关于布达佩斯的事实。当 LLM 回复一个新的对象,例如“慕尼黑”时,系统并不会直接写入“慕尼黑”。它会查看句子:“布达佩斯有一个姐妹城市,慕尼黑。”它知道这是指那座城市,而不是那部电影。

该过程包含四个主要步骤:

  1. 提取(Elicitation): AI 根据特定的实体及其描述向 LLM 请求事实。
  2. 命名实体识别(NER): 它判断一个新词是一个字面上的数字还是一个现实世界的实体。
  3. 歧义消除(Disambiguation): 这是重头戏。系统将新提到的内容与数据库中现有的条目进行比较。如果上下文与现有的“布达佩斯”相匹配,它就会链接到该处。如果这是一个新的“慕尼黑”(电影),它会创建一个新的 ID。
  4. 整合(Consolidation): 它将同义的名称(如“大苹果”和“纽约市”)合并为一个统一的标准条目。

论文明确反对使用“表面字符串”(仅名称)作为标识符的旧方法。他们表明,如果没有上下文,表面字符串会以两种方式失效:它们会混淆同形异义词(将不同的事物视为同一个),也会碎片化同义词(将同一个事物视为不同的事物)。GPTKB 2.0 通过使用“提取三元组”(即该事实来源的句子)和现有实体的描述作为上下文来做出正确的判断,从而拒绝了这种做法。

数据规模:一张宏大且干净的地图

这个项目的规模令人震惊。论文报告称,GPTKB 2.0 包含:

  • 3840 万个三元组(以“主语-谓语-宾语”形式呈现的事实)。
  • 160 万个规范化实体(经过歧义消除的独特事物)。
  • 207,633 个整合关系(连接的类型)。
  • 66,523 个整合类别(事物的分类)。

有趣的是,与 Wikidata 等现有数据库相比,其中约 36.8% 的实体是世界上全新的,这意味着 LLM 发现了此前未存在于结构化数据库中的事实。

Web 界面:透明度即功能

这篇论文最独特的部分是位于 https://gptkb.org/ 的 Web 界面。它不仅仅是一个搜索引擎;它是进入 AI 推理过程的“玻璃盒”。

  • 可追溯的决策: 如果你点击像“海德公园”(Hyde Park)这样的实体,你可以看到系统是如何判定它是伦敦的海德公园而非其他地方的。你可以看到 AI 考虑过的候选名单,以及它拒绝其他选项的原因。
  • 同义词合并: 如果你点击“大苹果”,界面会显示它已被合并到“纽约市”。你甚至可以点击查看 AI 用来做出该决定的特定提示词(prompt)。
  • 实体链接: 你可以输入自己的文本,系统会将文本中的名称链接到 GPTKB 2.0 中的正确条目。例如,如果你写关于“水星”(Mercury)的内容,系统会根据你句子的上下文,正确地将“水星”链接到行星,或将“墨丘利”链接到罗马神。
  • 查询: 你可以用普通英语提问(例如“布达佩斯以什么闻名?”),系统会将其转化为结构化数据库查询(SPARQL)来获取答案。它会向你展示它运行的确切查询以及采取的步骤。

我们有多确定?(评估)

作者不仅构建了它,还对其进行了严格测试。他们手动检查了数据样本,以查看 AI 是否犯错。

  • 合并精确度: 当系统判定两个名称是同一件事(同义词)时,对于相同标签的对象,其准确率达到了 98%;对于不同标签的别名,准确率为 91%。主要的错误模式是错误合并(认为两个不同的事物是同一个),这在特定的别名案例中发生了约 9%
  • 拆分精确度: 当系统判定两个事物是不同的(同形异义词)时,在它保持独立的同标签对样本中,准确率达到了 100%
  • 事实性: 在检查事实是否真实时,经人工检查的三元组中有 94.5% 是“真实的”,只有 2.0% 是“虚假的”。当 AI 评审员检查 1,000 个项目时,92.8% 是真实的。

论文指出,上下文(实体的描述)至关重要。在一个实验中,当 AI 评审员看不到实体的描述时,事实的准确性显著下降(从 94.5% 的真实率降至 80%),这证明了上下文正是让歧义消除发挥作用的关键。

它不是什么

需要注意的是,这篇论文并未声称 GPTKB 2.0 是完美的,也没有说它已经完全解决了 AI 幻觉问题。作者承认,错误的同义合并(因为看起来相似而将两个不同的事物合并)仍然是最大的残留错误。他们还澄清这是一个“通用领域”知识库,这意味着它涵盖了广泛的主题,但并不是专门的医疗或法律数据库。其结果是基于人工和自动抽样,而不是对全部 3800 万个事实进行的逐一检查,因为后者是不可能的。

总结

GPTKB 2.0 迈出了重要的一步,因为它将 LLM 知识的“黑盒”转变成了“玻璃盒”。通过构建一个在构建过程中进行实体歧义消除并记录每一次决策的数据库,研究人员创造了一个不仅规模巨大且有用,而且可审计的资源。你可以信任这些事实,因为你可以看到它们背后的证据。这表明,只要我们愿意投入精力去检查上下文并保留详细的决策日记,我们就可以从 AI 模型混乱、非结构化的知识中构建出结构化、可靠的知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →