GPTKB 2.0: Direct Construction of Disambiguated Knowledge Bases from Large Language Models
本文介绍了 GPTKB 2.0,这是一种可扩展的方法论,通过实现实体、关系和类别的即时规范化,以克服原生表示的局限性,直接从大语言模型构建出一个百万级规模的消歧知识库。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图建立一座包含世界上所有存在的实物的终极图书馆。几十年来,图书管理员(计算机科学家)一直试图通过阅读书籍和网站,剪下事实,并将它们粘贴到整齐的卡片上。但有一个棘手的问题:名称是非常混乱的。“慕尼黑”(Munich)这个词可以指德国的一个城市,也可以指一部关于间谍的电影。短语“法兰西岛”(Ile-de-France)和“法兰西岛大区”(Ile-de-France region)听起来可能不同,但它们指的其实是同一个地方。如果你的图书馆不够小心,最终会为同一个事物准备两张不同的卡片,或者因为它们共享一个名字而不小心把两个不同的事物粘在一起。
最近,一种被称为“大语言模型”(LLM)的新型“超级大脑”出现了。这些模型阅读了大量的互联网内容,以至于它们似乎无需物理书籍就能了解事实。一些研究人员想:“为什么不让这个超级大脑直接为我们建立图书馆呢?”但问题在于:超级大脑本身并没有关于事物的唯一 ID 卡列表。它只知道单词。如果你要求它列出事实,它可能会不小心为“慕尼黑城市”和“慕尼黑电影”创建重复的条目,因为它将它们视为同一个词。或者,它可能会忘记“法兰西岛”和“法兰西岛大区”是同一个地方。这篇论文介绍了一种巧妙的新方法来修复这种混乱,将超级大脑那些充满文字的回答转化为一个干净、有序且庞大的图书馆,即使每个事物都有相同的名字,也能拥有自己唯一的 ID 卡。
论文:GPTKB 2.0
这项工作的研究人员——Yujia Hu、Tuan-Phong Nguyen 和 Simon Razniewski——正在应对人工智能领域的一个重大挑战。他们想看看是否可以直接从大语言模型(LLM)中构建一个巨大的、有组织的知识库,而无需依赖像维基百科这样的现有数据库来告诉他们什么是什。
问题:“名称游戏”的混乱
把 LLM 想象成一个知识渊博但字迹潦草且没有归档系统的健谈朋友。如果你让这个朋友写下关于“慕尼黑”的事实,他可能会写道:
- “慕尼黑是德国的一个城市。”
- “慕尼黑是一部关于间谍的电影。”
如果你只是按顺序把这些写下来,你就会得到两个看起来完全一样的“慕尼黑”条目。或者,如果你的朋友说“法兰西岛”和“法兰西岛大区”,你可能会认为它们是两个不同的地方,从而制作两张单独的卡片。这被称为同名异义(homonymy,同名不同物)和同义异名(synonymy,异名同物)问题。以往利用 LLM 构建这些图书馆的尝试大多只是直接使用原词,导致了数据库中充斥着重复内容。
解决方案:“上下文侦探”
团队创建了一个名为 GPTKB 2.0 的新系统。他们并没有只是向 LLM 索取事实,而是构建了一个像侦探一样的智能流水线。其工作步骤如下:
- 种子(The Seed): 他们从一个单一的实体开始,就像在土壤中播下一颗种子(他们使用了“范内瓦·布什/Vannevar Bush”作为起点)。
- 询问(Elicitation): 他们问 LLM:“请告诉我关于 [种子] 的事实。”但他们不仅仅询问名称,还要求提供描述。因此,如果种子是“慕尼黑(城市)”,LLM 就知道只需讨论该城市,而不涉及那部电影。
- 侦探工作(Disambiguation/消歧): 当 LLM 给出一个新事实时,系统会进行检查:“等等,我们以前见过这个名字吗?”
- 如果名字是“慕尼黑”,系统会查看上下文(它所在的句子)。如果句子说“慕尼黑是一个首都”,它就会匹配到城市卡片;如果句子说“慕尼黑是一部电影”,它就会为这部电影创建一个全新的卡片。
- 如果名字是“法兰西岛大区”,系统会意识到这只是“法兰西岛”的一种华丽说法,并将它们合并到一张卡片中。
- 受控并行(Guarded Parallel): 一个接一个地做这样做速度很慢。同时做所有这些事则很有风险(在你意识到它们是同一个东西之前,你可能已经创建了两个“慕必黑”卡片)。团队发明了一种“受控”的方式来同时进行多次检查,确保在还在摸索清楚之前不会意外创建重复项。
重大成果
团队在大规模范围内运行了这个系统。他们不仅仅是做了一个小清单;他们建立了一个包含以下内容的图书馆:
- 3840 万个事实(称为“三元组”)。
- 160 万个经过消歧的唯一实体(如人物、地点和电影)。
- 207,633 个关系(事物如何连接)和 66,523 个类(事物的类型)。
特别之处在于,其中 36.8% 的实体是新增的。它们并不存在于著名的 Wikidata 数据库中。这意味着 LLM 发现了人类策划的图书馆所遗漏的东西,尤其是在那些晦涩或较冷门的“长尾”话题领域。
效果如何?
研究人员测试了他们的图书馆以检查其准确性。
- 合并(Merging): 当他们尝试合并应该是同一个东西的事物(同义词)时,准确率达到了 91%。
- 拆分(Splitting): 当他们尝试将不同的事物分开(同名异义)时,他们在测试样本中的准确率达到了 100%。
- 事实核查(Fact-Checking): 他们将随机事实与网络进行对比。大约 94.5% 的事实被证实为真,只有 2% 为假。
为什么这很重要
在此之前,大多数大型知识库都依赖于人类或像维基百科这样的现有数据库来保持有序。这篇论文表明,你可以直接从 AI 模型的“大脑”中构建一个庞大、干净的知识库,而无需预先存在的地图。它证明了,只要拥有正确的“侦探”工具,AI 就可以组织自己的知识,寻找独特的个体并理清混乱的名字,从而创建一个比我们之前构建的任何东西都更大、更详细的图书馆。
该系统现在已向所有人开放探索,这表明我们终于可以将 AI 那种混乱、充满文字的知识转化为一个结构化、可靠的世界地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。