← 最新论文
💻 computer science

GPTKB v1.5: A Massive Knowledge Base for Exploring Factual LLM Knowledge

本文介绍了 GPTKB v1.5,这是一个通过大规模递归物化技术由 GPT-4.1 构建的、包含 1 亿个三元组的具有成本效益的知识库,它能够实现对事实性大语言模型知识的系统性探索、结构化查询和对比分析。

原作者: Yujia Hu, Tuan-Phong Nguyen, Shrestha Ghosh, Moritz Müller, Simon Razniewski

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yujia Hu, Tuan-Phong Nguyen, Shrestha Ghosh, Moritz Müller, Simon Razniewski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人,它几乎读遍了互联网上的所有内容。你知道它知道很多事实,但如果你问它:“关于埃菲尔铁塔你都知道些什么?”它可能会告诉你一些事情。如果你问:“那卢浮宫呢?”它会告诉你更多。但你完全不知道它不知道什么,或者它的知识深度究竟有多深,因为你一次只能问一个问题。这就像试图通过仅仅走过你偶然经过的点来绘制一张大陆地图。

GPTKB v1.5 是一个改变游戏规则的项目。研究人员没有一个一个地向机器人提问,而是构建了一个巨大的、互联的地图,展示了机器人(具体来说是 GPT-4.1)所知道的一切。想象一下,这就像是将一堆零散的琐事卡片变成了一个巨大的、可搜索的图书馆,其中每一个事实都与其他事实相连。

以下是他们如何做的以及他们的发现,用简单的语言解释如下:

1. “滚雪球”法(他们是如何构建它的)

研究人员并没有只是随机向机器人索要事实。他们使用了一种巧妙的“滚雪球”技术:

  • 种子(The Seed): 他们从一个特定的事物开始,比如“范内瓦·布什”(一位著名的工程师)。
  • 扩张(The Expansion): 他们问机器人:“告诉我关于范内瓦·布什你所知道的一切。”机器人给了他们一系列事实,比如“他在 X 工作”或“他发明了 Y”。
  • 连锁反应(The Chain Reaction): 机器人在这些回答中提到了新的名字(比如“X”和“Y”)。研究人员随后立即询问机器人关于这些新名字的信息。
  • 结果: 他们不断重复这个过程,进行递归式的操作,深入了 10 层。这创造了一个由 1 亿个事实(称为“三元组”)连接 610 万个不同事物组成的庞大网络。

构建整个这个图书馆大约花费了 14,000 美元的计算时间,耗时约 18 天完成。

2. 清理混乱(“整合”)

当你以不同的方式问机器人同一个问题时,它有时会给出略有不同的答案,或者对同一件事使用不同的词汇(例如,在一段话中称某人为“人类”,而在另一段话中称其为“人”)。
为了解决这个问题,研究人员运行了一个“清理”过程。他们将相似的词汇归为一类,并合并了重复的事实。这把一堆杂乱、冗余的数据变成了一个干净、有序的数据库,拥有清晰的类别。

3. 你可以用这张地图做什么?

该论文介绍了一个网站,任何人都可以通过以下三种主要方式探索这个庞大的知识库:

  • “维基百科”式探索器: 你可以点击任何项目(比如新加坡的“鱼尾狮雕像”)并查看机器人关于它的事实列表。然后,你可以点击这些事实中提到的其他人或地点,从而跳转到他们的页面,像在博物馆中漫步一样探索机器人的大脑。
  • “侦探”查询工具: 你可以使用一种名为 SPARQL 的特殊语言提出复杂的问题。例如,你可以问:“向我展示这个机器人知道的最常见的 100 种事物的类型。”机器人的地图显示,它知道得最多的是,其次是电影、公司和书籍。
    • 一个有趣的发现: 研究人员检查了机器人的知识是否公平。他们问道:“如果机器人知道‘A 嫁给了 B’,它是否也知道‘B 嫁给了 A’?”他们发现,84% 的情况下,它并不知道。 机器人的知识往往是片面的,它可能记得一段关系的其中一方,却忘记了另一方。
  • “口味测试”(对比): 你可以将不同的 AI 模型进行对比。研究人员将 GPT-4.1 与其他模型(如 Llama 和 DeepSeek)进行了比较。
    • 例子: 当被问及著名的 AI 研究员 Ilya Sutskever 时,GPT 模型给出了 40 个事实,而 Llama 模型仅给出了 14 个。
    • 陷阱: 尽管两者都弄错了他的出生日期!这表明,即使一个模型知道得更多,它们也可能犯同样的愚蠢错误。

4. 它有多准确?

研究人员并没有盲目信任机器人;他们核实了它的工作。

  • 他们随机抽取了 1,000 个事实,并根据现实世界(通过网络搜索)进行了核对。
  • 得分: 大约 75.5% 的事实是真实的。
  • 问题: 大约 19.5% 是错误的,还有一些事实过于模糊而无法验证。
  • 偏差: 由于他们是从特定的“种子”名称开始的,所以这张地图在研究人员认为应该询问的事物方面权重很高。这是一个巨大的地图,但它并不是整个宇宙知识的完整地图。

核心结论

GPTKB v1.5 是一个耗资 14,000 美元的实验,它将一个“黑盒”AI 变成了一个透明的、可搜索的图书馆。它证明了我们可以系统地绘制出 AI 知道什么,同时也揭示了虽然这些模型知识极其渊博(拥有 1 亿个事实),但它们也容易产生片面思维和特定的错误。对于研究人员来说,这是一个让他们不再靠猜测 AI 知道什么,而是开始真正“看见”它所知之物的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →