← 最新论文
💬 NLP

Improving Factuality in LLMs via Inference-Time Knowledge Graph Construction

本文提出了一种新颖的框架,通过在推理过程中动态构建和细化结构化知识图谱,将模型内部知识与外部检索相结合,以克服非结构化文本方法的局限性,从而提升大语言模型的事实准确性。

原作者: Shanglin Wu, Lihui Liu, Jinho D. Choi, Kai Shu

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Shanglin Wu, Lihui Liu, Jinho D. Choi, Kai Shu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、博览群书的图书管理员(即大型语言模型,或 LLM)。这位管理员读过数百万本书,几乎能告诉你任何事。然而,像任何人一样,他们也有无法完美记住所有内容的局限。有时,他们可能会混淆两个相似的故事,忘记某个具体细节,或者自信地编造一个听起来正确但实则错误的“事实”。研究人员将这种现象称为“幻觉”。

为了解决这个问题,本文作者提出了一种让这位管理员工作的新方法,他们称之为“推理时知识图谱构建”。

以下是他们方法的运作方式,通过“绘制寻宝地图”这一类比,分解为简单步骤:

问题:非结构化搜索

通常,当你向图书管理员提出一个棘手的问题时,他们可能会尝试仅靠深入思考(即“思维链”)来回答。或者,他们可能会在互联网上查找一些文本并阅读。

  • 问题所在: 阅读一段冗长、杂乱的文本,就像试图通过阅读一本关于该城市的小说来寻找某条特定街道。这很容易让人迷路、错过转弯,或被无关细节分散注意力。由于信息未加组织,图书管理员可能会抓取错误的事实。

解决方案:绘制“地图”(知识图谱)

作者们教导图书管理员在回答问题时,不要仅仅阅读文本,而是绘制一张“地图”(即知识图谱)。这张地图用线条(关系)连接着点(事实)。

以下是他们的四步流程:

1. 绘制种子地图(初始化)

当你提出一个问题(例如:“伯恩斯坦的《交响舞曲》是基于哪部戏剧创作的?”)时,图书管理员首先查看自己的记忆,并绘制出一张微小、粗略的草图。

  • 他们写下:Dag Achatz → 改编 → 交响舞曲 → 源自 → 西区故事。
  • 问题: 图书管理员的内部记忆可能不完整。他们可能会停在“西区故事”上,心想:“这就是答案!”但实际上,《西区故事》本身又是基于其他作品创作的。这张地图缺少了一块。

2. 扩展地图(内部扩展)

图书管理员查看他们的草图,问道:“关于这些点,我还知道什么?”他们尝试利用自己的脑力在地图上添加更多线条。

  • 他们可能会添加:西区故事 → 作曲者 → 伦纳德·伯恩斯坦。
  • 问题: 即使进行了这种扩展,图书管理员可能仍然缺少将《西区故事》与原始戏剧《罗密欧与朱丽叶》重新连接起来的关键线索。他们的内部记忆存在空白。

3. 咨询“城市指南”(外部检索)

这是神奇的一步。图书管理员意识到:“我不确定我是否掌握了全貌。”于是,他们暂停并咨询一位值得信赖的外部“城市指南”(如维基百科或谷歌搜索)。

  • 他们在指南中查阅《西区故事》。
  • 指南显示:“《西区故事》的灵感来源于《罗密欧与朱丽叶》。”
  • 图书管理员将这一经过验证的新事实添加到他们的地图中:西区故事 → 灵感来源 → 罗密欧与朱丽叶。
  • 益处: 如果图书管理员之前犯了错误(例如,认为音乐出自不同的年份),“城市指南”能帮助他们修正地图,而不仅仅是添加内容。

4. 找到宝藏(在图谱上作答)

现在,拥有一张完整且经过修正的地图,将"Dag Achatz"一直连接到“罗密欧与朱丽叶”,图书管理员在地图上追踪路径。由于路径清晰且经“城市指南”验证,他们可以自信地回答:“答案是《罗密欧与朱丽叶》。”

为什么这更好?

论文声称,该方法在以下三个主要原因上优于其他方法:

  1. 结构优于混乱: 图书管理员不再在杂乱无章的文本洪流中跋涉,而是使用结构化的地图工作。这使得他们更难被无关信息分散注意力。
  2. 自我修正: 图书管理员不仅仅信任自己的记忆。他们利用外部指南来修正自己地图中的错误。如果图书管理员认为"A 导致 B",但指南说"A 导致 C",图书管理员就会更新地图。
  3. 小管理员也能做大事: 实验表明,即使是较小、较弱的“图书管理员”(较小的 AI 模型),如果使用这种绘图方法,也能表现得与巨大的模型一样好。外部指南拉平了竞争环境。

结果

作者在三种不同类型的常识问答挑战中测试了这种方法。

  • 结果: 与询问 AI 的标准方法相比,他们的方法 consistently 获得了更多正确答案。
  • “召回”提升: 他们发现,通过使用外部指南,他们构建的“地图”中包含正确事实的频率要高得多(在“召回”率,即找到正确事实方面有了巨大提升),而不仅仅是依赖 AI 的记忆。

注意事项(局限性)

作者诚实地指出了缺陷:

  • 垃圾进,垃圾出: 如果图书管理员绘制的地图初始部分就是错的,且外部指南未能发现,那么最终答案仍然会是错的。
  • 并非完美: 在地图上拥有正确事实与实际选出正确答案之间仍存在差距。该系统尚未达到 100% 的完美。

总结

简而言之,这篇论文建议,与其让 AI 仅仅“思考”或“阅读一段文字”,不如让它构建一张事实的视觉地图,对照可信的百科全书检查该地图,修正地图上的任何错误,然后沿着地图找到答案。这使得 AI 更准确、更不易撒谎,也更容易理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →