← 最新论文
💬 NLP

KGHaluBench: A Knowledge Graph-Based Hallucination Benchmark for Evaluating the Breadth and Depth of LLM Knowledge

本文提出了 KGHaluBench,这是一个基于知识图谱的幻觉评估基准,通过动态构建多维度问题并采用自动化验证流程,全面评估了 25 个前沿大语言模型在知识广度与深度上的真实性及幻觉成因。

原作者: Alex Robertson, Huizhi Liang, Mahbub Gani, Rohit Kumar, Srijith Rajamohan

发布于 2026-02-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Alex Robertson, Huizhi Liang, Mahbub Gani, Rohit Kumar, Srijith Rajamohan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 KGHaluBench 的新工具,它的核心任务只有一个:给大语言模型(LLM)做一次“深度体检”,看看它们到底是在“说真话”还是在“一本正经地胡说八道”(也就是所谓的“幻觉”)。

为了让你更容易理解,我们可以把大语言模型想象成一个博学但偶尔会“吹牛”的超级导游

1. 为什么需要这个新工具?(旧工具的缺陷)

以前的测试就像是在考导游“死记硬背”的能力:

  • 题目太死板:就像只问“珠穆朗玛峰有多高?”这种固定问题。导游背熟了答案就能拿高分,但这不能证明他懂地理,也不能看出他会不会编造“珠穆朗玛峰在火星上”这种离谱的话。
  • 只问表面:以前的测试很少问深层问题,比如“珠穆朗玛峰的形成对当地气候有什么具体影响?”。
  • 结果有偏差:如果题目只问名人(比如“爱因斯坦”),导游因为背得多,表现很好;但如果问冷门人物,他可能就瞎编了。以前的测试没考虑到这种“知名度”带来的不公平。

KGHaluBench 就像是一个“随机出题、深度追问”的考官,专门抓导游的把柄。

2. KGHaluBench 是怎么工作的?(核心机制)

这个工具利用了一个巨大的知识图谱(Knowledge Graph),你可以把它想象成一张无限大的、相互连接的“事实地图”

第一步:随机抓个“主角”(动态出题)

考官不会提前定好题目,而是从“事实地图”里随机抓一个实体(比如“丹泽尔·华盛顿”或者一幅冷门画)。

  • 比喻:就像考官随机指着一个路人甲,问导游:“请介绍一下这个人,包括他的职业、出生地和孩子,还要讲得生动点。”
  • 难度控制:考官会计算这个人的“知名度”。如果是路人甲,问题就难;如果是明星,问题就相对简单。这样能确保测试公平,不会因为题目太简单或太难而失真。

第二步:生成“复合问题”(考察深度)

考官不会只问一个简单问题,而是把三个事实串起来,形成一个复合问题

  • 比喻:考官问:“请告诉我丹泽尔·华盛顿(主角)的职业出生地以及他孩子的名字,并把这些信息串联成一段 200 字的故事。”
  • 目的:这迫使导游必须同时调动大脑里三个不同的知识点。如果导游编造了一个孩子,或者把出生地搞错了,就是“幻觉”。

第三步:三层“安检门”(自动验证)

导游回答完,系统会像过安检一样,分三层检查:

  1. 第一层:有没有“装傻”或“乱认亲戚”?(实体级过滤)

    • 检查:导游回答的是不是真的丹泽尔·华盛顿?还是把“丹泽尔·华盛顿”和另一个同名的人搞混了?或者导游直接说“我不知道”(这叫“弃权”,系统会给予部分分数,因为承认不知道比瞎编要好)。
    • 比喻:如果导游指着路人乙说“这是丹泽尔”,直接挂科。
  2. 第二层:事实对不对?(事实级检查 - 快速通道)

    • 检查:用快速的小模型检查导游说的“职业”是不是对的。
    • 比喻:就像用金属探测器扫一下,看有没有明显的错误。
  3. 第三层:细节准不准?(事实级检查 - 专家通道)

    • 检查:如果快速检查没通过,就请一个更聪明的“专家模型”来仔细推敲句子的逻辑和细节。
    • 比喻:如果导游说“他出生在 1950 年”,专家会核对地图上的事实,确认是 1951 年,判定为错误。

3. 他们发现了什么?(实验结果)

他们测试了 25 个最先进的大模型(包括开源的和商业的),发现了一些有趣的现象:

  • 大模型也会“吹牛”:即使是最好的模型,也会犯错。
  • 越大的模型,越会“装懂”
    • 小模型:遇到不认识的人,容易直接瞎编(广度幻觉多)。
    • 大模型:能认出这个人是谁(广度没问题),但在讲细节时容易“张冠李戴”(深度幻觉多)。
    • 比喻:小模型是“不懂装懂”,大模型是“懂一点但记混了”。
  • “承认不知道”很重要:有些模型因为太谨慎,经常说“我不知道”,虽然分数看起来低,但幻觉率极低。这就像导游宁可说“我不清楚”,也不乱指路。

4. 这个工具的新发明(新指标)

为了更公平地打分,他们发明了两个新指标:

  • 加权准确率 (Wa):就像考试时,如果题目很难,答对一道题的分数就更高;题目简单,答对分数就低。这样能消除“题目太简单”带来的虚假高分。
  • 幻觉深度/广度率:把“胡说八道”分成两类:
    • 广度幻觉:连人都不认识,瞎编名字。
    • 深度幻觉:认识人,但把细节搞错了。

总结

KGHaluBench 就像是一个拥有“随机出题”和“火眼金睛”的严厉考官。它不再满足于让大模型背答案,而是通过随机抽取冷门或热门人物,提出复杂的组合问题,并层层剥茧地检查答案的真伪。

它的目的是告诉开发者:现在的模型虽然看起来能言善辩,但在知识的“广度”和“深度”上,依然有很多“吹牛”的死角。 只有把这些死角找出来,我们才能让 AI 变得更诚实、更可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →