← 最新论文
💻 computer science

PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations

该论文提出了名为 PRISM 的受控基准,通过将幻觉解构为知识缺失、知识错误、推理错误和指令遵循错误四个维度,并结合生成过程的记忆、指令与推理三阶段进行细粒度诊断,从而深入揭示大语言模型幻觉的成因及不同缓解策略间的权衡关系。

原作者: Yuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 PRISM 的新工具,它的任务就像是给大语言模型(LLM,比如 ChatGPT、文心一言等)做一次全方位的“体检”和“故障诊断”

以前,我们评价一个 AI 说没“胡说八道”(幻觉),通常只是看它最后的答案对不对。这就像老师批改作业,只看分数,却不知道学生是因为没背过公式算错了数看错题了,还是故意乱写才丢分的。

PRISM 的出现,就是为了解决“不知道错在哪”的问题。它把 AI 的“胡说八道”拆解成了四个具体的“病因”,并设计了一套精密的测试题来分别检查。

🧩 核心概念:AI 为什么会“胡说八道”?

作者把 AI 的幻觉分成了四种类型,我们可以用**“一个想当医生的实习生”**来打比方:

  1. 知识错误 (KE - Knowledge Error):记错了

    • 比喻:实习生脑子里记得“阿司匹林能治感冒”,但实际上阿司匹林是治发烧和止痛的。他记得很牢,但内容是错的
    • 现实:模型内部存储了过时或错误的信息,导致它自信地输出错误事实。
  2. 知识缺失 (KM - Knowledge Missing):没学过

    • 比喻:实习生被问到"2025 年诺贝尔奖得主是谁”,他脑子里根本没有这个信息,但他为了显得自己懂,瞎编了一个名字
    • 现实:模型训练数据里没有这个新知识(比如最新的新闻或虚构的设定),它却强行回答。
  3. 推理错误 (RE - Reasoning Error):算错了

    • 比喻:实习生知道“感冒药不能和降压药一起吃”,也知道“病人吃了降压药”,但他逻辑混乱,最后建议病人“把两种药一起吃”。他手里有正确的零件,但组装错了
    • 现实:模型拥有正确的信息,但在多步逻辑推理、数学计算或代码生成时,步骤衔接出错。
  4. 指令遵循错误 (IFE - Instruction Following Error):没听话

    • 比喻:医生(用户)明确说:“请用只有三个词的中文回答,不要用逗号”。实习生虽然知道答案,但无视了规则,写了一大段话还加了逗号。
    • 现实:模型忽略了用户的格式、长度、语言或特定约束要求。

🔍 PRISM 是怎么工作的?(像做手术一样精准)

以前的测试题(Benchmark)就像**“混合大杂烩”**:一道题里既考记忆,又考逻辑,还考格式。如果 AI 做错了,你根本不知道它是因为记不住,还是因为逻辑差。

PRISM 的做法是“分科考试”:

  • 隔离变量:它设计了 9,448 道题目,覆盖 65 个不同的小任务。每一道题都测试上述四种“病因”中的一种。
  • 精准定位:如果 AI 在“知识缺失”的考题上错了,那就说明它真的缺知识;如果在“指令遵循”上错了,那就说明它听不懂人话。

这就好比:
以前的考试是“综合题”,你考砸了,老师只能说你“不行”。
PRISM 是“分科测试”,老师能告诉你:“你数学(推理)很好,但历史(知识)太烂,而且你连‘只写 50 字’这种要求都做不到(指令)。”


⚖️ 惊人的发现:AI 的“顾此失彼”

论文测试了 24 种主流的大模型(包括 GPT-4、Claude、Llama 等),发现了一个有趣的**“不可能三角”**现象:

  • 优化 A,往往牺牲 B
    • 如果你给 AI 做大量的“指令遵循”训练(让它更听话、格式更规范),它的逻辑推理能力可能会下降。
    • 如果你强行往 AI 脑子里塞新知识(知识注入),它可能会忘记原本记得很牢的东西(灾难性遗忘)。
    • 如果你让它更擅长做复杂的逻辑推理,它有时候反而听不进简单的格式指令。

这就好比训练运动员:
如果你拼命练短跑(推理),你的长跑耐力(指令遵循)可能会变差;如果你拼命练举重(知识记忆),你的灵活性(逻辑推理)可能会变慢。目前的 AI 技术很难做到“六边形战士”,总是要在某个方面做出妥协。


💡 这个研究有什么用?

  1. 不再盲目修 Bug:以前开发者不知道 AI 为什么错,只能盲目地调参。现在有了 PRISM,开发者可以像医生看 X 光片一样,精准地看到 AI 是“脑子记错了”还是“逻辑乱了”,然后对症下药
  2. 建立信任:在医疗、法律等高风险领域,我们需要知道 AI 是“真的不知道”还是“瞎编的”。PRISM 能帮我们区分这两者,让 AI 更安全。
  3. 未来的方向:它告诉我们,想要造出完美的 AI,不能只靠一种方法(比如只加数据或只改指令),需要平衡不同能力的训练策略。

总结

PRISM 就像是一个高精度的 AI 体检中心。它不再满足于给 AI 打个总分,而是把 AI 的“胡说八道”拆解成记错、没学过、算错、没听话四种具体毛病,并告诉我们:想要治好一种毛病,可能会让另一种毛病变重。这为未来制造更靠谱、更聪明的 AI 提供了清晰的路线图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →