← 最新论文
💬 NLP

Does Less Hallucination Mean Less Creativity? An Empirical Investigation in LLMs

这项实证研究调查了三种减少幻觉的技术(验证链、通过对比层进行解码以及检索增强生成)对大语言模型创造力的影响,揭示了验证链能够增强发散性思维,而通过对比层进行解码则会抑制发散性思维,且检索增强生成的影响微乎其微,从而为在科学应用中平衡事实准确性与创造性探索提供了至关重要的指导。

原作者: Mohor Banerjee, Nadya Yuki Wangsajaya, Syed Ali Redha Alsagoff, Min Sen Tan, Zachary Choy Kit Chun, Alvin Chan Guo Wei

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohor Banerjee, Nadya Yuki Wangsajaya, Syed Ali Redha Alsagoff, Min Sen Tan, Zachary Choy Kit Chun, Alvin Chan Guo Wei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一支非常聪明、富有创造力的机器人团队(大型语言模型,简称 LLM),它们擅长编写故事和解决谜题。但有时,这些机器人会变得过于天马行空,开始编造一些并不真实的内容。在技术领域,我们把这种现象称为“幻觉”。

科学家们一直试图构建“事实检查员”来阻止这些机器人撒谎。但本篇论文提出了一个宏大且有趣的问题:如果我们强迫这些机器人做到 100% 的事实准确,我们是否会无意中扼杀了它们的创造力?

你可以把它想象成一位爵士乐手。如果你告诉他们:“你只能演奏乐谱上写好的音符,”他们可能永远不会出错,但也可能永远无法创作出优美且全新的旋律。

以下是研究人员使用三种不同的“事实检查”工具得出的发现:

1. “提问”工具(验证链 / CoVe)

类比: 想象一位作家在写完故事后,停下来问自己:“等等,这合理吗?如果我尝试一个不同的结局会怎样?”他们写下问题,回答问题,然后重写故事。

结果: 这个工具实际上帮助了机器人的创造力,使其变得更加富有创意。
通过强迫机器人停下来并质疑自己的想法,它并没有仅仅局限于那些安全、乏味的答案。它探索了更多的路径,并提出了更独特、更多样化的想法。这就像提问的过程打破了机器人的“隧道视野”,让它看到了新的可能性。

2. “层对比”工具(通过对比层进行解码 / DoLa)

类比: 想象机器人的大脑有很多层,就像一栋多层的建筑。底层是机器人学习基础模式的地方(比如“猫有毛”),而顶层则是它整合所有信息并做出最终决定的地方。
这个工具的工作原理是通过比较“早期想法”(底层)与“最终想法”(顶层)。如果早期想法过于狂野或与最终决定不符,该工具就会减去这些差异,从而使最终答案更符合事实。

结果: 这个工具抑制了创造力。
研究人员发现,那些“狂野”且“富有创意”的想法往往存在于这些底层之中。通过减去底层信息来使机器人的回答更符合事实,我们实际上无意中移除了创造力所需的原材料。这就像试图通过去除香料来让汤变得更好喝一样;你会得到一碗更安全、更平淡的汤,但你也失去了它的风味。

3. “图书馆”工具(检索增强生成 / RAG)

类比: 想象机器人正在参加一场考试,但它不必完全依赖记忆,而是被允许在写出答案之前,从一个书籍库中查找答案。

结果: 这个工具对创造力几乎没有影响(无论是正面还是负面)。
机器人的创造力既没有变得更高,也没有变得更低。研究人员认为这是因为他们使用的“图书馆”里充满了技术手册和代码教程,这与机器人试图解决的创意故事或谜题并不匹配。这就像是试图用一本汽车零件字典来写诗;信息确实在那里,但它并不能激发新的灵感。

核心结论

这项研究中最令人惊讶的部分是,事实性与创造性并不是同一回事。

  • 收敛性思维(找到正确答案): 这三种工具都保持了机器人解决问题的正确能力。它们并没有破坏机器人遵循规则的能力。
  • 发散性思维(产生新想法): 这是工具表现各异的地方。
    • CoVe(提问)让机器人变得更有创意
    • DoLa(层对比)让机器人变得更缺乏创意
    • RAG(图书馆)则没有产生明显变化

为什么这很重要?

研究人员在不同规模的机器人(从小型到大型)和不同类型的机器人(LLaMA、Qwen、Mistral)上进行了测试。结果对于所有模型都是一致的。

这告诉我们,如果我们想要将 AI 用于科学发现(我们需要既有事实依据,又有天马行空的奇思妙想),我们必须谨慎选择使用哪种事实检查工具。如果我们选错了工具(比如 DoLa),我们可能会得到一个虽然完全准确但极其乏味的机器人。如果我们选对了工具(比如 CoVe),我们可能会得到一个既准确又充满惊喜的创新型机器人。

简而言之:你不必在“聪明”与“有创意”之间做选择,但你必须选择正确的工具来让两者共存。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →