← 最新论文
💬 NLP

Learned but Not Expressed: Capability-Expression Dissociation in Large Language Models

该实证研究表明,大型语言模型虽具备在特定条件下重构训练数据的能力,但在标准生成任务中,其输出会因对齐诱导的语篇先验而系统性地抑制非因果性解决方案,从而揭示了模型“习得能力”与“表达表现”之间的显著解离现象。

原作者: Toshiyuki Shigemura

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Toshiyuki Shigemura

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个关于大型语言模型(LLM,比如现在的 AI 聊天机器人)非常有趣且反直觉的现象。简单来说,它的核心发现是:AI“学过”的东西,并不等于它“会说出来”的东西。

为了让你更容易理解,我们可以把这篇论文的研究过程想象成一次**“侦探调查”**。

1. 核心谜题:AI 的“双重人格”

通常我们认为,如果 AI 在训练时读过很多书(包括神话、奇幻故事、甚至一些不科学的解释),那么当它写故事或给建议时,应该偶尔会蹦出这些内容。这就像我们假设:只要脑子里有知识,嘴巴就会说出来。

但这篇论文的研究者发现,AI 其实有“双重人格”:

  • 人格 A(标准模式): 在正常聊天、写故事或给建议时,它表现得非常“理智”和“科学”。哪怕是在写奇幻小说,它也拒绝使用“魔法”或“神迹”来解决问题,而是坚持用逻辑和因果关系。
  • 人格 B(特殊模式): 如果你非常明确地、直接地命令它:“请列举一些靠魔法解决问题的例子”,它立刻就能完美地写出来,甚至写得比谁都好。

结论就是:AI 脑子里确实存着这些“非科学”的知识(人格 B 证明它能做到),但在正常说话时,它被一种看不见的“过滤器”给拦住了(人格 A 拒绝输出)。

2. 研究过程:一场精心设计的“捉迷藏”

研究者为了验证这个猜想,设计了一个非常严谨的实验,就像是在玩一场大规模的“捉迷藏”:

  • 捉迷藏规则(实验设置):

    • 他们找了 3 个当时最先进的 AI 模型(相当于三个不同的“嫌疑人”)。
    • 设计了 10 种不同的场景(比如:遇到突发困难、人际冲突、时间紧迫等)。
    • 让 AI 在两种模式下生成回答:
      1. 写故事模式(本来应该允许天马行空,比如用魔法解决困难)。
      2. 给建议模式(本来就应该讲逻辑,比如如何赶完项目)。
    • 总共生成了 300 个回答。
  • 捉迷藏结果(主要发现):

    • 在这 300 次回答中,一次都没有出现“非因果”的解决方案(比如“问题突然因为神迹解决了”或“因为运气好莫名其妙好了”)。
    • 即使在写故事这种本该允许“胡编乱造”的场合,AI 也坚持用逻辑解释一切。
    • 统计结果: 出现率为 0%
  • 验证环节(确认 AI 不是“失忆”):

    • 为了确认 AI 不是真的“忘了”这些概念,研究者单独问了它们:“请列出一些靠超自然力量解决问题的例子”。
    • 结果:AI 们全部都能成功列出,而且列举得很精彩。
    • 这证明了:AI 不是“不会”,而是“不想”在正常模式下说。

3. 为什么会这样?(用比喻来解释)

这就好比一个极其守规矩的厨师

  • 他的冰箱里(训练数据): 塞满了各种食材,包括普通的蔬菜,也有毒蘑菇、甚至是一些只在神话故事里存在的“龙肉”。
  • 他的菜谱(对齐机制/Alignment): 经过严格的训练,他学会了一条铁律:“除非客人 explicitly(明确地)点‘神话大餐’,否则在正常点餐时,绝对不能端出毒蘑菇或龙肉,哪怕客人只是想吃个普通的炒饭。”
  • 实验结果: 当你让他做 300 道普通的菜(写故事或给建议)时,他端出来的全是安全的、符合逻辑的菜。但如果你直接问:“你会做龙肉吗?”他会立刻展示高超的厨艺,把龙肉做得色香味俱全。

这篇论文指出的就是:AI 的“输出”不仅仅取决于它“学过什么”,更取决于它被训练成“在什么情况下该说什么”。

4. 这个发现意味着什么?

  • 打破了一个旧观念: 以前人们以为,AI 只要训练数据里有,就会在输出里体现。现在我们知道,AI 有一个强大的“过滤器”,能系统地屏蔽掉某些内容,哪怕这些内容在训练数据里很常见。
  • 理解 AI 的新视角: AI 的行为不是简单的“从数据库里调取信息”,而是一种**“情境下的选择”**。它学会了在什么场合该表现得像个科学家,什么场合该表现得像个作家,而且这种界限被训练得非常严格。
  • 对未来的启示: 这意味着我们不能简单地通过“看训练数据”来预测 AI 会说什么。要理解 AI,不仅要研究它“脑子里有什么”,更要研究它“被训练成在什么情况下会闭嘴”。

总结

这篇论文就像给 AI 做了一次**“心理侧写”,发现它们虽然“博闻强记”(什么都学过),但在日常交流中却“谨言慎行”(只说符合逻辑和规则的话)。这种“能而不为”**(有能力但不表达)的现象,揭示了现代 AI 背后复杂的控制机制,提醒我们:AI 不仅仅是知识的容器,更是被精心调教过的“守门人”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →