Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning
本文挑战了大型语言模型中的表征收敛意味着共享推理策略的观点,揭示出尽管模型对共享输入形成了相似的内部表征,但它们在推理过程中表现出显著的分歧,特别是在问题难度、决策阶段以及共享信息的因果影响方面。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,16 名不同的学生(即 AI 模型)坐在教室里,都在尝试解决同样的 800 道难题。这些学生有不同的老师、不同的教科书,甚至有不同的思维方式。
AI 界有一个流行理论,称为“柏拉图表征假说”(Platonic Representation Hypothesis),它认为随着这些学生变得更聪明,他们都会开始以完全相同的方式思考。这就像他们都在发现关于世界运作方式的同一种“普遍真理”。
这篇论文提出了一个简单的问题:如果这些学生以相同的方式看待问题,他们是否也会以相同的方式解决问题?
答案令人惊讶地是“否”。论文发现,虽然这些模型在“看到了什么”上达成一致,但它们在“如何思考”上却完全分歧。以下是用简单类比进行的分解说明:
1. “困惑具有传染性”效应(难度反转)
你可能会预期,当学生们正确解决难题时,他们都会使用相似而精妙的逻辑。你可能会预期他们在正确时看起来非常相似。
实际发生的情况是:
- 当他们做对时: 学生们使用非常不同、独特的策略。他们的“思维过程”看起来毫无相似之处。
- 当他们做错时: 他们看起来完全一样。
类比: 想象一群人试图在浓雾中导航。
- 当路径清晰时(简单问题),每个人都采取不同且高效的路线到达目的地。他们看起来不同,因为他们成功了。
- 当雾气浓重时(难题),每个人都迷路了。他们都站在同一个地方,茫然地盯着前方,因为雾气让每个人的视线都以同样的方式变得模糊。
- 研究发现: 模型在困惑时最相似,而不是在聪明时最相似。它们收敛于“共享的困惑”,而非“共享的理解”。
2. “第一印象与最终决定”之间的差距(生成差距)
研究人员在两个不同时间点观察了模型的“大脑”:
- 做决定之前: 当它们刚刚阅读问题时。
- 做决定之后: 当它们实际生成答案时。
实际发生的情况是:
- 阅读问题时: 所有模型看起来几乎完全相同。它们在词语含义上达成一致。
- 生成答案时: 一旦它们必须决定说什么,它们的大脑就会剧烈分化。它们朝着完全不同的方向前进。
类比: 想象一群厨师看着同一篮食材。
- 第一步(阅读): 他们都同意食材是什么(这是“做决定前”阶段)。他们都看到了番茄和洋葱。
- 第二步(烹饪): 一旦开始烹饪,一位厨师做了沙拉,另一位做了汤,第三位则把它烧焦了。他们的最终菜肴(输出)完全不同,尽管他们是从相同的食材开始的。
- 研究发现: 模型在输入(食材)上达成一致,但在计算(烹饪)上存在分歧。
3. “幽灵知识”效应(伴随性正确性)
研究人员发现,模型确实将正确答案存储在其共享的“思维”中。如果你让一个聪明的探测器(一个小侦探)去查看模型 A 的大脑,它可以告诉你答案。如果该侦探随后查看模型 B 的大脑,它也能告诉你答案。
然而:
- 仅仅因为信息存在那里,并不意味着模型会使用它来做决定。
- 如果你试图从模型的大脑中“删除”那部分特定知识,模型几乎不会察觉。它仍然会给出相同的答案。
类比: 想象一个参加考试的学生,他把答案写在手上,但因为太紧张而不敢看。
- 答案物理上存在于他的手上(共享表征)。
- 但该学生实际上并没有使用该信息来解决问题;他是在猜测。
- 研究发现: 模型在脑海中携带着“真理”,但这并没有真正驱动它们的行为。这就像车里的乘客知道目的地,但并不是他在开车。
为什么会发生这种情况?
论文提出了一种涉及注意力的机制。
- 当问题容易时,模型的“注意力”(焦点)是敏锐且具体的。不同的模型关注不同的细节,从而导致不同的解决方案。
- 当问题困难时,模型的注意力变得“弥散”或模糊。它扩散到所有地方,就像一束太宽的手电筒光。这种模糊性使得所有模型看起来都一样,因为它们都在以类似、无结构的方式“猜测”。
核心结论
论文得出结论:AI 模型并没有收敛于共享的“逻辑”或“真理”。 相反,它们收敛于一种共享的输入处理方式(就像我们都将红苹果视为红色一样)。
- 它们共享的是: 如何阅读提示。
- 它们不共享的是: 如何推理解决问题。
这意味着,如果你想组建一个协同工作的 AI 模型团队(一个“集成”),你不应该仅仅因为它们在纸面上看起来不同而选择它们。你应该选择那些在解决难题时犯不同错误或使用不同策略的模型,因为它们的真正差异就存在于那里。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。