← 最新论文
💬 NLP

Disentangling generalization and memorization in large language models using chess

本文利用国际象棋作为受控测试平台,证明大型语言模型严重依赖对常见模式的记忆,因为当面对缺乏相关训练先验的新颖局面时,其性能显著下降并趋近于随机水平,从而揭示了其在系统性泛化能力方面的固有局限。

原作者: Leonard S. Pleiss, Maximilian Schiffer, Robert K. von Weizsaecker

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Leonard S. Pleiss, Maximilian Schiffer, Robert K. von Weizsaecker

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图判断一名学生究竟是在真正学习一门学科,还是仅仅在死记硬背他们之前见过的某次特定考试的答案

这篇论文将国际象棋作为一个巨大且受控的课堂,用来测试大型语言模型(LLMs)——即 ChatGPT、Claude 和 Gemini 等工具背后的 AI 大脑。研究人员想知道:当这些 AI 解决问题时,它们是在运用真正的推理能力,还是仅仅从其庞大的训练数据数据库中调取一个死记硬背的答案?

以下是他们实验和发现的分解,使用了简单的类比。

1. 实验设置:三种类型的国际象棋谜题

为了测试死记硬背与推理之间的区别,研究人员创建了三种类型的国际象棋局面,就像视频游戏中的三个不同关卡:

  • “著名”谜题(分布内): 这些是标准的、众所周知的国际象棋开局(例如“西班牙开局”)。它们出现在数百万场对局中,很可能包含在 AI 的训练数据里。
    • 类比: 这就像向学生提问一个 literally 写在教科书里的问题。如果他们答对了,可能只是在复述书本内容。
  • “熟悉但新颖”的谜题(近分布): 这些看起来像正常的国际象棋对局,但从未被下过。它们遵循规则,看起来像标准对局,但具体的棋子排列是独一无二的。
    • 类比: 这就像一道数学题,使用了与教科书相同的数字和公式,但关于“苹果和橘子”的故事背景略有不同。学生必须建立联系,而不仅仅是抄写答案。
  • “外星”谜题(分布外): 这些是怪异、随机的棋盘设置。棋子的摆放方式在现实生活中几乎从未发生过(例如,兵阻挡了国王)。它们打破了所有常规模式。
    • 类比: 这就像要求学生用一种他们从未听过的语言、遵循他们从未见过的规则来解决一个逻辑谜题。没有教科书可以死记硬背;他们必须从头开始思考。

2. 实验:AI 的表现

研究人员要求各种顶级 AI(GPT-3.5、GPT-4o、GPT-5、Claude 和 Gemini)在这三种类型的谜题中走出最佳的一步。他们通过 AI 的走法与超级计算机国际象棋引擎的走法有多接近来衡量成功程度。

以下是他们的发现:

“著名”谜题:AI 是超级背诵者

当谜题是标准且熟悉的,AI 表现得非常好。

  • 结论: 这些模型在死记硬背方面极其出色。如果它们以前见过某种模式,就能完美地回忆出解决方案。

“外星”谜题:AI 崩溃了

当谜题怪异且新颖(分布外)时,AI 的表现分崩离析。

  • 结论: 它们的性能下降到了随机猜测的水平。事实上,它们开始以很高的频率走出违规的棋步(例如像象一样移动马)。
  • 隐喻: 这就像一个知道期末考试所有答案的学生,但当被给出一张白纸并要求“写一个故事”时,却开始胡言乱语。它们实际上并不理解游戏的规则;它们只识别它们见过的模式

“熟悉但新颖”的谜题:急剧下滑

随着谜题变得稍微不那么熟悉,AI 的表现并没有只是轻微下降,而是像滑下陡峭的悬崖一样急剧下滑。

  • 结论: 谜题看起来越像 AI 未曾见过的东西,它的表现就越差。

3. “更努力思考”测试

研究人员还测试了具有“推理模式”的新模型(如 GPT-5),在这种模式下,AI 被要求在回答前“逐步思考”。

  • 结果: 更努力地思考有所帮助,但作用有限。
  • 陷阱: 当谜题怪异(分布外)时,AI 会花费大量时间“思考”(使用更多的词/标记),但它仍然无法解决问题。
  • 隐喻: 想象一个学生,面对一道难题时,开始写一篇关于数学历史的十页长文,而不是解方程。他们确实在努力工作,但他们只是在重组已知的事物,而不是创造新的解决方案。“思考”过程放大了它们的死记硬背能力,但并未产生真正的推理能力。

4. 主要结论

该论文得出结论:当前的大型语言模型在模式匹配方面才华横溢,但在真正的泛化能力方面存在困难

  • 扩展并非灵丹妙药: 让模型变得更大(增加更多数据和参数)有助于它们记忆更多内容,但这似乎并不能帮助它们学会如何对从未见过的事物进行推理。
  • “晶体化”陷阱: 模型依赖“晶体化”知识(死记硬背的片段)。当这些片段不可用时,它们没有“流体”智力可以依靠。它们无法从第一性原理推导出游戏规则;只有当游戏看起来与它们以前见过的完全一样时,它们才能识别出这个游戏。

简而言之: 这些 AI 就像百科全书,能够背诵整个国际象棋历史,但如果你把它们放在一个房间里,里面有一副棋盘和一套它们从未见过的规则,它们甚至可能不知道如何正确地移动棋子。它们是过去的 master,但尚未成为新事物的 master。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →