← 最新论文
💬 NLP

Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models

本文在 58 个单词谜题上评估了三大类大语言模型的 39 种配置,结果表明跨家族差异和与人类对齐的难度模式比参数扩展更为重要,同时揭示了模型因过度依赖分布合理性而在拼写异常的常见词汇上存在系统性失败。

原作者: Bryan E. Tuck, Rakesh M. Verma

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Bryan E. Tuck, Rakesh M. Verma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在玩一个类似“拼字蜜蜂”(Spelling Bee)的文字游戏:系统会给你一组特定的七个字母,你必须仅使用这些字母尽可能多地组成单词,且每个单词都必须包含其中一个特定字母。

这篇论文将这个游戏视为对人工智能(AI)的压力测试。研究人员希望了解不同 AI 模型在遵循这些严格的“字母规则”方面表现如何,并与人类的表现进行对比。他们并非仅仅要求 AI 撰写故事,而是要求它解决一个谜题:一旦规则出错,答案即被视为无效。

以下是他们研究发现的简要说明,并辅以简单的类比:

1. “家族”与“规模”的意外

你可能会认为,让 AI“更大”(赋予其更多算力或参数)是最重要的因素。但研究发现并非完全如此。

  • 类比:想象你有三个不同品牌的汽车(Qwen、Claude 和 GPT)。你可以从 A 品牌购买一辆小型轿车,也可以购买一辆巨型卡车。
  • 发现:A 品牌的小型轿车与巨型卡车之间的差异显而易见,但 A 品牌的巨型卡车与 B 品牌的小型轿车之间的差异却更为巨大。
  • 结果:AI 所属的“家族”远比其规模大小更重要。专有模型(如 GPT 和 Claude)在解决此类谜题方面的表现比最大的开源模型高出2 到 2.2 倍,即使开源模型经过了显著扩展。

2. “思考时间”的悖论

研究人员测试了当给予 AI 更多“思考时间”(即更多计算预算)来解决谜题时会发生什么。

  • 类比:想象你让一名学生解一道数学题。你可以给他们 1 分钟、5 分钟或 1 小时。
  • 发现
    • 超级学生(高容量模型):如果给最智能的模型更多时间,它们的表现会显著提升。它们利用这段时间来反复检查自己的工作。
    • 困惑的学生(中等规模模型):令人惊讶的是,给中等规模模型更多时间反而使它们的表现变差。这就像它们开始过度思考,把自己逼入死角,从而生成更多错误答案。
    • 幼儿(小型模型):给最小规模的模型更多时间毫无帮助。它们只是不断重复同样的错误,因为它们从一开始就缺乏解决该问题的基本工具。

3. “人类与机器人”的难度差距

研究人员将 AI 的表现与 10,000 名真实人类玩同一游戏的数据进行了对比。

  • 类比:想象一张地图,其中有些道路容易走,有些则难走。人类和 AI 都觉得容易的道路容易,难走的道路难走,但它们会在不同的地方迷路。
  • 发现:AI 与人类在一定程度上是一致的(如果一个词对人类来说很难,通常对 AI 来说也很难),但两者之间存在巨大脱节。
  • 故障:AI consistently 在人类觉得非常简单、常见的单词上失败,特别是那些包含重复字母特殊模式的单词。
    • 示例:像"data"、"loll"、"momma"或"illicit"这样的单词。
    • 原因:人类看到这些单词就知道它们是真实的。然而,AI 似乎依赖于基于过去所见字母组合频率的“直觉”。因为"ll"或"mm"出现在单词中间在其训练数据中统计上较少见,AI 会认为“这看起来很奇怪,所以可能不是有效单词”,尽管它确实是。这就像一位厨师仅仅因为食材的排列方式是自己从未见过的模式就拒绝烹饪这道菜,即使这道菜其实非常美味。

4. “长单词”的崩溃

人类和 AI 在处理长单词方面存在巨大差异。

  • 类比:想象一场杂耍表演。人类可以熟练地抛接 4 个球,然后是 5 个,接着是 6 个,而他们的表现仅轻微下降。
  • 发现:AI 则像是一位能轻松抛接 4 个球的杂耍者,但一旦你增加第 5 个或第 6 个球,它们就会把所有球都弄掉。
  • 结果:随着单词变长,人类的成功率仅温和下降。但对于 AI,尤其是小型模型而言,成功率会急剧崩溃。小型模型或许能较好地解决 4 个字母的单词,但其解决 7 个以上字母单词的能力会下降 70 倍。似乎随着单词变长,AI 会失去对规则的追踪,忘记它被允许使用哪些字母。

总结

该论文得出结论:当前的 AI 模型非常擅长基于概率猜测单词“应该”长什么样,但当它们必须严格遵守一套僵硬的规则时,就会陷入困境。它们经常遗漏简单、常见的单词,因为这些单词对 AI 而言看起来“统计上不太可能”;而当谜题变得过长或过于复杂时,它们则会彻底崩溃。解决这一问题的最佳途径并非仅仅让 AI 变得更大,而是改变其自我检查的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →