← 最新论文
💬 NLP

On the Persistent Effects of Lexicality in Large Language Mod

本文研究了词汇重叠如何一致地影响大型语言模型不同深度和各种架构中的表示,揭示了一个词汇与语义信号均发生退化的过渡性中层机制,并证明了这种现象对摘要生成和模型编辑等下游任务产生的负面影响。

原作者: Hammad Rizwan, Muhammad Umair Haider, Nishant Subramani, Mona T. Diab, A. B. Siddique, Hassan Sajjad

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Hammad Rizwan, Muhammad Umair Haider, Nishant Subramani, Mona T. Diab, A. B. Siddique, Hassan Sajjad

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将大语言模型(LLM)想象成一座巨大的、多层结构的图书馆,每一层都代表一个不同的“思考层”。随着一个句子从底层(起点)向顶层(终点)移动,这座图书馆理应将原始的词汇转化为深层的、抽象的意义。

普遍的观点认为,当你向上移动楼层时,图书馆会忘记所使用的具体“词汇”,而完全专注于“意义”。然而,这篇论文指出,图书馆实际上从未真正忘记那些词汇。事实上,这些词汇一直都在高层中“纠缠”着意义。

以下是使用简单类比对该论文研究结果的拆解:

1. “词汇阴影”问题 (The "Word Shadow" Problem)

研究人员发现,即使在模型最深层、最“聪明”的部分,句子的表示形式仍然深受其所包含的具体词汇的影响,而不仅仅是其意义。

  • 类比: 想象你正在人群中寻找一位朋友。你通过性格来描述他(语义内容)。但模型就像一名保安,由于太容易被衣服的颜色(词汇重叠)分散注意力,以至于他会把两个穿着同样衣服的人搞混,即便其中一个是你的朋友,而另一个是陌生人。
  • 研究发现: 如果你取一个句子并改变其意义,但保留许多相同的词汇,模型会认为这两个句子非常相似。它无法察觉到意义已经发生了变化,因为它过于关注那个“词汇阴影”了。

2. “中间层”陷阱 (The "Middle Floor" Trap)

论文发现了一个发生在图书馆中间层(模型的中间层)的奇特现象。

  • 类比: 把模型的处理过程想象成一次穿越隧道的旅程。
    • 底层: 你看到的是原始的砖块(词汇)。
    • 顶层: 你看到的是完成的雕塑(意义)。
    • 中间层: 这里有一个黑暗、多雾的山谷。在这里,模型失去了对砖块的清晰视野,但又尚未构建出清晰的雕塑。这是一个“无人区”,模型在这里对词汇和意义的理解其实都是最差的。
  • 研究发现: 在这个中间部分,模型既难以识别原始词汇,也难以理解其意义。这是一个信息被压缩且变得混乱的过渡地带。

3. 训练无法修复“词汇阴影” (Training Doesn't Fix the "Word Shadow")

研究人员测试了那些经过专门训练、旨在更好地理解意义的模型(例如用于搜索引擎或聊天机器人的模型)。

  • 类比: 这就像聘请了一位擅长通过情节摘要来找书的新图书管理员。你会预期他会忽略封面艺术。但论文显示,即使是这些专家级的图书管理员,如果两本书有相同的标题词,仍然会被误导。
  • 研究发现: 无论你如何训练模型去理解语义,这种“词汇阴影”效应依然存在。模型仍然依赖表层词汇匹配作为一种捷径。

4. 现实世界的影响 (Real-World Consequences)

论文展示了这种“词汇阴影”如何破坏依赖这些模型的现实工具。

  • 摘要生成(“复制粘贴”陷阱):

    • 场景: 你要求 AI 总结一篇新闻文章。
    • 故障: AI 可能会生成一个虽然使用了原文章中完全相同的词汇,但逻辑不通的摘要。
    • 结果: 目前用于评分摘要的工具往往会给这类毫无意义的摘要打高分,因为它们与原文高度相似(高词汇重叠),尽管它们并没有传达任何实际意义。模型是在奖励“词汇匹配”而非“意义匹配”。
  • 模型编辑(“连带损害”陷阱):

    • 场景: 你想更新模型以学习一个新事实(例如:“X 国的首都是 Y 城”)。
    • 故障: 由于模型痴迷于词汇模式,针对 X 国进行的更新会意外改变它回答关于 Z 国问题的表现,如果 Z 国的名字听起来或看起来与 X 国相似。
    • 结果: 这种更新会因为共享相似词汇而“泄露”到其他主题上,从而破坏了模型保持事实独立性的能力。

总结

论文得出结论:我们不能假设大语言模型已经成功地从“思考词汇”转向了“思考意义”。词汇依然存在,并在幕后操控着一切,甚至在最深的层级中也是如此。

  • 核心启示: 如果你构建了一个依赖这些模型来理解意义的系统(如搜索引擎或事实核查工具),你必须非常小心。该系统可能会仅仅因为两者共享了几个词,就认为它们是相同的,即便它们的意义完全不同。我们需要用那些“具有相似词汇但意义不同”的刁钻问题来测试这些模型,以确保它们真的理解了我们的意思。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →