← 最新论文
💬 NLP

Revisiting Non-Verbatim Memorization in Large Language Models: The Role of Entity Surface Forms

该论文提出了利用维基百科重定向信息构建的 RedirectQA 数据集,通过引入多样化的实体表面形式(如别名、缩写及拼写变体),揭示了大语言模型的非字面记忆表现高度依赖于表面形式,且在不同类别的词汇变化下表现出显著的不一致性。

原作者: Yuto Nishida, Naoki Shikoda, Yosuke Kishinami, Ryo Fujii, Makoto Morishita, Hidetaka Kamigaito, Taro Watanabe

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuto Nishida, Naoki Shikoda, Yosuke Kishinami, Ryo Fujii, Makoto Morishita, Hidetaka Kamigaito, Taro Watanabe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)做一场特殊的“体检”,专门检查它们是不是真的“记住”了知识,还是只是在“死记硬背”特定的名字。

我们可以把这篇论文的核心内容想象成这样一个故事:

1. 核心问题:模型是“认人”还是“认名字”?

想象一下,你有一个超级聪明的朋友(大语言模型),他读过很多书,知道很多事实。

  • 如果你问他:"贝利(Pelé) 是做什么的?”他可能马上回答:“足球运动员。”
  • 但如果你换个问法:"埃德森·阿兰特斯·多·纳西门托(Edson Arantes do Nascimento,贝利的真名) 是做什么的?”他会不会卡壳,甚至回答错误?

以前的研究通常只问第一种情况(用大家最熟悉的“标准名”)。但这就像只测试朋友认不认识“贝利”这个称呼,却没法知道他是不是真的认识“贝利”这个人。如果模型只是记住了“贝利=足球员”这个特定的名字组合,而不是真正理解了“这个人”是谁,那当名字一变,它可能就“失忆”了。

2. 新工具:RedirectQA(重定向问答库)

为了解决这个问题,作者们发明了一个新玩具,叫 RedirectQA

  • 它的原理:利用维基百科的“重定向”功能。在维基百科里,如果你搜"NYT",它会自动跳转到“纽约时报”;搜“克里斯蒂亚诺·罗纳尔多”的错别字,也会跳转到正确页面。
  • 它的玩法:作者把这些“别名”、“缩写”、“拼写错误”、“真名”都收集起来,针对同一个事实,生成一堆不同的问题。
    • 问题 A:贝利是做什么的?(标准名)
    • 问题 B:埃德森是做什么的?(真名)
    • 问题 C:佩莱(拼写变体)是做什么的?
    • 问题 D:克里斯蒂亚诺·罗纳尔多的错别字是做什么的?

这就好比给同一个“人”穿了13 套不同的衣服(不同的名字形式),然后问模型:“这个人是谁?”

3. 实验发现:模型有点“脸盲”

作者测试了 13 种不同的大模型,结果发现了一个有趣的现象:模型经常“认脸不认人”,或者“认衣服不认人”。

  • 一致性很差:对于同一个事实,模型用“标准名”能答对,换用“别名”或“缩写”时,答案却变了,甚至答错了。
  • 衣服越像,越容易认
    • 如果是拼写小错误(比如少个标点、大小写不同),模型通常还能认出来,比较稳健。
    • 如果是完全不同的名字(比如用真名代替艺名,或者用缩写"NYT"代替全称),模型就经常“断片”,答不对了。
  • 结论:模型并不是真正“理解”了事实,它更像是在记忆“名字 + 答案”的配对。一旦名字变了,配对就失效了。

4. 频率分析:是“个人名气”重要,还是“名字热度”重要?

作者还做了一个数学分析,看看模型答对题跟什么有关:

  • 实体频率:这个“人”在训练数据里总共出现了多少次(不管叫什么名字)。
  • 表面频率:这个“特定的名字”在训练数据里出现了多少次。

发现
模型答对题的概率,既跟这个“人”的总名气有关,也跟这个“特定名字”的热度有关。

  • 对于标准名,只要这个“人”总名气大,模型通常能答对,哪怕那个名字本身出现次数不多。
  • 对于别名,如果那个别名本身出现次数很少,即使这个“人”很有名,模型也很容易答错。

这说明模型内部有一种**“跨名字的连接”**,但这种连接并不完美。它不是完全独立的记每一个名字,也不是完全通用的理解一个人,而是处于一种中间状态。

5. 总结与启示

这篇论文告诉我们:

  1. 别只测标准名:以前我们评价模型聪不聪明,只问它认不认识“贝利”。现在发现,这不够全面。如果它不认识“埃德森”,那它的知识其实很脆弱。
  2. 名字很重要:大模型对“名字的形式”非常敏感。改变一下称呼,可能就会让模型从“天才”变成“笨蛋”。
  3. 未来的方向:要真正评估大模型的记忆能力,必须像 RedirectQA 这样,用各种各样的名字(别名、缩写、错别字)去“骚扰”它,看看它是不是真的“懂”那个事实,而不是只记住了那个特定的标签。

一句话总结
大模型可能像个只认“身份证照片”不认“本人” 的保安。你给他看标准证件照(标准名),他能认出你;但如果你换个发型、戴个墨镜或者用个昵称(别名),他可能就不认识你了。这篇论文就是教我们如何设计各种“伪装”,来测试模型到底是不是真的“认识”这个世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →