← 最新论文
💬 NLP

How Much Do LLMs Know About Chinese Zero Pronouns?

本文系统地评估了各种大语言模型在处理多种语言任务中的中文零指代(Zero Pronouns)能力,揭示了尽管这些模型(包括最先进的推理导向型模型)具有通用的专业能力,但在处理此类现象的上游识别和下游翻译方面仍面临显著困难。

原作者: Yifei Li, Guanyi Chen, Tingting He

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifei Li, Guanyi Chen, Tingting He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在读一篇中文故事。在英语中,如果一个名叫“Bill”的角色做了某事,我们通常会说:“Bill saw him.”(比尔看到了)。但在中文里,这门语言就像一位技艺精湛的极简主义画家,经常会在画布上留下空白。你可能只会看到:“比尔看见了 [空白]。”

这个空白被称为零代词(Zero Pronoun, ZP)。读者必须用大脑来填补这个空缺:“哦,他看到了他自己,”或者“他看到了那只狗。”

这篇论文就像是大语言模型(LLM)——即我们今天使用的那些超级智能的 AI 聊天机器人——的一份成绩单。研究人员想知道:这些 AI 大脑真的能“看见”中文里那些隐形的空白吗?它们能理解这些空白指的是谁,并将其正确地翻译成英语吗?

以下是他们调查过程的拆解,使用了几个简单的类比。

1. 五步测试法(理解的“阶梯”)

研究人员不仅仅是让 AI 翻译一个句子。他们构建了一个由五个任务组成的阶梯,从最简单的(识别空白)到最难的(翻译整个故事)。

  • 第一步:发现空白(识别 Identification)。
    • 任务: 观察一个中文句子,并指出隐形代词究竟藏在哪里。
    • 结果: AI 在这里遇到了困难。这就像是要求一个机器人在黑暗的房间里找幽灵。小型 AI 模型几乎错过了所有的幽灵。即使是那些大型、智能的模型,也只能找到大约 15% 的幽lardır。
  • 第二步:它是真实的吗?(指称性 Referentiality)。
    • 任务: 判断这个空白是指代一个特定的人/物,还是仅仅是一个泛指的“某人”(比如说“一个人必须系好安全带”,这里的“一个人”并不是指特定的人)。
    • 结果: AI 很懒。它假设每一个空白都指向一个特定的人,即使事实并非如此。它就像一个认为每一个影子都是罪犯的侦探。
  • 第三步:它在看向哪里?(指称类型 Referential Type)。
    • 任务: 如果空白指代某人,那么这个人是在空白出现之前被提到的(向后看),还是在空白出现之后被提到的(向前看)?
    • 结果: AI 搞混了。它擅长向后看,但对向前看表现得很糟糕。
  • 第四步:解开谜题(解析 Resolution)。
    • 任务: 真正说出那个空白所指代的身份。
    • 结果: AI 的表现很差,尤其是在对话中。它有一种坏习惯,即倾向于猜测房间里最出名的那个名字,即使那个名字并不符合语境。
  • 第五步:翻译(最终大 Boss)。
    • 任务: 将中文文本翻译成英文,并在翻译过程中用正确的英文单词(如 "he", "she" 或 "it")填补这些空白。
    • 结果: 这是最大的失败。即使是最优秀的 AI 模型,正确率也不到一半。 它们翻译正确的隐形代词比例不足 50%。

2. “规模 vs. 智力”之争

研究人员测试了不同规模(小型、中型、巨型)以及不同“性格”(标准型 vs. 具备“推理”能力的逐步思考型)的 AI 模型。

  • 越大并不一定越好: 虽然巨型模型表现得稍好一些,但差距并不显著。
  • 思考会有所帮助: “推理型”模型(那些在回答前会先进行“思考”的模型)整体表现最好。它们就像是在交卷前会反复检查作业的学生。
  • 翻译悖论: 令人惊讶的是,提高 AI 寻找 空白的能力,并不一定会自动提高它翻译空白的能力。翻译能力似乎是一块独立的肌肉,AI 尚未完全练就。

3. “先知”实验(给 AI 一份作弊条)

研究人员想知道:如果我们直接告诉 AI 空白在哪里,它能否更好地翻译?

  • 设置: 他们给 AI 提供了一个在空白处标记了特殊标签(如 <pro>)的版本。
  • 结果: 砰! 表现大幅提升。当 AI 知道该往哪里看时,“推理型”模型大约有 7 9% 的时间是正确的。
  • 教训: AI 不一定是不理解空白的含义,它只是极其不擅长寻找空白。一旦你指出来,它就能搞定剩下的部分。

4. “语境”问题

研究人员还测试了 AI 需要多少“背景故事”。

  • 发现: 对于某些任务,给 AI 更多的句子(更多的语境)反而会让它表现得更差。这就像是给一个困惑的学生一整座图书馆的书,而不是仅仅给他们需要的那一页;过多的信息只会让他们更加困惑。

总结

论文得出结论:中文零代词是目前 AI 面临的一个巨大的、尚未解决的难题。

即使是当今最先进的 AI 模型,也像是来中国旅游的游客,虽然会说几个单词,但总是错过对话中那些隐形的部分。它们可以翻译那些显现出来的词汇,但却经常无法填补那些让句子变得完整的隐形空白。

研究人员希望这项研究能作为一个“成绩单”,向开发者展示他们的 AI 在哪些地方失败了,以便他们能够构建出真正理解人类语言中“隐形”部分的更好系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →