← 最新论文
💬 NLP

ChineseBERT: Chinese Pretraining Enhanced by Glyph and Pinyin Information

ChineseBERT 是一种通过整合字形(视觉)和拼音(语音)信息来增强中文语言理解的预训练模型,在多种 NLP 任务中以更少的训练步数实现了最先进的性能。

原作者: Zijun Sun, Xiaoya Li, Xiaofei Sun, Yuxian Meng, Guoyin Wang, Xiang Ao, Qing He, Fei Wu, Jiwei Li

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijun Sun, Xiaoya Li, Xiaofei Sun, Yuxian Meng, Guoyin Wang, Xiang Ao, Qing He, Fei Wu, Jiwei Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

文字的秘密生活:计算机如何学习阅读中文

想象一下,你正在教一个机器人阅读一种语言。对于英语这样的语言,机器人主要通过观察字母的顺序和句子的上下文来猜测单词的含义。这就像是在解一个由声音和语法规则组成的拼图。但中文是一个完全不同的谜题。在中文里,“字母”是汉字,它们是微小且复杂的图形。每一个图形不仅仅是一个声音,它更是一幅往往暗示着其含义的图画。想想“河”或“湖”这两个字——它们侧边都带有一个小小的“水”部首,就像一个视觉提示在说:“嘿,这和水有关!”

此外,中文还有一个被称为“多音字”的棘手转折。这意味着同一个字可以有两种完全不同的读音,而每种读音都会彻底改变意思。这就像如果英语单词“read”无论是在过去时还是现在时看起来都一模一样,而你必须仅凭句子来猜测它是哪种情况。长期以来,试图理解中文的计算机模型一直缺失这两个关键线索:汉字的视觉形状及其特定的读音。它们试图在缺少一半拼图的情况下解决这个谜题。本文深入探讨了自然语言处理(NLP)领域——即我们教计算机理解人类语言的领域——来研究赋予机器人每个汉字的“图像”和“声音”是否能帮助它成为一个更好的读者。

论文的核心思想:赋予计算机眼睛和耳朵

这项研究背后的研究人员与 Shannon.AI 和浙江大学合作,注意到现有的中文计算机模型忽略了中文特有的两种“超能力”:字形(视觉形状)和拼音(发音)。他们决定构建一个名为 ChineseBERT 的新模型来解决这个问题。

把标准的计算机模型想象成只能通过听老师讲课来学习阅读的学生。他们听到单词并记忆上下文。然而,ChineseBERT 就像是一个戴着一副特殊眼镜、又戴着一副超级灵敏耳朵的学生。

  • 眼镜(字形嵌入): 模型将汉字视为一个微小的图像。它看到的不仅仅是一个代码,而是一个实际的形状。研究人员为每个字符提供了三种不同的“字体”(如楷书、行书和篆书风格)。通过观察这些视觉形状,即使模型以前从未在句子中见过它们在一起出现,它也能学到带有“水”部首的字符是相关的。这就像是识别出鱼的图片和鲸鱼的图片是相关的,因为它们都有鳍,即使你还不知道它们的名字。
  • 耳朵(拼音嵌入): 模型也在倾听声音。这对于那些棘手的“多音字”至关重要。如果字符“乐”出现了,模型会检查它的读音。是“yuè”(音乐)还是“lè”(快乐)?声音会告诉模型应该选择哪种确切的含义,解决了仅靠视觉形状无法解决的问题。

团队将这三样东西——标准的汉字编码、视觉形状和声音——结合成一个“融合”超级嵌入。这就像是为机器人阅读的每一个字符都提供了一个三层信息的“三明治”。

他们的发现:更聪明、更快、更准确

研究人员在从互联网抓取的 40 亿个中文字符的大型库上训练了这个新的 ChineseBERT 模型。他们并没有止步于此;他们在各种任务(从阅读理解到文本中的姓名识别)上将其与现有的最佳模型(如 ERNIE 和 BERT-wwm)进行了对比测试。

以下是实验揭示的结果:

  • 它是速度达人: ChineseBERT 以更少的训练步骤实现了顶尖水平。其他模型需要数百万步才能学习,而 ChineseBERT 却更快达到了目标。这就像是由于有了更好的学习资料,机器人在一半的时间内就学会了这门语言。
  • 它擅长阅读: 在机器阅读理解任务(根据文本回答问题)中,ChineseBERT 创下了新纪录。例如,在 CMRC 2018 数据集上,ChineseBERT 的“Large”版本得分 78.05,超过了之前最好的 77.95。在 CJRC 数据集上,它将精确答案得分提高到了 67.0,超越了竞争对手。
  • 它理解细微差别: 在自然语言推理(判断一个句子是否证明了另一个句子)等任务中,ChineseBERT 也占据了领先地位,在测试集上得分为 81.6,略微超过了排名第二的模型。
  • “少即是多”效应: 研究人员进行了一个有趣的实验,他们给模型的训练数据越来越少。他们发现,即使只有通常数据的 30%,ChineseBERT 的表现仍然优于其他模型。这表明视觉和声音的线索起到了“正则化器”的作用——一种心理护栏,帮助模型更高效地学习语言规则,而不需要死记硬背一切。

论文明确排除和澄清的内容

论文谨慎地指出了哪些做法无效或不是主要焦点。

  • 不仅仅是关于更多数据: 作者明确指出,仅仅增加文本量并不是提高性能的唯一途径。他们的模型证明,添加“正确类型”的信息(字形和拼音)比仅仅向标准模型投喂更多原始文本更有效。
  • 它不是解决所有问题的万能药: 虽然 ChineseBERT 非常强大,但论文指出,对于某些非常简单的任务(例如基准测试已经达到 95% 以上的情感分析),其提升是“微乎其微的”。真正的胜利来自于那些理解字符形状或声音至关重要的复杂任务。
  • 它不仅仅是旧模型的复制品: 研究人员展示了如果你去掉字形或拼音部分,模型的性能会显著下降。事实上,同时移除两者会导致其 F1 分数(衡量准确性的指标)下降约 2 个点。这证明了该模型并非仅仅是“运气好”;它确实需要这些视觉和声音特征才能发挥最佳水平。

总结

论文得出结论,ChineseBERT 是一个重大的进步,因为它尊重了中文的独特本质。通过将汉字符号同时视为图像和声音,该模型比那些仅将文本视为字符串代码的模型更好地捕捉到了语言的“灵魂”。作者认为,这些视觉和语音特征是帮助计算机理解中文语义的强大工具,使它们能够学习得更快、更准确。虽然他们计划在未来训练更大规模的版本,但这项工作表明,有时要教会机器一种语言,你必须给它看图的眼睛和听声的耳朵。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →