← 最新论文
⚡ electrical engineering

Zipf's Law of Abbreviation in a Logographic Script: Coding-Theoretic Bounds on Chinese Character Stroke Counts

本研究通过证明汉字笔画数相对于最优编码界限表现出显著的压缩,将齐普夫(Zipf)的缩写定律扩展至表意文字,这一模式在很大程度上独立于文字类型,并因历史上的简化改革而进一步增强,同时又受到用于字符消歧的二维笔画排列结构必要性的制衡。

原作者: Mustafa Ergen

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Mustafa Ergen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

语言是一个权衡的系统。一方面,需要清晰地被理解;另一方面,是人类想要快速说话或写作的欲望。七十多年来,语言学家观察到一个持续存在的模式,即语言如何解决这个问题:我们最常用的词往往是最短的。这被称为缩写定律(law of abbreviation)。它出现在口语的发音中,出现在书面词汇的长度中,甚至出现在动物的鸣叫声中。这个道理很简单:如果你一天要说一百万次一个词,那么把它变短是值得的。如果你一年只说一次,那么长一点也无所谓。但一个更深层的问题最近浮现了。我们知道语言遵循这一规则,但它们究竟在多大程度上接近了效率的绝对极限?如果一种语言是经过完美设计的,它能有多短?而这些潜力中有多少尚未被利用?

直到现在,这个问题主要是在像英语或西班牙语这样的字母文字中进行研究的,在这些语言中,一个词的成本是由它包含的字母数量来衡度。一项新研究将这项调查带到了一种完全不同的书写系统中:中文。在中文中,基本单位不是字母,而是汉字,而书写一个汉字的成本是由绘制该字符所需的笔画数来衡度的。由于汉字是由一组固定的五种基本笔画类型构建的,研究人员可以以前所未有的精度计算出理论上的效率极限,这在字母文字中是无法实现的。通过将标准字集中每个字符的笔画数与其实际使用频率进行对比分析,研究显示,中文书写系统非常高效,但由于一个非常具体的结构性原因,它并未达到完美。

研究人员首先收集了海量数据。他们提取了一个包含所有 20,902 个标准汉字所有笔顺的数据库,并将其与两个庞大的现实文本集合进行匹配。其中一个集合包含了来自编辑过的书籍和报纸的近 2.6 亿个汉字,而另一个则包含了来自社交媒体帖子的超过 1.9 亿个汉字。他们统计了每个字符的笔画数,并计算了人们实际阅读文本时所需的平均笔画数。结果证实了预期的模式:最常见的字符确实是最简单的。整个字典中的平均字符大约需要 12.7 画,但在阅读普通文本时遇到的平均字符仅需约 7.2 画。出现频率最高的 100 个字符构成了几乎 40% 的所有书面文本,它们的平均笔画数仅为 6 画。

为了了解这个系统的效率究竟如何,团队将现实世界的文本与两个理论上的极端情况进行了比较。第一种是随机排列,即通过纯粹的偶然性,将最常用的词分配给最长、最复杂的字符。第二种是完美排列,即将最常用的词分配给最短的字符,而将最罕见的词分配给最长的字符。实际的中文书写系统介于两者之间。它比随机排列要好得多,但并非完美。研究计算了一个最优性得分(optimality score),该得分衡量了系统距离完美排列的接近程度。对于简化字,得分是 0.668,这意味着该系统大约达到了理论最佳水平的三分之二。这个数字与在数十种使用字母和音节文字的其他语言中发现的词长得分惊人地相似,这表明任何通信系统在保持可用性的同时,其压缩程度都存在一个普遍的极限。

然而,这项研究不仅限于测量效率。由于中文书写系统使用一组由五种基本笔画类型组成的闭集,研究人员可以计算出可能的绝对数学极限。他们确定,如果该系统是一个完美的编码系统,那么在连续文本中的平均字符只需约 4.34 画。现实平均值是 7.22 画这一事实意味着,该系统使用的笔画数约为绝对最小值的 1.66 倍。在典型的字母语言中,这种差距可能会被视为简单的低效或缺乏规划。但研究人员发现,这种差距并非错误,而是一种特性。

该系统无法进一步压缩的原因在于字符是如何构建的。如果中文是一个完美的、一维的编码(就像一串仅靠顺序定义单词的字母),那么每个字符都应该具有唯一的笔画序列。但在中文中,许多不同的字符拥有完全相同的笔画序列。例如,“人”、“入”和“八”的笔画序列是完全一致的;它们仅通过这些笔画在页面上的空间排列来区分。同样,“学”和“土”使用相同的笔画且顺序相同,但区别在于其中一条横线的长度。因为笔画序列不是唯一的,所以该系统无法在不丧失辨别单词能力的情况下压缩到数学极限。那些看似冗余的“额外”笔画,实际上是创造二维结构所必需的,这种结构允许视觉组件被重复使用。这种空间排列使书写系统具有透明性:一个认识“水”字的读者,通常可以根据其包含的相同部件来推测其他字符的含义,即使他从未见过这些字符。

研究还考察了一次重大的历史事件,以观察该系统是否可以得到改进。在二十世纪中叶,中国经历了简化改革,改变了数千个字符的形状,通常减少了笔画数。研究人员将这次改革视为一项受控实验。他们发现,改革成功提高了书写系统的效率,将最优性得分从 0.555 提高到了 0.668。至关重要的是,改革针对的是高频字符,使其平均减少了两个笔画,而对罕见且复杂的字符则基本保持不变。这正是完美编码系统会做的事情:在最常用的形式上节省最多的精力。改革实现了这种改进的事实表明,当前系统与理论极限之间的剩余差距是真实存在的且是可以操作的,但也表明在任何官方改革之前,绝大部分的压缩已经通过数百年的自然使用完成了。

最终,论文得出结论:中文书写系统并非未能达到完美,而是正在解决一个不同的问题。它牺牲了一定的压缩率,以换取清晰度和结构。使用比数学最小值更多的笔画所带来的“低效”,是为一个通过空间排列构建识别性部件的系统所付出的代价。研究证实,虽然缩写定律依然成立,但压缩的极限不仅仅是计数笔画或字母的问题。它是由脚本本身的架构决定的。中文凭借其独特的视觉逻辑,落在与字母语言相同的效率范围内,这一事实表明,所有人类通信系统都在平衡着同样的根本压力:追求简洁的驱动力与保持清晰的需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →