Zipf's Law of Abbreviation in a Logographic Script: Coding-Theoretic Bounds on Chinese Character Stroke Counts
本研究は、中国語の漢字の画数が最適な符号化限界に対して顕著な圧縮性を示すことを実証することにより、ジップの短縮則を表意文字へと拡張するものであり、このパターンは文字体系の型に概ね依存せず、歴史的な簡略化改革によってさらに強化される一方で、文字の曖昧さを回避するための二次元的な画数配置という構造的必要性と均衡を保っている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言語はトレードオフの体系である。一方には、明確に理解される必要性があり、もう一方には、素早く話し書きたいという人間の欲求がある。70年以上にわたり、言語学者は、言語がこの問題にどのように対処するかについて、一貫したパターンを観察してきた。それは、最も頻繁に使われる言葉は、必然的に短くなる傾向があるということである。これは「短縮の法則」として知られている。これは音声、書かれた単語の長さ、さらには動物の鳴き声にも現れる。考え方は単純である。もしあなたが一日に百万回その言葉を言うなら、短くしておく方が得である。もし年に一度しか言わないのであれば、長くても構わない。しかし、最近、より深い問いが浮上している。言語がこの規則に従っていることは分かっているが、効率の絶対的な限界にどの程度まで近づいているのだろうか。もし完璧に設計されたとしたら、言語はどれほど短くなり得るのか、そして、その潜在的な可能性のうち、どれほどが未だに使われずに残されているのだろうか。
これまで、この問いは主に英語やスペイン語のようなアルファベット言語において研究されてきた。そこでは、単語のコストは含まれる文字数によって測定される。新しい研究は、この調査を全く異なる種類の表記体系、すなわち中国語へと持ち込んだ。中国語において、基本単位は文字ではなく「漢字」であり、漢字を書くコストは、描画に必要な筆画数(ストローク数)によって測定される。漢字は5つの基本的な筆画タイプから構成されているため、研究者たちは、アルファベットのスクリプトでは不可能な精度で、理論的な効率の限界を算出することができる。標準的な漢字セットの各文字の画数を、実際の使用頻度と照らし合わせて分析することで、この研究は、中国語の表記体系が驚くほど効率的である一方で、非常に特定の構造的な理由によって完璧には至っていないことを明らかにしている。
研究者たちはまず、膨大なデータの収集から始めた。彼らは20,902個の標準的な漢字のすべての筆順を含むデータベースを取り出し、それを2つの巨大な実世界のテキストコレクションと照合した。一つのコレクションは、編集された書籍や新聞から抽出された約2億6,000万文字を含み、もう一つは、ソーシャルメディアの投稿から抽出された1億9,000万文字以上の文字を含んでいた。彼らはすべての文字の画数をカウントし、人々が実際に読んでいるテキストを書くのに必要な平均画数を算出した。結果は予想通りのパターンを裏付けた。最も頻繁に使われる文字は、確かに書くのが最も単純であった。辞書全体の平均的な文字は約12.7画を必要とするが、通常のテキストを読んでいる際に出会う平均的な文字は約7.2画しか必要としなかった。全テキストの約4割を占める頻出上位100文字は、平均してわずか6画であった。
このシステムが実際にどれほど効率的であるかを理解するために、チームは実世界のテキストを2つの理論的な極端なケースと比較した。第一のケースは、ランダムな配置であり、最も一般的な単語に、純粋な偶然によって最も長く複雑な文字が割り当てられた場合である。第二のケースは、完璧な配置であり、最も一般的な単語に最短の文字が割り当てられ、最も稀な単語に最長の文字が割り当てられた場合である。実際の中国語の表記体系はその中間であった。ランダムなものよりはるかに優れていたが、完璧ではなかった。研究では、システムがその完璧な配置にどれだけ近いかを測定する「最適性スコア」を算出した。簡体字中国語のスコアは0.668であり、これはシステムが理論上の最善に対して約3分の2の地点にあることを意味する。この数値は、アルファベットや音節文字を用いる数十の他の言語で見られるスコアと驚くほど似ており、コミュニケーション・システムがいかに圧縮可能であっても、有用性を維持しながら達成できる圧縮には普遍的な限界があることを示唆している。
しかし、研究は単に効率性を測定することにとどまらなかった。中国の表記体系は5つの筆画タイプという閉じた集合を使用しているため、研究者たちは可能な数学的限界を計算することができた。彼らは、もしシステムが完全に効率的なコード、つまり文字の順序だけで単語が定義される文字の列であったならば、平均的な文字はわずか約4.34画で済むはずであることを突き止めた。実際の平均が7.22画である事実は、システムが絶対的な最小値よりも約1.66倍多くの画数を使用していることを意味する。典型的なアルファベット言語では、このような差は単なる非効率性や計画性の欠如として片付けられるかもしれない。しかし、研究者たちは、この差は間違いではなく、「特徴」であることを発見したのである。
システムがこれ以上圧縮できない理由は、文字がどのように構築されているかにある。もし中国語が、文字の順序だけで単語を定義する、一方向的なコード(文字列)のような完璧なものであったなら、すべての文字は一意の筆画シーケンスを持つはずである。しかし中国語では、多くの異なる文字が全く同じ筆画シーケンスを共有している。例えば、「人(person)」、「入(enter)」、「八(eight)」の筆画は、その順序において同一であり、それらはページ上の筆画の空間的な配置によってのみ区別される。同様に、「学(scholar)」と「土(earth)」の文字は、同じ順序で同じ筆画を使用しているが、一本の水平線の長さが異なる。筆画のシーケンスが一意ではないため、視覚的な構成要素を再利用する能力を失うことなく、数学的限界までシステムを圧縮することはできないのである。冗長に見える「余分な」筆画は、実は、二次元的な構造を作り出し、視覚的な構成要素を再利用することを可能にするために必要なものである。この空間的な配置によって、表記体系は透明性を獲得している。ある読者が「水(water)」という文字を知っていれば、たとえ見たことがなくても、その構成要素を含む他の文字の意味を推測できることが多い。
また、研究はシステムを改善できるかどうかを確認するために、主要な歴史的事象についても調査した。20世紀半ば、中国は数千の文字の形状を変更し、しばしば画数を減らす簡略化改革を行った。研究者たちは、この改革を制御された実験として扱った。彼らは、この改革が表記システムの効率を高めることに成功し、最適性スコアを0.555から0.668へと引き上げたことを発見した。決定的なのは、この改革が最も頻度の高い文字を対象とし、それらを平均で2画短縮した一方で、稀で複雑な文字にはほとんど手を加えなかったことである。これは、完璧なコーディング・システムが行うべきこと、すなわち、最も頻繁に使用される形態において最大の労力を節約するという行為そのものである。この改革がこのような改善を達成したという事実は、現在のシステムと理論的限界との間の残されたギャップが、現実的かつ実行可能なものであることを示唆しているが、同時に、膨大な圧縮の大部分は、いかなる公式の改革が行われるずっと前、何世紀にもわたる自然な使用を通じてすでに完了していたことも示している。
最終的に、論文は、中国の表記体系は完璧に達することに失敗しているのではなく、別の問題を解決しているのだと結論づけている。それは、圧縮を犠牲にして、明晰さと構造を獲得しているのである。「余分な」画数を使用するという「非効率性」は、意味が認識可能なパーツによって空間的に配置されるシステムのために支払われる代償である。この研究は、短縮の法則は成立しているものの、圧縮の限界は単に画数や文字数を数えることの問題ではないことを裏付けている。それは、スクリプト自体のアーキテクチャによって決定されるのである。独自の視覚的論理を持つ中国語が、アルファベット言語と同じ効率範囲に収まっているという事実は、すべての人間によるコミュニケーション・システムが、同じ根本的な圧力――短くしたいという衝動と、明確でありたいという欲求――の間でバランスを取っていることを示唆している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。