← 최신 논문
⚡ electrical engineering

Zipf's Law of Abbreviation in a Logographic Script: Coding-Theoretic Bounds on Chinese Character Stroke Counts

본 연구는 중국어 한자의 획수가 최적 코딩 경계에 비해 유의미한 압축을 보여준다는 점을 입증함으로써 지프의 약어 법칙을 로그 그래픽 문자로 확장하며, 이러한 패턴은 문자 유형과 크게 무관하게 나타나고 역사적인 간략화 개혁에 의해 더욱 강화되는 동시에 글자 식별을 위한 2차원적 획 배열의 구조적 필요성과 균형을 이룬다.

원저자: Mustafa Ergen

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Mustafa Ergen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어는 절충의 체계입니다. 한쪽에는 명확하게 이해되어야 할 필요성이 있고, 다른 한쪽에는 빠르게 말하고 쓰고 싶어 하는 인간의 욕구가 있습니다. 70년이 넘는 시간 동안 언어학자들은 언어가 이 문제를 해결하는 방식에서 일관된 패턴을 관찰해 왔습니다. 우리가 가장 자주 사용하는 단어일수록 더 짧다는 것입니다. 이것은 '축약의 법칙'으로 알려져 있습니다. 이는 구어뿐만 아니라 문자의 길이, 심지어 동물의 울음소리에서도 나타납니다. 아이디어는 간단합니다. 하루에 백만 번 말하는 단어라면 짧게 만드는 것이 이득입니다. 일 년에 한 번만 말한다면 길든 상관없습니다. 하지만 최근 더 깊은 질문이 제기되었습니다. 우리는 언어가 이 규칙을 따른다는 것은 알고 있지만, 과연 얼마나 절대적인 효율성의 한계에 근접해 있는가 하는 점입니다. 만약 언어가 완벽하게 설계된다면 얼마나 더 짧아질 수 있으며, 그 잠재력 중 얼마만큼이 사용되지 않은 채 남아 있는 것일까요?

지금까지 이 질문은 영어 나 스페인어와 같은 알파벳 언어를 중심으로 주로 연구되어 왔으며, 여기에서 단어의 비용은 포함된 철자의 개수로 측정됩니다. 새로운 연구는 이 조사를 완전히 다른 종류의 문자 체계인 중국어로 가져왔습니다. 중국어에서 기본 단위는 철자가 아니라 글자(문자)이며, 글자를 쓰는 비용은 그것을 그리는 데 필요한 획의 수로 측정됩니다. 중국어 글자는 고정된 다섯 가지 기본 획 유형으로 구성되어 있기 때문에, 연구자들은 알파벳 문법에서는 불가능한 정밀도로 이론적 효율성의 한계를 계산할 수 있습니다. 표준 글자 세트의 모든 획 수를 실제 사용 빈도와 대조하여 분석함으로써, 이 연구는 중국어 쓰기가 놀라울 정도로 효율적이지만, 매우 구체적이고 구조적인 이유 때문에 완벽함에는 미치지 못한다는 사실을 밝혀냈습니다.

연구진은 먼저 방대한 양의 데이터를 수집했습니다. 그들은 20,902개의 표준 중국어 글자에 대한 모든 획 순서를 담은 데이터베이스를 구축하고, 이를 두 개의 거대한 실제 텍스트 모음과 대조했습니다. 한 컬렉션은 편집된 도서와 신문에서 추출한 약 2억 6천만 개의 글자를 포함하고 있었고, 다른 하나는 소셜 미디어 게시물에서 가져온 1억 9천만 개 이상의 글자를 보유하고 있었습니다. 그들은 모든 글자의 획 수를 세고, 사람들이 실제로 읽는 텍스트를 쓰는 데 필요한 평균 획 수를 계산했습니다. 결과는 예상된 패턴을 확인해주었습니다. 가장 흔한 글자들이 실제로 쓰기에 더 단순하다는 점입니다. 전체 사전에 있는 글자의 평균 획 수는 약 12.7획이지만, 일반적인 텍스트를 읽을 때 마주치는 평균 글자 수는 약 7.2획에 불고했습니다. 전체 텍스트의 거의 40%를 차지하는 가장 빈번한 100개의 글자는 평균적으로 단 6획이었습니다.

이 시스템이 실제로 얼마나 효율적인지 이해하기 위해, 연구팀은 실제 텍스트를 두 가지 이론적 극단과 비교했습니다. 첫 번째는 무작위 배열로, 가장 흔한 단어들에 가장 길고 복잡한 글자를 우연히 배정한 경우였습니다. 두 번째는 완벽한 배열으로, 가장 흔한 단어들에는 가능한 가장 짧은 글자를 배정하고, 가장 드문 단어들에는 가장 긴 글자를 배정한 경우였습니다. 실제 중국어 쓰기 체계는 그 중간 어디쯤에 위치했습니다. 무작위보다는 훨씬 나았지만, 완벽하지는 않았습니다. 연구팀은 시스템이 완벽한 배열에 얼마나 근접했는지를 측정하는 최적성 점수를 계산했습니다. 간체자의 경우 점수는 0.668이었는데, 이는 시스템이 이론적 최선에 대해 약 3분의 2 지점에 와 있음을 의미합니다. 이 수치는 알파벳과 음절 문자를 사용하는 수십 개의 다른 언어에서 발견된 단어 길이 점수와 놀라울 정도로 유사하며, 이는 어떤 의사소통 시스템이 유용성을 유지하면서 압축될 수 있는 보편적인 한계가 존재함을 시사합니다.

하지만 연구는 단순히 효율성을 측정하는 것에 그치지 않았습니다. 중국어 쓰기 체계는 다섯 가지의 닫힌 획 유형을 사용하기 때문에, 연구자들은 가능한 수학적 한계치를 계산할 수 있었습니다. 그들은 만약 시스템이 완벽하게 효율적인 코드라면, 실행 텍스트에서의 평균 글자가 약 4.34획이 되어야 한다는 것을 결정했습니다. 실제 평균이 7.22획이라는 사실은 시스템이 절대적 최소치보다 약 1.66배 더 많은 획을 사용하고 있음을 의미합니다. 전형적인 알파벳 언어에서 이러한 격차는 단순한 비효율성이나 계획의 부재로 치부될 수 있습니다. 그러나 연구진은 이 격차가 실수가 아니라 하나의 특징임을 발견했습니다.

시스템을 더 압축할 수 없는 이유는 글자가 구성되는 방식에 있습니다. 만약 중국어가 순서만으로 단어를 정의하는 철자의 문자열과 같은 완벽한 1차원 코드라면, 모든 글자는 고유한 획의 순서를 가질 것입니다. 하지만 중국어에서는 많은 서로 다른 글자들이 정확히 동일한 획 순서를 공유합니다. 예를 들어, '사람(人)', '들어가다(入)', '여덟(八)'의 획 순서는 동일하며, 이들은 페이지 위의 공간적 배치에 의해서만 구별됩니다. 마찬가지로, '학자(學)'와 '땅(土)'을 나타내는 글자들은 동일한 순서로 획을 사용하지만, 하나의 가로선 길이에 의해 차이가 납니다. 획의 순서가 고유하지 않기 때문에, 시각적 구성 요소를 재사용할 수 있는 2차원적 구조를 유지하면서 수학적 한계까지 압축하는 것은 불가능합니다. 중복되어 보이는 이 '여분의' 획들은 사실 시각적 구성 요소들을 재사용할 수 있게 해주는 2차원 구조를 만들기 위해 필수적입니다. 이러한 공간적 배치는 쓰기 체계를 투명하게 만듭니다. 즉, '물(水)'이라는 글자를 아는 독자는 설령 본 적이 없더라도 그 글자를 포함하고 있는 다른 글자들의 의미를 추측할 수 있습니다.

연구는 또한 시스템을 개선할 수 있는지 확인하기 위해 주요한 역사적 사건을 조사했습니다. 20세기 중반, 중국은 수천 개의 글자 모양을 바꾸어 종종 획수를 줄이는 간체화 개혁을 단행했습니다. 연구진은 이 개혁을 통제된 실험으로 다루었습니다. 그들은 이 개혁이 글자 수를 줄임으로써 쓰기 체계의 효율성을 성공적으로 높였다는 것을 발견했습니다. 구체적으로, 개혁은 가장 빈번한 글자들을 대상으로 하여 평균 2획을 줄인 반면, 드문 복잡한 글자들은 거의 건드리지 않았습니다. 이는 완벽한 코딩 시스템이 수행하는 방식과 정확히 일치합니다. 즉, 가장 자주 사용되는 형태에서 가장 많은 노력을 절감하는 것입니다. 이 개혁이 이러한 개선을 달성했다는 사실은 현재의 시스템과 이론적 한계 사이의 남은 격차가 실재하며 조치 가능한 것이라는 점을 시사하지만, 동시에 공식적인 개혁이 일어나기 훨씬 전부터 이미 대다수의 압축이 자연스럽게 이루어졌음을 보여줍니다.

결론적으로, 논문은 중국어 쓰기 체계가 완벽함에 도달하지 못하고 있는 것이 아니라, 다른 문제를 해결하고 있다고 결론짓습니다. 중국어는 명료함과 구조를 얻기 위해 압축을 희생합니다. 수학적 최소한보다 더 많은 획을 사용하는 '비효율성'은 의미가 인식 가능한 부분들로 구성되어 공간상에 배치되는 체계를 위해 지불하는 대가입니다. 이 연구는 축약의 법칙이 유효하지만, 압축의 한계가 단순히 획이나 철자를 세는 문제만이 아님을 확인해 줍니다. 그것은 스크립트 자체의 구조에 의해 결정됩니다. 독특한 시각적 논리를 가진 중국어가 알파벳 언어들과 동일한 효율성 범위에 있다는 사실은, 모든 인간의 의사소통 체계가 '짧아지고자 하는 욕구'와 '명확해야 한다는 필요성'이라는 동일한 근본적인 압박 사이에서 균형을 잡고 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →