A Quantitative Confirmation of the Currier Language Distinction
본 논문은 사전 레이블 없이 베타-이항 혼합 모델이 분할을 복원할 수 있고 지도 분류기가 89.2%의 정확도로 장별 정체성을 예측할 수 있음을 보여줌으로써 보이니치 원고에서 커리어의 A/B 언어 구별의 타당성을 지지하는 정량적 증거를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
보이니치 필사본을 아무도 해독한 적이 없는 암호로 쓰인 신비롭고 고대적인 책이라고 상상해 보세요. 수십 년 동안 프레슬트 커리어라는 암호학자는 이 책이 단순히 하나의 "언어"로 쓰인 것이 아니라, 실제로 그가 언어 A와 언어 B라고 부른 두 가지 뚜렷한 사투리의 혼합물이라는 직감을 가지고 있었습니다.
수년 동안 이는 단어 패턴에 대한 직감에 기반한 이론에 불과했습니다. 하지만 이 새로운 논문에서 저자 크리스토프 파리셀은 단순한 추측이 아닌 수학을 통해 그 직감을 검증하기로 결정합니다. 이 연구를 책의 DNA 에 대한 **법적 감사 (forensic audit)**라고 생각하세요.
다음은 그들이 무엇을 했는지와 무엇을 발견했는지를 간단한 비유로 설명한 내용입니다:
1. 탐정의 도구: "문자 쌍"
읽는 것이 불가능한 단어를 해석하는 대신, 연구자들은 저자가 시각적으로 유사한 문자 사이에서 어떻게 선택했는지 살펴보았습니다.
- 비유: 당신이 이야기를 쓰고 있다고 상상해 보세요. 때로는 "color"라는 단어를 사용하고, 때로는 "colour"를 사용합니다. 만약 이를 무작위로 바꾼다면 단순한 버릇일 뿐입니다. 하지만 책의前半部에서는 항상 "color"를 사용하고,後半部에서는 항상 "colour"를 사용한다면, 이는 두 명의 다른 저자나 두 가지 다른 규칙을 암시합니다.
- 연구: 연구자들은 보이니치 필사체에서 비슷하게 보이는 11 개의 문자 쌍 (예:
d대l, 또는or대ar) 을 선정했습니다. 그런 다음 각 페이지 (folio) 에서 쌍의 각 문자가 사용된 횟수를 세었습니다.
2. 큰 질문: 진짜인가 아니면 우연인가?
연구자들은 세 가지 까다로운 질문을 던졌습니다:
- 단순한 무작위 노이즈인가? 한 언어 내에서 차이점이 우연히 발생할 수 있는 것일까?
- 제본의 속임수인가? 커리어의 원래 구분은 책이 물리적으로 꿰매어진 곳 (시그니처, "quires") 과 우연히 일치했습니다. 아마도 언어가 바뀌어서가 아니라 필사자가 바뀌었기 때문에 책의 스타일이 변한 것일 수 있습니다.
- 예측 가능한가? 라벨 (A 또는 B) 을 숨기고 컴퓨터에게 추측하게 한다면, 문자 수만 보고 어떤 페이지가 어떤 "언어"인지 알아낼 수 있을까요?
3. 결과: "두 가지 언어" 이론이 입증되다
이 연구는 **베타 - 이항 혼합 (Beta-Binomial mixture)**이라는 정교한 통계 모델을 사용했는데, 이는 스마트 분류기처럼 작동합니다. 이 모델은 어느 페이지가 A 인지 B 인지 알지 못한 채 원시 숫자들을 분석했습니다.
- "마법" 같은 분류: 정답을 알려주지 않았음에도 불구하고, 컴퓨터는 페이지를 자연스럽게 두 개의 뚜렷한 그룹으로 분류했습니다. 이는 커리어의 원래 A/B 구분과 약 38% 의 정확도로 일치했는데 (이러한 유형의 데이터에서 통계적으로 매우 큰 성과임), 100 페이지 이상에서 90% 의 확신을 보였습니다.
- "맹검" 테스트: 책의 절반에 있는 패턴을 컴퓨터에게 학습시킨 후, 나머지 절반의 언어를 추측하게 했을 때, **89.2%**의 정확도로 맞혔습니다.
- "제본" 이론 배제: 언어가 단일 꿰매어진 섹션 (시그니처) 내부에서 바뀔 때, 문자 패턴이 급격히 변한다는 사실을 발견했습니다. 이는 변화가 책을 꿰맨 사람과 관련된 것이 아니라 텍스트 자체에 관한 것임을 증명합니다.
4. 문자의 세 가지 "성격 유형"
이 연구는 문자 쌍들이 모두 같은 방식으로 행동하지 않는다는 사실을 발견했습니다. 마치 회사의 서로 다른 유형의 직원들처럼 세 그룹으로 나뉩니다:
- "전환자" (범주형): 이 문자들은 엄격합니다. 페이지가 언어 A 면 한 문자를 사용하고, 언어 B 면 다른 문자로 전환합니다. 이들은 두 가지 언어가 존재함을 증명하는 "신원증"과 같습니다.
- "경향성" (중간형): 이 문자들은 선호도가 있지만 엄격하지는 않습니다. 한 스타일이나 다른 스타일로 기울어지며 미묘한 신호 역할을 합니다.
- "자유 영혼" (자유 변이): 이 문자들은 언어와 전혀 상관없습니다. 페이지가 A 이든 B 이든 무작위로 변합니다.
5. "놀라운" 이상 현상
한 쌍의 문자 (e/ch) 는 이상했습니다. 이 문자 쌍은 페이지를 A 나 B 로 분류하는 데는 도움이 되지 않았지만, 언어가 한쪽에서 다른 쪽으로 전환되는 정확한 순간을 포착하는 데는 가장 뛰어났습니다. 이는 화재가 어느 방에 있는지 알려주지는 않지만, 화재가 시작되는 순간 바로 비명을 지르는 연기 감지기 같은 것입니다.
결론
이 논문은 커리어가 옳았다고 결론 내립니다. 보이니치 필사본은 단일하고 균일한 텍스트가 아닙니다. 두 가지 뚜렷한 "언어"(또는 작성 체계) 사이에는 진정한 구조적 분열이 존재합니다.
- 우연이 아닙니다: 패턴은 너무 강력하여 우연의 일치가 될 수 없습니다.
- 물리적 속임수가 아닙니다: 변화는 책의 동일한 물리적 섹션 내부에서도 발생합니다.
- 예측 가능합니다: 컴퓨터는 문자 통계를 보고 높은 정확도로 언어를 추측할 수 있습니다.
그러나 이 연구는 또한 "A 대 B" 구분은 텍스트의 차이점 중 약 **29%**만 설명한다고 지적합니다. 이는 책에 아직 우리가 파악하지 못한 많은 숨겨진 복잡성과 구조가 남아 있다는 뜻이지만, "두 가지 언어" 이론은 확실히 신화가 아닌 측정 가능한 사실이라는 점입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.