← 최신 논문
💬 NLP

Three Buddhist Vocabularies: Computational Stylometry of the English Pali Canon across Sutta, Vinaya, and Abhidhamma

이 논문은 수타(Sutta), 위나야(Vinaya), 아비담마(Abhidhamma) 피타카에 걸친 영어 팔리 경전의 계산 스타일로메트리 분석을 제시하며, 아비담마의 높은 다양성과 숫자 밀도, 테라바다와 물사라스티바다 위나야의 공유된 법적 유산, 그리고 시간에 따른 상당한 번역 변이와 같은 각 코퍼스의 뚜렷한 어휘적 프로필을 밝히는 동시에, 모든 텍스트가 지프의 법칙을 준수함을 확인한다.

원저자: Joy Bose

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Joy Bose

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

불교 경전인 **티피타카(Tipitaka)**를 서로 다른 저자가 서로 다른 목적으로 집필한 세 개의 별도 구역을 가진 거대한 도서관이라고 상상해 보십시오. 오랫동안 연구자들은 "수트라(Sutta)" 구역(설화와 설법)을 연구해 왔습니다. 이 논문은 마치 새로운 사서가 다른 두 구역인 **비나야(Vinaya, 승려의 규칙집)**와 **아비담마(Abhidhamma, 마음의 기술적 백과사전)**로 걸어 들어가, 언어 자체가 방마다 어떻게 변하는지 컴퓨터 프로그램을 실행해 보는 것과 같습니다.

연구자 조이 보스(Joy Bose)는 심오한 철학을 이해하기 위해 모든 단어를 읽은 것이 아닙니다. 대신, 그들은 어휘가 어떻게 움직이는지 보기 위해 "단어 카운터"와 "패턴 탐지기"를 사용했습니다. 그들이 발견한 내용은 다음과 같습니다.

1. 언어의 세 가지 "풍미"

세 구역을 세 가지 유형의 파티라고 생각해 보십시오.

  • 수트라 구역 (이야기꾼들): 이곳은 가장 큰 방입니다. 이곳의 언어는 캠프파이어 이야기와 같습니다. 이들은 특정 구절(예: "승려가 말했다" 또는 "네 가지 것들")을 자주 반복합니다. 컴퓨터는 이곳의 단어들이 매우 반복적이며, 일정한 리듬감을 형성한다는 것을 발견했습니다.
  • 비나야 구역 (규칙집): 이 방은 법적 지침으로 가득 차 있습니다. 이 구역은 반복성이 높다는 점에서 이야기꾼들과 놀랍도록 유사합니다. 현대어 번역(브라마리)을 읽든 고어 번역(호너)을 읽든, "어휘 리듬"은 거의 동일합니다. 이는 마치 서로 다른 두 사람이 같은 전화번호부를 읽는 것과 같습니다. 단어는 약간 바뀔 수 있지만, 구조는 같습니다.
  • 아비담마 구역 (백과사전): 이곳은 이질적인 존재입니다. 이곳은 52가지 유형의 느낌과 89가지 유형의 의식을 나열하는 기술적 매뉴얼입니다. 수많은 구체적이고 고유한 것들의 이름을 불러야 하기 때문에 훨씬 더 다양한 단어를 사용합니다. 이곳은 반복성이 적으며, 이야기보다는 현대 과학 교과서에 더 가깝게 느껴집니다.

2. "집프(Zipf)" 테스트: 주인공은 누구인가?

연구자들은 **집프의 법칙(Zipf's Law)**이라는 유명한 수학 규칙을 사용했습니다. 한 록 콘서트에서 한 가수가 노래의 50%를 부르고, 두 번째 가수가 25%를 부르며, 나머지는 남은 시간을 나누어 갖는다고 상상해 보십시오. 대부분의 텍스트에서는 몇 개의 흔한 단어(예: "그", "그리고", "그것")가 상위권을 차지합니다.

  • 이야기와 규칙 속에서: 상위 10개 단어는 대부분 문법 보조어(예: "그것" 또는 "그들")입니다.
  • 백과사전 속에서: 컴퓨터는 이상한 점을 발견했습니다. **"의식(Consciousness)"**이라는 단어가 상위 10위 안으로 뛰어들어 문법 단어들을 밀어냈습니다. 이는 마치 기술 매뉴얼 도서관에서 "엔진"이라는 단어가 너무 자주 등장하여 "그(The)"라는 단어를 압도하는 것과 같습니다. 이는 백과사전이 단순히 이야기를 하는 것이 아니라 특정 개념에 집착하고 있음을 증명합니다.

3. "어휘 중복" (얼마나 공유하는가?)

연구자들은 다음과 같이 질문했습니다. 만약 당신이 규칙집에서 한 움큼의 단어를 집어 든다면, 그중 몇 개나 이야기집에서도 발견될까요?

  • 결과: 규칙집 단어의 약 절반이 이야기집에도 있습니다. 그들은 같은 전통의 일부이기 때문에 공통된 언어를 공유합니다.
  • 시간 여행 테스트: 연구자들은 테라바다(스리랑카/태국에서 사용) 규칙집과 2,000년 전의 물사르바스티바다(티베트에서 사용) 규칙집을 비교했습니다. 비록 2,000년 전에 갈라졌음에도 불구하고, 그들은 여전히 **50%**의 어휘를 공유합니다. 이는 현대 미국 영어 사전과 19세기 영국 영어가 여전히 절반의 단어를 공유하는 것과 같으며, 그들이 같은 가계도에서 나왔음을 증명합니다.

4. "번역의 변화" (시간에 따라 언어가 어떻게 변하는가)

연구자들은 정확히 동일한 규칙집 텍스트를 가져와 두 가지 번역본을 비교했습니다. 하나는 1938년의 것이고, 다른 하나는 2026년의 것입니다.

  • 충격적인 사실: 두 번역본은 단어의 **24%**만을 공유했습니다! 이는 매우 큰 격차입니다.
  • 원인: 의미가 변한 것이 아니라, 단어가 변한 것이었습니다.
    • 예시 1: 1938년에는 깊은 명상 상태를 "musing"(백일몽처럼 들림)이라고 불렀습니다. 2026년에는 이를 "absorption"(훨씬 더 집중된 느낌)이라고 부릅니다.
    • 예시 2: 심각한 잘못을 1938년에는 "defeat"(패배)라고 불렀지만, 2026년에는 "expulsion"(추방)이라고 부릅니다.
    • 예시 3: 2026년 번역가는 해부학 및 성별 문제에 대해 더 직접적이었던 반면, 1938년 번역가는 예의 바르고 모호한 언어를 사용했습니다.

5. "숫자" 계산

백과사전(아비담마)은 숫자를 세는 것에 집착합니다. 숫자 단어(하나, 둘, 셋, 넷)를 **3.26%**의 비율로 사용합니다. 이야기집은 이를 **2.09%**만 사용합니다. 이는 타당합니다. 89가지 유형의 의식을 나열하려면, 숲속을 걷는 승려의 이야기를 하는 것보다 "하나", "둘", "셋"이라는 말을 훨씬 더 많이 해야 하기 때문입니다.

요약

이 논문은 언어적 X-레이와 같습니다. 이 논문은 부처가 가르친 깊은 내용을 상세히 알려주지는 않지만, 그 가르침이 어떻게 포장되었는지를 보여줍니다.

  • 이야기는 리듬감이 있고 반복적입니다.
  • 규칙은 절차적이며 시간을 초월하여 공유됩니다.
  • 백과사전은 조밀하고 기술적이며 고유한 용어들로 가득 차 있습니다.
  • 번역은 88년 사이에 급격히 변하며, 오래된 단어를 현대적이고 정밀한 단어로 교체합니다.

연구자는 컴퓨터를 통해 이러한 패턴을 명확하게 볼 수 있지만, 이러한 아이디어들이 시간이 흐름에 따라 어떻게 진화했는지에 대한 더 깊은 질문은 개념적 차원의 인간적 분석이 필요하며, 이것이 그들의 다음 단계 작업이라고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →