← 최신 논문
💬 NLP

An Information-Theoretic Approach to Identifying Formulaic Clusters in Textual Data

본 논문은 고차원 텍스트 데이터에서 정형화된 클러스터와 문체적 층위를 식별하기 위해 가중 자기 정보 분포를 활용하는 정보 이론적 알고리즘을 제시하며, 이를 통해 다수의 저자가 참여한 히브리 성서 내의 구성적 패턴을 정량적으로 분석하는 데 있어 해당 알고리즘의 유효성을 입증한다.

원저자: Gideon Yoffe, Yair Segev, Barak Sober

게시일 2026-07-29
📖 5 분 읽기🧠 심층 분석

원저자: Gideon Yoffe, Yair Segev, Barak Sober

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 고대 도서관 내부의 미스터리를 풀려는 탐정이라고 상상해 보십시오. 이 도서관는 단순히 무작위적인 이야기들로 가득 찬 것이 아닙니다. 이곳은 수천 년 동안 수백 명의 서로 다른 사람들에 의해 쓰이고, 편집되고, 필사된 텍스트들의 집합체입니다. 어떤 부분은 독특한 목소리를 가진 단일 저자에 의해 쓰였지만, 어떤 부분은 서로 다른 출처에서 가져온 것들을 꿰매어 만든 패치워크 퀼트처럼 조각조각 이어 붙여진 것입니다. 문제는, 재단사들에게 직접 물어보지 않고 어떻게 어떤 조각이 어느 재단사의 것인지 알아낼 수 있느냐는 것입니다. 단순히 단어만 봐서는 안 됩니다. 왜냐하면 어떤 작가들은 서로 다른 이유로 같은 단어를 사용할 수도 있기 때문입니다. 따라서 당신은 글의 "리듬"이나 "예측 가능성"을 측정할 방법이 필요합니다.

여기서 **정보 이론(Information Theory)**이라는 과학의 한 분야가 등장합니다. 이것을 정보 이론을 통해 문장의 다음 단어를 읽을 때 당신이 얼마나 '놀라게 되는지'를 측정하는 방법이라고 생각해 보십시오. 만약 당신이 무엇이든 일어날 수 있는 이야기를 읽고 있다면, 당신은 끊임없이 놀라게 될 것입니다. 즉, 정보량이 높습니다. 그리고 이 글은 "느슨하거나" "창의적"인 느낌을 줍니다. 하지만 만약 당신이 요리법이나 법률 계약서를 읽고 있다면, 다음에 어떤 단어가 올지 정확히 알 수 있습니다. "...한 컵의"라는 말 뒤에는 거의 항상 "밀가루"가 따라옵니다. 이 예측 가능성은 정보량이 낮다는 것을 의미하며, 이는 패턴이 경직되어 있다는 뜻입니다. 이 논문에서 저자들은 이 '놀라움'(또는 그 결여)이라는 개념을 사용하여 고대 텍스트 속의 숨겨진 패턴을 찾아내고자 합니다. 그들은 글의 "레시피 같은" 부분과 "이야기 같은" 부분을 단지 단어의 예측 가능성을 측정함으로써 자동으로 식별할 수 있는지 확인하고자 합니다.

탐정의 새로운 도구

저자인 기디언 요페(Gideon Yoffe), 야이르 세게브(Yair Segev), 바라크 소버(Barak Sober)는 새로운 디지털 돋보기를 만들어냈습니다. 그들은 이를 **비지도 정보 이론적 접근 방식(unsupervised information-theoretic approach)**이라고 부릅니다. 이를 나누어 설명해 보겠습니다. "비지도(Unsupervised)"란 컴퓨터가 무엇을 찾아야 할지 알려주는 스승 없이도 스스로 알아낸다는 것을 의미합니다. "정보 이론적(Information-theoretic)"이라는 것은 수학을 사용하여 예측 가능성을 측정한다는 뜻입니다.

그들의 핵심 아이디어는 단순하지만 강력합니다: 정형화된 텍의(Formulaic text)는 예측 가능하다. 작가가 조상의 명단이나 종교 법전과 같이 엄격한 구조를 사용할 때, 그들은 동일한 구절을 반복해서 사용합니다. 이러한 구절들이 매우 자주 등장하기 때문에, 그것들은 매우 예측 가능해집니다. 정보 이론의 언어로 말하자면, 예측 가능한 것들은 **자기 정보량(self-information)**이 낮습니다(낮은 놀라움). 반면 예측 불가능하고 창의적인 스토리텔링은 자기 정보량이 높습니다(높은 놀라움).

연구팀은 텍스트를 스캔하여 유난히 예측 가능한 글의 덩어리들을 찾는 알고리즘을 개발했습니다. 이 알고리즘은 단순히 추측하는 것이 아니라, 확률 모델이 보는 단어들에 대해 얼마나 '놀랄 것인지'를 바탕으로 모든 텍스트 부분에 대한 점수를 계산합니다. 만약 어떤 섹션이 반복적이고 정형화된 구절들로 가득 차 있다면, 모델은 전혀 놀라지 않을 것이고 점수는 낮게 유지됩니다. 만약 그 섹션이 거칠고 창의적인 서사라면, 점수는 올라갑니다. 이처럼 낮은 점수를 가진 섹션들을 함께 그룹화함으로써, 알고리즘은 "정형화된 클러스터(formulaic clusters)", 즉 다른 손길에 의해 쓰였거나 다른 목적을 위해 작성된 것처럼 느껴지는 텍스트의 부분들을 분리해 낼 수 있습니다.

고대 텍스트에 도구 테스트하기

저자들은 이 새로운 도구가 실제로 작동하는지 확인하기 위해, 히브리 성경, 특히 첫 세 권인 창세기, 출애굽기, 레위기에서 테스트를 진행했습니다. 이 책들은 학자들 사이에서 "합성된(composite)" 것으로 유명한데, 이는 여러 출처가 함께 엮여 있다고 믿어지기 때문입니다. 가장 논쟁적인 질문 중 하나는, 매우 구조적이고 법률적이며 반복적인 것으로 알려진 **제사장 출처(P)**를 다른 서사적인 부분들과 어떻게 분리하느냐 하는 것입니다.

연구원들은 단순히 단어를 본 것이 아니라, 단어의 구조를 보았습니다. 그들은 텍스트를 작은 덩어리(문장이나 구절 같은)로 나누고 특정 패턴이 얼마나 자주 나타나는지 계산했습니다. 그런 다음 알고리즘을 실행하여 텍스트를 두 그룹으로 자연스럽게 나눌 수 있는지 확인했습니다: 하나는 매우 반복적이고(낮은 놀라움), 다른 하나는 더 다양하고(높은 놀라움) 변칙적인 그룹입니다.

결과는 다음과 같았습니다:

  • 창세기에서: 그들은 긴, 지루한 족보 목록과 아브라함 및 이삭의 흥미진진한 이야기 사이의 차이를 살펴보았습니다. 알고리즘은 족보를 매우 예측 가능하고 정형화된 클러스터로 성공적으로 식별해 냈습니다. 이는 가족 목록이 엄격하고 반복적인 패턴을 따르는 반면, 이야기는 더 유동적이기 때문에 타당한 결과입니다.
  • 출애굽기에서: 그들은 성막 건축과 종교 의례에 관한 법을 포함하는 제사장(P) 섹션과 비제사장적 서사 섹션 사이의 분리를 테스트했습니다. 알고리즘은 이 두 층을 안정적으로 분리해 냈으며, 이는 전통적인 학자들이 오랫동안 믿어온 바와 일치했습니다. 제사장 부분은 반복적인 지시 사항들로 가득 차 있었기에 "낮은 놀라움" 구역으로 나타났습니다.
  • 레위기에서: 이것이 가장 까다로운 테스트였습니다. 레위기는 법들로 가득 차 있지만, 학자들은 여기에 제사장 출처(P)와 이후의 "성결 법전(H)"이라는 두 가지 서로 다른 층이 포함되어 있는지에 대해 논쟁합니다. 둘 다 반복적이지만, 미묘한 차이가 있습니다. 저자들은 자신들의 방법이 이 둘을 구별할 수 있다는 것을 발견했지만, 이는 텍를 적절한 "렌즈"를 통해 바라보았을 때만 가능했습니다. 분석할 텍스트 덩어리의 크기에 따라, 알고리즘은 때때로 제사장 법을 가장 반복적인 것으로 강조하기도 했고, 때로는 성결 법전을 강조하기도 했습니다. 이는 두 층 모두 정형화되어 있지만, 서로 다른 규모에서 나타나는 서로 다른 종류의 패턴을 따르고 있음을 시사합니다.

얼마나 확신하는가?

저자들은 자신들의 방법이 성경의 미스터리를 단번에 해결했다고 주장하는 데 주의를 기울입니다. 대신, 그들은 자신들의 방법이 이러한 차이를 정량화하는 방법을 제시한다는 것을 보여줍니다.

그들은 먼저 통제된 환경에서 패턴을 찾을 수 있는지 확인하기 위해 컴퓨터로 생성된 가짜 데이터로 알고리즘을 테스트했습니다. 이러한 시뮬레이션에서 그들의 방법은 데이터가 희소하고 고차원적인 경우(이는 고대 텍스트의 특성과 정확히 일치합니다), 표준 클러스터링 도구(k-means 또는 Gaussian Mixture Models 등)보다 종종 더 나은 성능을 보였습니다.

실제 성경에 적용했을 때, 결과는 유망하면서도 미묘했습니다. 출애굽기에서 그들의 방법은 시도한 다양한 매개변수 설정 중 **68%**에서 기존 학자들의 분류와 일치한 반면, 표준 k-means 방법은 **30%**에 그쳤습니다. 창세기에서는 k-means가 **14.6%**인 것에 비해 **40%**의 일치율을 보였습니다. 레위기에서는 k-means가 **29.8%**인 것에 비해 **45.5%**의 일치율을 보였습니다.

이 수치들은 정보 이론적 접근 방식이 이러한 숨겨진 층을 찾는 강력한 도구임을 시사하지만, 모든 경우에 완벽하게 작동하는 마법 지팡이는 아니라는 점을 보여줍니다. 텍스트를 어떻게 자르느냐(단어 그룹의 크기와 구절의 창 크기)에 따라 결과가 달라진다는 사실은, 이 텍스트들의 "정형화된" 성격이 복잡하다는 것을 알려줍니다. 그것은 단 하나의 현상이 아니라, 서로 다른 규모에서 나타나는 패턴들의 혼합입니다.

이것이 왜 중요한가

이 논문은 단순히 책을 분류하는 새로운 방법을 제시하는 것이 아니라, 책을 듣는 새로운 방법을 제공합니다. "놀라움"을 측정하기 위해 수학을 사용함으로써, 저자들은 텍스트의 리듬이 변하는 지점을 객^관적으로 볼 수 있는 방법을 제공합니다. 만약 이야기가 갑자기 매우 예측 가능해진다면, 그것은 다른 저자가 펜을 들었거나 텍스트가 템플릿으로부터 복사되었음을 나타내는 신호일 수 있습니다.

저자들은 이 방법이 히브리 성경과 같이 시간이 흐름에 따라 편집되고 층이 쌓인 텍스트에 특히 유용하다고 결론짓습니다. 이 방법은 어떤 단어가 중요한지 미리 추측할 필요 없이 텍스트의 "구조적 비계(structural scaffolding)"를 볼 수 있게 해줍니다. 이 방법이 정확히 누가 무엇을 썼는지 증명하는 것은 아니지만, 이 고대 서적들이 어떻게 구성되었는지에 대한 전통적인 이론들을 뒷받침하는 정량적 프레임워크를 제공합니다. 이는 문학적 분석이라는 예술을 패턴의 과학으로 바꾸어 놓으며, 가장 복잡한 이야기 속에서도 우리가 놀라움을 측정할 줄 안다면 구조와 반복의 지문을 찾아낼 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →