← 최신 논문
💬 NLP

Automatic Annotation of Ancient Greek Vowel Length

이 논문은 형태론적 문맥을 사용하여 이중 모음(dichrona letters)의 모음 길이를 자동으로 주석 처리하는 고대 그리스어 대상 최초의 범용 규칙 기반 맥로나이저(macronizer)를 소개하며, 그 결과물이 운문과 산문 모두에서 높은 정확도를 달러성하도록 문자 수준 트랜스포머를 효과적으로 학습시키고 하위 운율 작업들을 개선함을 입증한다.

원저자: Albin Thörn Cleland, Eric Cullhed

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Albin Thörn Cleland, Eric Cullhed

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 2천 년 전 사라진 암호로 쓰인 미스터리를 풀려는 탐정이라고 상상해 보십시오. 그 암호는 철학, 드라마, 그리고 서구 과학의 기초를 제공했던 고대 그리스어입니다. 하지만 여기 반전이 있습니다. 고대의 필사가들은 이 텍스트들을 쓸 때 모든 소리를 나타내는 전체 알파벳을 사용하지 않았습니다. 그들은 알파(alpha), 이오타(iota), 입실론(ypsilon)이라는 세 가지 특정 문자에 대해 "짧은" 버전과 "긴" 버전을 가지고 있었지만, 종이 위에 이를 다르게 표기하지는 않았습니다. 이는 마치 영어에 "a"라는 글자의 두 가지 버전(cat의 짧은 'a'와 father의 긴 'a')이 있는데, 우리는 둘 다 그냥 "a"라고만 쓰는 것과 같습니다. 시의 의미, 문법, 그리고 뜻을 파고들기 위해서는 어떤 "a"가 의도된 것인지 알아내야 합니다. 이것은 단순히 철자를 맞히는 문제가 아닙니다. 고대 그리스어에서 길이를 틀리는 것은 단어를 동사에서 명사로 바꾸거나, 질문을 명령문으로 바꿀 수 있기 때문입니다. 수십 년 동안 이 텍스트들을 읽으려는 컴퓨터들은 이 차이를 구별하지 못해 막혀 있었습니다. 길이를 모르는 컴퓨터는 어떤 음표를 길게 연주하고 어떤 음표를 짧게 연주해야 할지 모르는 채 곡을 연주하려는 음악가와 같습니다.

이 지점에서 "고대 그리스 모음 길이의 자동 주석 달기(Automatic Annotation of Ancient Greek Vowel Length)"의 이야기가 시작됩니다. 저자인 알빈 쏜 클랜드랜드(Albin Thörn Cleland)와 에릭 컬헤드(Eric Cullhed)는 "마크론화(macronizing)"라고 불리는 문제를 다루고 있습니다. 마크론화란 글자 위에 긴 대시나 작은 모자 같은 작은 음악적 표시를 더해, 컴퓨터에게 "이 소리를 길게 유지하라" 또는 "빠르게 발음하라"고 알려주는 것을 의미합니다. 도전 과제는 엄청납습니다. 수백만 개의 단어 형태가 존재하며, 어떤 글자가 길고 짧은지는 단어의 의미, 구조, 방언, 시대, 심지어 시의 리듬과 같은 어지러울 정도로 복잡한 요소들에 달려 있습니다. 이것은 "롱테일 문제(long-tail problem)"입니다. 즉, 단순한 규칙 목록으로는 모두 커버할 수 없는 희귀하고 기이한 사례들이 너무나 많다는 뜻입니다. 연구자들은 알고 싶었습니다. 우리가 이 작업을 자동으로 수행하는 컴퓨터 프로그램을 만들 수 있을까? 만약 그렇게 한다면, 그것이 컴퓨터가 그리스어를 이해하는 데 실제로 도움이 될까?

탐정의 도구 상자: 규칙과 재귀

팀은 먼저 "규칙 기반 마크론화 도구"를 구축하는 것으로 시작했습니다. 이것을 수천 권의 문법서와 사전을 암기한 매우 엄격하고 박식한 사서라고 상상해 보십시오. 이 사서는 다음과 같은 특정 지침을 따릅니다. "만약 단어가 이런 모양이고 저런 것으로 끝난다면, 모음은 반드시 길어야 한다." 만약 사서가 100% 확신하지 못한다면, 그들은 추측하기보다는 글자를 빈칸으로 남겨둡니다.

그들은 이 사서에게 4천만 단어가 포함된 방대한 고대 그리스 텍스트 라이브러리를 학습시켰습니다. 사서는 놀라울 정도로 유능하여, 까다로운 글자 중 약 69%의 길이를 성공적으로 파악해 냈습니다. 하지만 사서에게는 약점이 있었습니다. 그들은 너무 조심스러웠습니다. 만약 단어가 희귀하거나 완벽한 규칙 책에 부합하지 않으면, 그들은 그냥 포기하고 빈칸으로 남겨두었습니다. 그들은 인간처럼 문맥적 단서를 사용하여 빈틈을 메우는 방식으로 "추측"할 수 없었습니다.

추측하는 법을 배우는 학생

사서의 망설임을 해결하기 위해, 저자들은 영리한 방법을 시도했습니다. 그들은 사서의 작업물(사서가 확신했던 69%의 단어들)을 가져와 새로운 학생, 즉 "문자 수준 트랜스포머(character-level transformer)"라고 불리는 작은 인공지능을 훈련시키는 데 사용했습니다.

AI 학생을 사서가 일하는 모습을 지켜보는 명석한 도제로 생각해 보십시오. 도제는 사서의 정답으로부터 배우지만, 동시에 사서가 놓친 패턴을 찾아내기 위해 글자 하나하나를 직접 관찰하도록 훈련받습니다. 여기서 핵심적인 기술은 도제가 사서가 확신하지 못하는 부분은 무시하도록 교육받았다는 점입니다. 이는 도제가 사서의 불확전함을 배우는 대신, 단어의 형태를 보고 "이것은 길 것이다"라고 말할 수 있도록 일반화하는 법을 배우게 함으로써, 사서가 가진 규칙의 한계를 넘어 학습하게 했습니다.

결과는 인상적이었습니다. 엄격한 사서가 약 70%의 글자를 처리한 반면, AI 도제는 거의 99.7%를 처리했습니다. 더 중요한 것은, 도제가 단순히 무작정 추측한 것이 아니라 가장 어려운 사례들에서도 사서보다 더 자주 정답을 맞혔다는 점입니다. 수동으로 검증된 벤치마크 데이터로 테스트했을 때, 이 AI는 92% 이상의 정확도를 기록하며, 경직된 규칙을 따르는 것을 넘어 언어의 "느낌"을 배울 수 있음을 증명했습니다.

왜 중요한가: 리듬을 스캔하기

연구자들은 단순히 글자에 라벨을 붙이는 것에 그치지 않고, 이 새로운 기술이 다른 작업에 실제로 도움이 되는지 확인하고 싶었습니다. 그들은 이를 "스캔션(scansion, 음보 측정)", 즉 시의 리듬을 파악하는 기술에 테스트했습니다. 고대 그리스 시에서 리듬은 음절이 "무거운지(긴 음)" 아니면 "가벼운지(짧은 음)"에 전적으로 달려 있습니다.

그들은 시를 읽도록 설계된 컴퓨터 프로그램에 두 가지 버전의 동일한 텍스트를 주었습니다. 하나는 새로운 모음 길이 표시가 있는 텍스트이고, 다른 하나는 표시가 없는 텍스트입니다. 결과는 어떠했을까요? "마크론화"된 텍스트를 받은 프로그램이 올바른 리듬을 파악하는 능력이 약 5.8% 더 향상되었습니다. 이는 컴퓨터 과학 분야에서 유의미한 도약입니다. 이는 언어의 숨겨진 음악성을 컴퓨터에게 가르치는 것이 시의 구조를 훨씬 더 잘 이해하도록 돕는다는 것을 보여줍니다.

세부 사항

물론 이것이 모든 것을 해결하는 마법 지팡이는 아닙니다. 저자들은 시스템의 한계에 대해 매우 명확하게 밝히고 있습니다. 현재 이 시스템은 아테네의 방언인 "아티카(Attic)" 그리스어에 맞춰져 있습니다. 만약 다른 지역이나 후대의 시를 입력한다면, 시스템이 비아티카 단어에 "아티카 규칙"을 적용하기 때문에 길이를 틀릴 수 있습니다. 이는 뉴욕 억양 가이드가 누군가에게 남부 사투리를 가르치려는 것과 같습니다. 어떤 단어에는 효과가 있겠지만, 다른 단어에서는 틀릴 것입니다.

또한, AI 학생은 사서의 교과서로부터 배웠습니다. 만약 사서가 규칙에서 실수를 했다면, 학생도 그 실수를 배웠을 것입니다. 시스템은 그것을 구축한 규칙과 데이터만큼만 우수합니다. 그러나 저자들은 자신들의 도구, 데이터, 그리고 벤치마크를 모두에게 공개했습니다. 이는 다른 연구자들이 이제 이 "도제"를 가져다가 더 나은 교과서로 가르치고, 언젠가는 모든 방언과 시대의 고대 그리스어 암호를 풀어내어, 침묵하고 모호한 스크립트를 다시 완전히 들리고 리드미컬한 언어로 되돌려 놓을 수 있음을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →