“Just do register analysis”, they said. “It’ll be easy”, they said: Evaluating the impact of lexico-grammatical tagging systems on multidimensional analysis
본 연구는 다차원 분석을 위한 다섯 가지 오픈 소스 어휘-문법 태깅 시스템을 체계적으로 평가하며, 이들 시스템이 일반적인 레지스터 구분을 성공적으로 재현하고 있음에도 불구하고, 결과적인 차원 점수의 상당한 차이는 근저에 있는 NLP 파이프라인의 차이가 아니라 일관되지 않은 특징의 조작화로 인해 발생한다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
언어를 거대하고 북적이는 도시라고 상상해 보세요. 우리가 말하거나 글을 쓸 때마다 우리는 서로 다른 동네를 걷고 있는 것입니다. 대화가 가득한 활기찬 시장 광장(대화), 사실들로 가득 찬 조용한 도서관(학술적 글쓰기), 혹은 극적인 연극 무대(소설) 같은 곳 말이죠. 언어학자들은 이 동네들을 파악하여 무엇이 그들을 독특하게 만드는지 이해하기 위해 오랫동안 노력해 왔습니다. 이를 위해 그들은 '다차원 분석(Multidimensional Analysis, MDA)'이라는 강력한 도구를 사용합니다. MDA를 단순히 단어 하나하나를 보는 것이 아니라, 축약형이 얼마나 사용되었는지, 사람들이 '나'나 '너'라는 표현을 얼마나 자주 쓰는지, 혹은 길고 복잡한 문장이 얼마나 많이 등장하는지와 같은 수백 가지의 미세한 단서들을 세어봄으로써 텍스트의 '분위기'를 측정하는 고성파 GPS라고 생각하면 됩니다. 이 단서들은 '차원(dimensions)'이라는 단위로 그룹화되는데, 이는 지도 위의 보이지 않는 축과 같습니다. 한 축은 텍스트가 얼마나 '수다스럽고 몰입도가 높은지'를 측정할 수 있고, 다른 축은 얼마나 '사실적이고 거리감이 있는지'를 측정할 수 있습니다.
수십 년 동안 연구자들은 '비버 태거(Biber Tagger)'라고 불리는 특정하고 전설적인 도구에 의존해 왔습니다. 이것은 마치 도시의 모든 이들이 사용하는 원래의 신뢰할 수 있는 나침반과 같습니다. 하지만 문제는 이 원래의 나침반이 금고 안에 잠겨 있어서, 아무도 그 작동 방식을 직접 볼 수 없거나 사용할 수 없다는 점입니다. 그래서 영리한 엔지니어들이 모두가 지도를 가지고 놀 수 있도록 자신들만의 오픈 소스 버전 나침반을 만들었습니다. 하지만 큰 의문이 남아 있습니다. 이 새로운 나침반들이 원래의 나침반과 정확히 같은 방향을 가리킬까요? 만약 두 명의 탐험가가 서로 다른 지도를 사용한다면, 그들은 같은 동네에 도착할까요, 아니면 한 명이 도시의 전혀 다른 부분에서 길을 잃게 될까요? 이것이 바로 독일 에를랑겐-뉘른베르크 대학교의 연구팀이 해결하고자 했던 미스터리입니다.
연구진은 이 다섯 가지의 새로운 '비버 스타일' 도구들을 테스트하기로 했습니다. 그들은 19세기 영국 소설의 방대한 컬렉션을 가져왔는데, 특히 캐릭터들이 서로 대화하는 수다스러운 부분(대화)과 작가가 이야기를 들려주는 부분(서사) 사이의 차이에 주목했습니다. 그들은 이미 '원래의' 나침반이 대화는 보통 매우 '몰입적'이고 대화적이며, 서사는 더 '정보적'이고 묘사적이라는 것을 보여주었다는 사실을 알고 있었습니다. 연구팀은 동일한 텍로 다섯 가지의 서로 다른 오픈 소스 도구인 MAT, pseudobibeR, pybiber, BizerPlus, Biberpy를 실행했습니다. 그들은 이 도구들이 지도의 레이아웃에 대해 합의할 것인지, 아니면 완전히 다른 도시를 그려낼 것인지를 확인하고 싶었습니다.
결과는 "대체로 그렇다"와 "예외적인 사례를 주의하라"가 섞여 있었습니다. 먼저, 좋은 소식은 거의 모든 도구가 동일한 큰 그림을 성공적으로 찾아냈다는 것입니다. 그들은 모두 대화는 수다스럽고 서사는 사실적이라는 점에 동의했습니다. 도시의 일반적인 형태는 그대로 유지되었습니다. 하지만 연구진이 정확한 좌표(지도의 구체적인 숫자들)를 살펴보았을 때, 도구들이 항상 일치하는 것은 아니라는 것을 발견했습니다. MAT나 pybiber 같은 일부 도구는 원래의 결과와 매우 유사한 결과를 만들어냈습니다. 반면, Biberpy 같은 도구는 다소 거칠었는데, 이들은 원래의 나침반이 놓았던 위치에서 놀라울 정도로 멀리 떨어진 곳에 텍스트를 배치했습니다.
왜 이런 일이 발생했을까요? 연구진은 이 도구들의 엔진룸을 파헤쳐 범인을 찾아냈습니다. 그들은 이러한 차이가 도구가 문법을 이해하기 위해 사용하는 기본 기술(예를 들어 특정 언어 모델) 때문이 아니라는 것을 발견했습니다. 대신, 문제는 도구들이 특정 요소들을 세는 방식에서 왔습니다. 몇몇 까다로운 특징들이 다르게 계산되고 있었던 것입니다. 예를 들어, 한 도구는 특정 유형의 물음표나 특이한 문장 구조를 세는 방식이 달라 숫자가 급증하여 최종 점수를 망쳐놓을 수 있었습니다. 이는 마치 한 지도 제작자는 보도의 모든 자갈을 '건물'로 세기로 결정하고, 다른 지도 제작자는 오직 마천루만을 세기로 결정한 것과 같습니다. 그러면 도시 자체는 변하지 않았더라도 전체 건물 수는 완전히 달라 보일 것입니다.
연구진은 또한 이 도구들이 얼마나 빠른지도 확인했습니다. 연구진은 현대적인 기술(Python 사용)로 구축된 도구들이, 특히 그래픽 카드(GPU)가 있는 강력한 컴퓨터를 사용할 경우 일반적으로 빠르다는 것을 발견했습니다. MAT는 사람이 버튼을 클릭해야 했기 때문에 조금 느렸지만, 다른 도구들은 자동으로 실행될 수 있었습니다. 흥가롭게도, 더 '똑똑하거나' 복잡한 언어 모델을 사용하는 것이 반드시 최종 지도를 더 정확하게 만드는 것은 아니었으며, 단지 지도를 그리는 데 시간이 더 오래 걸릴 뿐이었습니다.
결론적으로, 이 논문은 이 새로운 도구들이 훌륭하고 대체로 신뢰할 수 있지만, 원래의 완벽한 복제본은 아니라고 제안합니다. 만약 당신이 원래의 '비버 태거'를 사용한 기존 연구들과 당신의 새로운 발견을 직접 비교하고 싶다면, 매우 주의해야 합니다. 설정을 조정하거나 희귀 단어들을 필터링하여 숫자를 맞추어야 할 수도 있습니다. 연구진은 Biberpy와 같은 일부 도구는 현재로서는 직접적인 비교를 위해 사용하기에 너무 다를 수 있다고 경고합니다. 또한 그들은 이 분야의 미래가 연구자들이 정확히 어떻게 세고 싶은지 선택할 수 있도록 도구를 더 유연하게 만들고, 아마도 영어 이외의 다른 언어를 지도화할 수 있는 도구를 구축하는 데 있다고 제안합니다. 언어의 도시는 광대하며, 우리에게는 많은 새로운 나침반이 있지만, 우리는 여전히 이 나침반들이 모두 같은 방향으로 북쪽을 가리키고 있는지 확인해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.