← 최신 논문
💻 computer science

Exploring Functional Shifts in Pos Tagging Across Various NLP Libraries: A Study of NLTK, spaCy and Textblob

이 연구는 기능적 전이(functional shifts)로 인해 발생하는 가든 패스 문장(garden path sentences)을 처리하는 데 있어 NLTK, TextBlob, spaCy의 성능을 비교하며, spaCy가 구문론적 정확도 측면에서 다른 두 라이브러리보다 크게 우수하다는 것을 밝히고 아프리카 언어를 포함한 NLP 도구 개선을 위한 통찰을 제공한다.

원저자: Kayode Victor Amusan

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kayode Victor Amusan

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 동화책을 읽는 법을 가르치고 있다고 상상해 보세요. 여러분은 로봇이 단어뿐만 아니라 그 단어들이 문장 안에서 어떻게 행동하는지도 이해하기를 원합니다. "run"이 빠르게 움직이라는 명령일까요, 아니면 긴 시간을 묘사하는 명사일까요? 컴퓨터 과학의 세계에서 이 작업은 **품사 태깅(Part-of-Speech tagging, POS tagging)**이라고 불립니다. 이것은 마치 문장의 모든 단어에 색칠을 하여 그것이 명사인지, 동사인지, 형용사인지, 혹은 그 외의 것인지를 보여주는 디지털 형광펜과 같습니다. 우리 인간에게는 쉬워 보이지만, 컴퓨터에게는 단어가 문장 중간에 옷을 갈아입을 때 매우 까다로워집니다. 이것을 **기능 변화(functional shift)**라고 합니다. 이것은 마치 배우가 연극을 시작할 때는 왕이었는데, 이름은 바꾸지 않은 채 갑자기 요리사 모자를 쓰고 요리를 하기 시작하는 것과 같습니다. 컴퓨터는 주변의 다른 단어들을 바탕으로 그 새로운 역할을 추측해야 합니다.

더 까다로운 것은 **미로형 문장(garden path sentences)**입니다. 이 문장들은 여러분을 한 가지 생각으로 유도했다가 마지막에 덜컥 넘어뜨리는 '정원 길(garden path)'로 안내합니다. 예를 들어, "The old man the boat"라는 문장이 있습니다. 여러분의 뇌는 "old man"을 한 사람(노인)으로 읽고 싶어 하지만, 실제 문장은 "노인들이 배를 조종한다"는 뜻입니다. 여기서 "man"은 명사가 아니라 동사입니다! 만약 컴퓨터가 이러한 반전에 혼란을 느낀다면, 전체 이야기를 오해할 수 있으며 이는 번역 앱이나 검색 엔진 같은 분야에서 큰 문제가 됩니다. 그래서 과학자들은 어떤 프로그램이 이러한 교활한 단어 변화를 포착하는 데 가장 뛰어난지 확인하기 위해 다양한 컴퓨터 프로그램을 계속 테스트하고 있습니다.


이 연구에서 카요데 빅터 아무산(Kayode Victor Amusan)이라는 연구자는 세 가지 인기 있는 컴퓨터 프로그램인 NLTK, TextBlob, 그리고 SpaCy를 시험대에 올리기로 했습니다. 이 세 프로그램을 언어 수업을 듣는 서로 다른 세 명의 학생이라고 상상해 보세요. 선생님(연구자)은 그들에게 혼란을 주도록 설계된 56개의 까다로운 문장 뭉치를 건네주었습니다. 이 문장들에는 미로형 문장, 단어가 명사로 변한 경우(예: "singing"이 하나의 행위인 명사가 된 경우), 그리고 의미를 바꾸기 위해 위치를 바꾼 단어들이 포함되어 있었습니다. 목표는 간단했습니다. 어떤 프로그램이 문장 속 각 단어가 수행하는 역할을 올바르게 식별하는지 보는 것이었습니다.

결과는 마치 한 명의 주자가 명확하게 앞서 나가는 경주와 같았습니다. 56개의 까다로운 문장 중 SpaCy가 32개를 맞혔습니다. NLTKTextBlob은 각각 21개씩 맞히며 공동 2위를 차지했습니다. 이는 SpaCy가 복잡한 문장에서 단어들의 "옷 갈아입기"를 파악하는 데 훨씬 더 뛰어났음을 의미합니다.

연구는 프로그램들이 어디에서 실수했는지 확인하기 위해 구체적인 사례들을 면밀히 살펴보았습니다. 예를 들어, "round"라는 단어를 봅시다. 이것은 원(명사), 모양(형용사), 회전하다(동사), 또는 원을 그리며 움직이다(부사)가 될 수 있습니다. "The earth turns round once"와 같은 문장에서 SpaCy는 "round"를 부사로 정확히 식별했습니다. 그러나 NLTK와 TextBlob은 혼란을 느껴 이를 명사로 분류했습니다. 마찬가지로 대명사, 접속사, 또는 형용사가 될 수 있는 "that"이라는 단어에 대해서도, SpaCy는 거의 모든 맥락에서 차이를 구분해 낼 수 있었던 반면, 나머지 두 라이브러리는 자주 놓치는 모습을 보였습니다.

연구자는 세 프로그램 모두 가장 혼란스러운 미로형 문장(예: "The complex houses married and single students")에서는 어려움을 겪었다는 점을 발견했습니다. 하지만 SpaCy는 여전히 다른 프로그램들보다 더 많은 것을 맞혔습니다. 예를 들어, "houses"가 실제로 (거처를 제공한다는 의미의) 동사로 쓰인 문장에서, SpaCy는 그것이 건물이 아니라는 것을 잡아낼 가능성이 더 높았습니다. 이 연구는 NLTK와 TextBlob이 일반적인 작업에는 유용할 수 있지만, 언어가 복잡해지고 단어의 역할이 바뀌기 시작할 때는 SpaCy가 더 강력한 도구라는 점을 시사합니다.

이 논문은 SpaCy가 완벽하다거나 문제가 해결되었다고 주장하는 것이 아닙니다. 사실, SpaCy조차 56개 중 24개의 문장을 틀렸다는 점을 지적하고 있습니다. 단지 까다롭고 꼬여 있는 문장을 다루어야 한다면, 현재로서는 SpaCy가 세 가지 중 가장 신뢰할 수 있는 선택이라는 점을 제안할 뿐입니다. 연구자는 이 정보가 교사, 학생, 그리고 다른 과학자들이 인간의 언어를 이해하는 더 나은 도구를 만드는 데 도움이 되기를 바라며, 나아가 미래의 프로그램들이 아프리카 언어들을 똑같은 쉬움으로 구사할 수 있게 돕기를 희망합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →