← 최신 논문
💬 NLP

Loanword or Switch? The Annotation Boundary, Not the Model, Drives Kazakh-Russian Code-Switching Identification

이 논문은 카자흐-러시아 코드 스위칭을 식별하는 데 있어 주요한 과제는 언어 식별 모델의 선택이 아니라, 새로 공개된 문서 수준의 골드 데이터셋과 필터 우선 캐스케이드 접근 방식에 의해 명확해진 통합 외래어와 실제 코드 스위칭을 구분하는 어노테이션 경계라고 주장한다.

원저자: Bogdan Savelyev

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bogdan Savelyev

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어의 거대한 혼동: 컴퓨터가 외래어 때문에 왜 헷갈려 하는가

당신이 로봇에게 두 가지 서로 다른 언어를 가르치려 한다고 상상해 보세요. 이 두 언어는 우연히도 똑같은 알파벳을 사용합니다. 마치 서로 다른 방언을 쓰지만 같은 글자 세트로 글을 쓰는 두 이웃과 같습니다. 이것이 바로 컴퓨터 과학의 한 분야인 **자연어 처리(NLP)**의 세계입니다. 이곳에서 기계는 인간의 말을 읽고, 쓰고, 이해하려고 노력합니다. 로봇의 첫 번째 업무 중 하나는 **언어 식별(LID)**입니다. 즉, 단순히 "이 문장은 프랑스어인가, 스페인어인가?" 또는 "이것은 카자흐어인가, 러시아어인가?"를 파악하는 것입니다.

보통은 쉽습니다. 문장이 프랑스어 단어들로 가득 차 있다면 로봇은 "프랑스어"라고 말합니다. 하지만 사람들이 하나의 메시지에 두 언어를 섞어서 사용하는 현상인 **코드 스위칭(code-switching)**이 발생하면 상황이 까다로워집니다. 이는 누군가 한 언어로 문장을 시작했다가 다른 언어로 끝내는 경우를 말합니다. 예를 들어, "I went to the bakery to buy khleb"라고 말하는 것과 같습니다. 이 시나리오에서 로봇은 결정해야 합니다. 이것이 두 언어가 뒤섞인 지저한 혼합물인가, 아니면 단순히 다른 언어에서 빌려온 몇 개의 단어가 포함된 하나의 언어인가? 만약 로봇이 이를 잘못 판단한다면, 순수한 메시지를 혼합된 것으로 오해하거나, 실제 혼합을 놓칠 수도 있습니다. 이것이 중요한 이유는 컴퓨터가 실제로는 한 가지 언어인데 "혼합된" 상태라고 생각하면, 번역이나 감정 분석을 잘못 수행하여 소셜 미디어 중재부터 고객 서비스 봇에 이르기까지 모든 분야에서 혼란을 야기할 수 있기 때문입니다.

논문의 이야기: 로봇의 잘못이 아니라 규칙의 문제

이 논문에서 연구자 보그단 사벨리예프(Bogdan Savelyev)는 카자흐스탄에서 수백만 명이 사용하는 카자흐어와 러시아어 사이의 특정한 골칫거리를 다룹니다. 두 언어 모두 키릴 문자를 사용합니다. 문제는 무엇일까요? 컴퓨터들이 그들이 보는 거의 모든 카자흐어 문장에 대해 "혼합됨!"이라고 외치고 있었다는 점입니다. 왜일까요? 카자흐어가 수년에 걸쳐 러시아어로부터 수천 개의 단어를 빌려왔기 때문입니다(예: "quality"가 kachestvo가 된 것처럼). 글자만을 보고 판단하는 컴퓨터에게, 러시아어 외래어가 포함된 카자흐어 문장은 마치 언어가 바뀐 문장처럼 보입니다.

논문은 실수가 컴퓨터 모델이 너무 멍청해서가 아니라, 우리가 그들에게 준 규칙에 있다고 주장합니다. 연구진은 "혼합된"이라는 정의가 너무 느슨하다는 것을 깨달았습니다. 그들은 더 엄격한 새로운 규칙을 제안했습니다: 통합된 외래어는 여전히 원래의 언어이다. 만약 카자흐어 문장이 러시아어 단어를 사용하더라도 카자흐어의 문법과 문장 구조를 유지하고 있다면, 그것은 "혼합된" 것이 아니라 카자흐어입니다. 진짜 "혼합된" 텍스트는 화자가 실제로 문법 구조를 바꿀 때, 즉 러시아어로 한 절을 끝내고 카자흐어로 새로운 절을 시작할 때만 발생합니다.

이를 증证明하기 위해 팀은 이 새로운 엄격한 규칙을 따르는 인간들이 정성껏 라벨링한 3,000개 이상의 메시지로 구성된 "골드 스탠다드(gold standard)" 데이터셋을 구축했습니다. 그런 다음 다양한 컴퓨터 모델을 이 새로운 규칙책에 대조하여 테스트했습니다.

연구 결과는 다음과 같습니다:

  • "글자 세기"의 실수: 카자키 텍스트 안에 러시아어 글자가 있는지 단순히 확인하는 도구들은 형편없었습니다. 그들은 외래어와 실제 언어 전환을 구분하지 못했기 때문에 거의 모든 것을 "혼합됨"으로 분류했습니다.
  • "윈도우(Window)" 기법: 그들은 문장 전체를 한꺼번에 보는 대신 단어의 작은 "윈도우"(예를 들어 2개 또는 3개의 단어를 한 번에 보는 것)를 살펴보는 HeLI라는 영리한 비신경망(non-neural) 방법을 시도했습니다. 알려진 외래어를 먼저 제거한 다음 이 작은 윈도우들을 점검함으로써, 이 방법은 실제 전환을 포착하는 데 훨씬 나은 성능을 보였습니다. 이 방법은 정답률이 약 70%에서 거의 87%까지 뛰어올랐습니다.
  • 맥락의 힘: 최고의 성적을 거둔 것은 XLM-R이라는 현대적인 대규모 AI 모델이었습니다. 이 모델은 메시지 전체를 한 번에 읽고 맥락을 이해하기 때문에, 외래어와 실제 언어 전환을 자연스럽게 구분할 수 있었습니다. 이 모델은 0.966(1.0 만점)의 점수를 기록했는데, 이는 믿기 힘들 정도로 높은 수치입니다.
  • 실제 세계의 영향: 이 스마트한 필터를 331,468개 이상의 실제 소셜 미디어 게시물 뭉치에 적용했을 때, 결과는 충격적이었습니다. 기존의 단순한 규칙들은 거의 28,000개의 게시물을 "혼합됨"으로 분류했지만, 인간이 샘플을 확인했을 때 실제로 혼합된 것은 약 **1.66%**뿐이었습니다. 새로운 스마트 필터는 전체 게시물의 단 **4.9%**만을 혼합된 것으로 정확히 식별했습니다. 이는 기존 규칙들이 혼합된 메시지의 수를 엄청나게 부풀려, 사람들이 주로 외래어를 섞어 쓰는 카자흐어를 말하고 있음에도 불구하고 끊임없이 언어를 전환하고 있는 것처럼 보이게 만들었음을 의미합니다.

논문은 병목 현상이 컴퓨터 모델 자체의 문제가 아니라, 주석 경계(annotation boundary), 즉 "외래어"와 "언어 전환" 사이에 우리가 긋는 선의 문제라고 결론짓습니다. 일단 그 선을 명확히 그으면, 더 단순한 모델도 준수한 성능을 낼 수 있고, 고급 모델은 완벽에 가까운 정확도에 도달할 수 있습니다. 저자는 다른 이들이 똑같은 실수를 반복하지 않도록 자신들의 데이터와 도구를 공개했습니다. 다만, 그들의 인간 라벨링 작업이 팀이 아닌 단 한 명에 의해 수행되었기에 인간의 오류 가능성이 존재하며, 거대한 데이터셋에 대한 최종 결과는 예측치라는 점을 인정했습니다. 그러나 증거는 강력합니다: 만약 당신이 코드 스위칭을 이해하고 싶다면, 단순히 글자 수를 세는 것이 아니라 컴퓨터에게 외래어와 언어 전환의 차이를 가르쳐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →