← 최신 논문
💬 NLP

PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing

이 논문은 Universal Dependencies 품사 태그가 주석 처리된 최초의 대규모 페르시아어-영어 코드 혼용 코퍼스인 PERCEPT와 함께, LLM 지원 주석 프레임을, 그리고 소셜 미디어 전반에 걸친 코드 혼용의 플랫폼별 패턴을 밝히는 종합적인 언어학적 분석을 소개한다.

원저자: Ghazal Kalhor, Zahra Jafari, Amirarsalan Shahbazi, Behnam Bahrak

게시일 2026-08-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ghazal Kalhor, Zahra Jafari, Amirarsalan Shahbazi, Behnam Bahrak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 전 세계 사람들이 동시에 소리치고, 속삭이고, 대화하는 거대하고 혼란스러운 놀이터라고 상상해 보세요. 이 놀이터에서 많은 사람들은 단순히 한 가지 언어만 사용하는 것이 아니라, 마치 스무디의 재료를 섞듯이 여러 언어를 함께 섞어서 사용합니다. 이것을 "코드 믹싱(code-mixing)"이라고 부릅니다. 이는 누군가가 모국어로 문장을 시작했다가, 어떤 단어가 딱 들어맞는 느낌이 들거나 혹은 새로운 기기를 지칭하는 단어를 그 언어로 알지 못할 때 갑자기 영어 단어를 던져 넣는 것을 말합니다. 컴퓨터에게 이것은 악몽입니다. 컴퓨터가 문장을 이해하려고 할 때, 컴퓨터는 단어들이 엄격한 규칙을 따르기를 기대합니다. 하지만 언어가 뒤섞이면, 컴퓨터는 마치 케이크를 굽는 도중에 갑자기 미터법 컵에서 야드파운드법 온스로 전환되는 레시피를 따르려는 요리사처럼 혼란에 빠집니다. 이러한 무질서하고도 즐거운 현실을 컴퓨터가 다룰 수 있도록 가르치기 위해, 과학자들은 이 혼합된 단어들이 정확히 어떻게 작동하는지를 보여주는 특별한 사전과 일련의 규칙, 즉 "코퍼스(corpus)"가 필요합니다.

여기에 영어와 섞어 쓰는 것을 즐기는 페르시아어 화자들을 위한 거대하고 체계적인 도서관 역할을 하는 새로운 프로젝트, PERCEPT가 등장합니다. 연구진인 이란 출신의 언어학자와 컴퓨터 과학자 팀은 다른 혼합 언어 쌍들에 대한 지도는 존재하지만, 페르시아어-영어 혼합은 어둡고 탐험되지 않은 숲과 같다는 점에 주목했습니다. 그들은 그곳에서 무슨 일이 일어나고 있는지 보기 위해 손전등을 만들고 싶었습니다. 그래서 그들은 세 곳의 인기 있는 디지털 광장인 X(구 트위터), 인스타그램, 그리고 디지칼라(Digikala, 거대한 온라인 쇼핑 사이트)에서 6,800개의 게시물을 수집했습니다. 그들은 단순히 단어만을 수집한 것이 아니라, 제미나이(Gemini)라는 초지능 AI 비서를 탐정처럼 활용하여 모든 영어 단어(또는 페르시아 문자로 쓰인 영어 단어)에 문장에서의 "역할"을 태깅했습니다. 문법에서 이 역할은 "품사(Part-of-Speech, POS)"라고 불립니다. 이 단어는 명사(사물)인가요? 동사(동작)인가요? 아니면 형용사(묘사)인가요? 또한 연구팀은 AI에게 해당 게시물이 "쇼핑", "정치", 또는 "웃긴 밈"과 같이 무엇에 대해 이야기하고 있는지 추측하도록 요청했습니다.

여기 흥ating로운 부분이 있습니다. 연구팀은 단순히 도서관을 구축한 것에 그치지 않고, 그 안으로 들어가 들어가 패턴을 찾기 위해 책을 읽기 시작했습니다. 그들은 페르시아어 화자들이 영어를 섞어 쓸 때 주로 명사(사물)를 사용한다는 것을 발견했습니다. 이는 마치 영어에서 "대상"을 빌려오되, "동작"이나 "묘사"는 페르시아어로 유지하는 것과 같습니다. 예를 들어, 그들은 "나는 새로운 laptop(노트북)을 샀다"라고 말할 수 있는데, 여기서 "laptop"은 빌려온 명사이지만 나머지 문장은 페르시아어로 유지됩니다. 하지만 이 혼합의 "풍미"는 어디에 있느냐에 따라 달라집니다. 쇼핑 사이트인 디지칼라에서는 브랜드 이름과 제품 모델(특수한 이름인 "고유 명사")을 많이 섞어 썼습니다. X에서는 더 많은 동사(동작)를 섞었고, 인스타그램에서는 형용사(묘사) 쪽으로 기울었습니다.

연구진은 또한 이러한 혼합된 단어들이 문장의 어디에 숨어 있는지도 살펴보았습니다. 그들은 놀라운 일관성을 발견했습니다. 어떤 플랫폼을 사용하든 상관없이, 혼합된 단어들은 문장의 맨 앞이나 중간에 나타나는 경향이 있으며, 맨 끝에는 거의 나타나지 않았습니다. 이는 마치 화자들이 장면을 설정하기 위해 영어 단어를 초반에 던져 넣은 다음, 페르시아어로 생각을 마무리하는 것과 같습니다. 하지만 가장 흥미로운 발견은 "트리거링(triggering)"에 관한 것이었습니다. 디지칼라에서는 누군가 영어 단어를 하나 사용하면, 바로 다음에 또 다른 영어 단어를 사용할 가능성이 매우 높았습니다. 이는 특정 브랜드나 제품에 대해 이야기하기 시작하면 영어 단어가 계속 흘러나오는 것과 같습니다. 이러한 현상은 인스타그램이나 X에서는 이만큼 나타나지 않았습니다.

마지막으로, 그들은 어떤 주제가 가장 많은 믹싱을 유발하는지 확인했습니다. 당연하게도, "산업 및 상업"과 "브랜드 및 비즈니스" 주제가 가장 높은 코드 믹싱 비율을 보였습니다. 사람들이 쇼핑, 기술, 또는 비즈니스에 대해 이야기할 때, 그들은 영어 용어를 뿌려 넣지 않을 수 없습니다. 연구팀은 인간 전문가들에게 샘플을 교차 검증하게 함으로써 AI의 작업을 확인했으며, 인간은 거의 항상 AI와 일치하는 결과를 보여주었습니다. 이는 그들의 새로운 도서관이 신뢰할 수 있음을 증명합니다.

요약하자면, 이 논문은 단순히 새로운 데이터셋을 제공하는 것이 아니라, 페르시아어 화자들이 자연스럽게 언어를 어떻게 혼합하는지에 대한 명확한 그림을 제공합니다. 이는 언어를 섞는 유형은 플랫폼에 따라 변할 수 있지만, 언어를 섞는 방식은 일정한 리듬을 따른다는 것을 시사합니다. 이 지도는 이제 누구나 사용할 수 있도록 개방되어 있으며, 더 나은 번역 도구, 더 똑똑한 챗봇, 그리고 언어가 끊임없이 함께 춤추는 세상에서 우리가 어떻게 소통하는지에 대한 더 깊은 이해를 구축하는 데 도움을 줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →