A Computational Approach to Language Contact -- A Case Study of Persian
이 연구는 역사적 언어 접촉이 단일 언어 페르시아어 언어 모델의 중간 표현에 어떻게 영향을 미치는지 조사하며, 보편적인 통사적 정보는 대체로 영향을 받지 않는 반면 격(Case)과 성(Gender) 같은 형태론적 특징은 접촉으로 유발된 구조적 변화에 의해 유의미하게 형성된다는 것을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑한 로봇이 하나 있다고 상상해 보세요. 이 로봇은 오직 페르시아어로 쓰인 책들만 읽어왔습니다. 영어, 아랍어, 터키어, 또는 일본어는 배운 적이 없습니다. 사실, 그 로봇은 그런 언어들이 존재한다는 사실조차 모릅니다.
이제, 당신이 이 로봇에게 터키어로 된 문장을 건네줍니다. 그리고 묻습니다. "이게 무슨 언어인지, 그리고 여기의 문법 규칙은 무엇인지 말해줄래?"
당신은 로봇이 "모르겠어요, 저는 페르시아어만 읽었거든요!"라고 말할 것이라 예상할 수도 있습니다. 하지만 이 논문은 더 깊은 질문을 던집니다: 로봇의 내부 '두뇌'(디지털 표현)가 직접 배우지 않았음에도 불구하고, 페르시아어의 역사를 이해하고 있다는 흔적을 은밀히 보여주고 있는가?
페르시아어는 수 세기 동안 여러 언어와 이웃하며 교류하고 거래하며 영향을 받아왔기에, 연구자들은 로봇의 '페르시아어 두뇌'가 이웃 언어들의 보이지 않는 지문을 흡수했을지 궁금해했습니다.
실험: 탐정 이야기
연구진은 ParsBERT(페르시아어 전용 AI 모델)라는 도구를 사용했고, 아랍어(주요 역사적 이웃)부터 일본어(접점이 없는 낯선 언어)에 이르기까지 8가지 다른 언어의 문장들을 입력했습니다.
그들은 로봇의 두뇌 내부를 들여다보기 위해 두 가지 주요 **"탐정 도구"**를 사용했습니다:
- 정보 측정기 (Information Meter): 이것은 로봇이 특정 특징(예: "이것은 명사인가?" 또는 "이 단어는 남성형인가?")에 대해 얼마나 많이 알고 있는지를 측정합니다. 라디오 신호가 얼마나 크게 들리는지 확인하는 것과 같습니다.
- 스포트라이트 (The Spotlight): 이것은 그 지식이 로봇의 두뇌 어디에 숨겨져 있는지 찾으려 합니다. 지식이 특정 뉴런(단 하나의 전구)에 저장되어 있는지, 아니면 방 전체에 은은하게 퍼진 빛처럼 넓게 흩어져 있는지 확인하는 것입니다.
거대한 발견: "보편적" 대 "특수적"
결과는 로봇이 생각하는 방식에서 나타나는 흥ча로운 분리를 보여주었는데, 저자들은 이를 **보편적 규칙(universal rules)**과 **지역적 습관(local habits)**의 차이라고 설명합니다.
1. 보편적 규칙 (하드 드라이브)
연구진이 로봇에게 보편적 품사(UPOS) 태그, 즉 "이것이 명사인가, 동사인가, 아니면 형용사인가?"를 물었을 때, 로봇은 모든 언어에 대해 일관되게 우수한 성능을 보였습니다.
- 비유: 로봇이 "단어의 종류"에 대한 보편적인 사전을 가지고 있다고 상상해 보세요. 그 단어가 페르시아어든, 영어든, 일본어든 상관없이 로봇은 "동사"는 동사라는 것을 압니다.
- 결과: 여기서 로봇은 언어 접촉을 신경 쓰지 않았습니다. 역사가 문장의 기본적인 구성 요소를 보는 방식을 바꾸지는 못했습니다. 이러한 규칙들은 너무나 깊고 보편적이어서 수 세기 동안의 단어 차용으로도 흔들리지 않습니다.
2. 지역적 습관 (가구)
연구진이 굴절 형태론(Morphology)(단어의 구체적인 형태, 예: 격(Case)이나 성(Gender))에 대해 물었을 때, 로봇의 행동은 페르시아어와의 역사적 관계에 따라 극적으로 변했습니다.
"격" 테스트 (누가 무엇을 했는가?):
- 문제: 페르시아어는 "격"(주어나 목적어를 나타내기 위해 단어 어미를 바꾸는 것)을 사용하지 않습니다. 대신 어순을 사용합니다.
- 결과: 복잡한 격 체계(많은 단어 어미를 가진 독일어나 러시아어 등)를 가진 언어를 볼 때, 로봇은 완전히 길을 잃었습니다. 정보를 찾아내지 못했습니다.
- 예외: 로봇이 어순이나 단순한 표식에 의존하는 언어(예: 영어나 프랑스어)를 볼 때는 훨씬 더 잘 수행했습니다.
- 시사점: 로봇은 다른 언어의 문법이 페르시아어의 모습과 닮았을 때만 그 문법을 "이해"합니다. 만약 다른 언어가 페르시아어가 한 번도 사용해 본 적 없는 체계(복잡한 격 어미 등)를 사용한다면, 로봇의 두뇌에는 그 지도가 없습니다.
"성" 테스트 (남성형 대 여성형):
- 문제: 페르시아어에는 문법적 성(단어가 남성인지 여성인지)이 없습니다.
- 결과: 로봇은 복잡한 성 체계를 가진 언어(세 가지 성이 있는 러시아어 등)를 다룰 때 어려움을 겪었습니다. 하지만 성 체계가 단순하거나 자연적인 성에 의존하는 언어(예: 아랍어나 프랑스어)에 대해서는 괜찮은 모습을 보였는데, 이는 아마도 페르시아어가 아랍어에서 많은 단어를 차용했고, 그 차용된 단어들이 가끔 그 "풍미"를 유지하고 있기 때문일 것입니다.
- 시사점: 로봇의 성에 대한 이해는 실제로 페르시아어에서 본 것에 의해 형성됩니다. 로봇은 배우지 않은 복잡한 성 체계를 스스로 만들어낼 수 없습니다.
기계 속의 "유령"
가장 흥별한 발견 중 하나는 이 정보가 어떻게 저장되어 있는가 하는 점이었습니다.
- 접점이 없는 언어(예: 일본어)의 경우, 로봇은 일본어만을 위해 켜지는 매우 구체적인 몇 개의 "전구"를 가지고 있었습니다. 찾기가 쉬웠습니다.
- 접점이 많은 언어(예: 아랍어 또는 터키어)의 경우, 정보는 단 하나의 전구에 있지 않았습니다. 대신, 그것은 로봇의 뇌 전체에 퍼진 **은은한 빛(diffuse glow)**이었습니다.
- 비유: 집을 상상해 보세요. 낯선 사람(일본어)을 초대하면 그 사람은 특정 의자에 앉습니다. 하지만 수 세기 동안 그곳에 살았던 오랜 가족 친구(아랍어)를 초대한다면, 그는 한 의자에 앉아 있는 것이 아니라 집 안의 모든 것을 만지고, 가구를 옮기고, 집 안에 자신의 향기를 남겨 놓을 것입니다. 어느 한 지점을 가리키며 "이것이 아랍어 부분이다"라고 말할 수 없습니다. 그 영향은 어디에나 있지만, 페르시아어 구조와 뒤섞여 있습니다.
결론
이 논문은 단 하나의 언어(페르시아어)로만 훈련된 언어 모델이 매우 선택적인 방식으로 자신의 역사의 흔적을 보여준다고 결론짓습니다.
- 그것은 보편적 규칙(동사가 무엇인지와 같은)을 안전하고 변함없이 유지합니다.
- 그것은 특수한 규칙(성이나 격과 같은)을 오직 그것이 페르시아어의 "모양"과 일치할 때만 적응시킵니다.
만약 언어 접촉이 페르시아어의 심층 구조(복잡한 격 어미를 추가하는 것과 같은)를 바꾸었다면, 로봇은 그것을 배웠을 것입니다. 하지만 페르시아어는 주로 단어를 차용하고 자신의 문장 구조를 유지했기 때문에, 로봇의 두뇌는 이를 반영합니다: 로봇은 차용된 단어들은 알지만, 여전히 페르시아어 문법으로 생각합니다.
요약하자면, 로봇은 외국어 단어를 많이 알고 있는 페르시아어 화자입니다. 하지만 여전히 페르시아어 방식으로 생각합니다. 로봇은 이웃의 문법을 말하는 법을 배운 것이 아니라, 자신이 차용한 단어들의 모양을 인식하는 법을 배웠을 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.