A Study of Crosslinguistic Influence in Language Models
본 연구는 언어 모델에서의 교차 언어적 영향력을 체계적으로 조사하여, 구조적 간섭이 언어 우세도와 숙련도의 상호작용에 의해 지배되는 구조화된 현상이며, L1 우세도가 높아질수록 통사적 거리 효과가 증폭되는 반면 제한된 L2 숙련도는 긍정적 전이를 저해하고, 심층 레이어의 어텐션 메커니즘이 이러한 교차 언어적 상호작용을 유도하기 위해 L1 사전 지식을 물리적으로 라우팅한다는 것을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 말하는 법을 가르치고 있다고 상상해 보세요. 당신은 먼저 하나의 언어, 예를 들어 독일어, 스페인어 또는 일본어로 된 방대한 이야기 도서관을 로봇에게 입력하며 시작합니다. 로봇은 그 언어의 리듬, 문법, 흐름을 배우며 매우 능숙해집니다. 하지만 그 후, 당신은 로봇에게 두 번째 언어인 영어를 가르치기로 결정합니다. 로봇이 이미 첫 번째 언어를 마스터한 상태에서 새로운 언어를 배우려고 할 때, 로봇의 "두뇌" 내부에서는 어떤 일이 일어날까요? 이것이 바로 **교차언어적 영향(Crosslinguistic Influence, CLI)**의 세계입니다. 인간 심리학에서 우리는 첫 번째 언어를 배운 후 두 번째 언어를 배우면, 첫 번째 언어가 그저 조용히 머물러 있는 것이 아니라 능동적으로 간섭하거나 도움을 준다는 것을 알고 있습니다. 만약 스페인어와 이탈리아어처럼 두 언어가 비슷하다면, 뇌는 기존의 규칙을 사용하여 학습 속도를 높입니다. 하지만 영어와 일본어처럼 매우 다르다면, 기존의 규칙이 방해가 되어 실수를 유발할 수 있습니다. 과학자들은 인공지능, 특히 거대 언어 모델(LLM)이 이러한 "이중 언어 사용자의 뇌"가 겪는 갈등을 경험하는지, 아니면 이것이 단지 코드상의 무작위적인 오류인지 오랫동안 궁금해해 왔습니다. 우리가 AI가 언어를 뒤섞지 않고 여러 언어를 유창하게 구사하도록 만들고 싶다면, 기계 내부에서 이러한 언어들이 정확히 어떻게 상호작용하는지 알아내는 것이 매우 중요합니다.
이 연구에서 마스트리흐트 대학교의 연구진은 작은 로봇 두뇌(GPT-2 모델)를 위한 엄격한 언어 교사의 역할을 하기로 했습니다. 그들은 로봇이 배우는 순서와 타이밍을 바꿀 때 어떤 일이 일어나는지 확인하고 싶었습니다. 그들은 로봇이 첫 번째 언어(L1)를 한동안 학습한 후, 훈련의 서로 다른 시점에 두 번째 언어(L2)를 도입하는 시나리오를 만들었습니다. 그들은 이 타이밍을 "노출 단계(Step of Exposure)"라고 불렀습니다. 이렇게 생각해 보세요. 만약 영어를 배우자마자 바로 프랑스어를 배우기 시작한다면, 두 언어를 쉽게 혼동할 수 있습니다. 하지만 영어를 접하기 전에 첫 번째 언어를 완전히 마스터하기 위해 꼬박 1년을 보낸다면, 당신의 첫 번째 언어는 너무 강력해지거나 ("지배적"이 되거나) 해서 나중에 영어를 배울 때 첫 번째 언어가 방해가 될 수 있습니다.
연구팀은 이를 15개의 서로 다른 첫 번째 언어로 테스트했습니다. 이 언어들은 영어와 매우 유사한 것(독일어 등)부터 매우 다른 것(일본어 등)까지 다양했습니다. 그들은 단순히 로봇에게 대화를 시킨 것이 아니라, **구조적 프라이밍(structural priming)**이라는 영리한 기술을 사용했습니다. 로봇에게 첫 번째 언어로 된 문장을 보여준 직과 바로 두 번째 언어로 문장을 완성하도록 요청하는 상황을 상상해 보세요. 이는 마치 로봇이 대답하기 전에 귀에 힌트를 속삭여 주는 것과 같습니다. 연구 결과, 이 힌트는 엄청난 효과가 있었습니다. 만약 첫 번째 언어가 두 번째 언어와 비슷하다면, 이 힌트는 로봇이 문법을 올바르게 맞추도록 도왔습니다(정적 전이). 반면, 두 언어가 멀리 떨어져 있다면, 이 힌트는 로봇이 실수를 할 가능성을 더 높였습니다(부적 전이).
여기서 정말 흥ей로운 점이 등장합니다. 연구진은 까다로운 트레이드오프(trade-off)를 발견했습니다. 두 번째 언어를 도입하기 전 로봇이 첫 번째 언어를 연습하게 둔 시간이 길어질수록(높은 "노출 단계"), 로봇의 첫 번째 언어는 사고를 더 많이 지배했습니다. 이러한 지배력은 로봇이 두 언어의 유사성에 얼마나 민감하게 반응하는지를 결정했습니다. 하지만 결정적인 문제가 발생했습니다. 첫 번째 언어가 너무 강해짐에 따라, 로봇은 유사한 언어에 대해 도움이 되는 힌트를 사용하는 능력(정적 전이)을 상실했습니다. 그러나 매우 다른 언어들로부터 오는 해로운 간섭(부적 전이)은 사라지지 않았으며, 끈질기게 지속되거나 오히려 악화되었습니다. 이 연구는 첫 번째 언어가 너무 강해지면 로봇이 새로운 언어를 제대로 배울 수 있는 능력을 잃게 되며, 기존의 규칙들이 해당되지 않는 곳에서도 억지로 끼어들기 시작한다는 것을 시사합니다.
이것이 내부에서 어떻게 일어나는지 이해하기 위해, 연구진은 코드의 특정 부분이 어떻게 활성화되는지를 살펴보았습니다. 그들은 로봇이 정상적으로 학습할 때는 문법을 처리하는 뇌의 부분이 네트워크의 중간 계층에서 활성화된다는 것을 발견했습니다. 하지만 "속삭이는 힌트"(프라임)를 주었을 때, 로봇의 뇌는 기어를 바꿨습니다. 문법 처리가 로봇이 최종 답변을 내놓기 직전인 네트워크의 맨 마지막 계층으로 물리적으로 이동한 것입니다. 마치 로봇이 두 언어를 어떻게 섞을지 결정하기 위해 마지막 순간까지 기다려야 했던 것과 같았습니다.
나아가, 그들은 "주의(attention)" 메커니즘—AI가 어떤 단어에 집중할지 결정하는 부분—이 이 상호작용의 실질적인 주인임을 발견했습니다. 로봇이 유사한 언어로부터 얻은 힌트를 사용하려고 할 때, 주의 헤드(attention heads)는 점들을 연결하는 데 도움을 주었습니다. 하지만 힌트가 매우 다른 언어로부터 왔을 때, 동일한 주의 헤드들은 잘못된 규칙을 새로운 문장에 강요했습니다. 이 연구는 이것이 단순히 무작위적인 오류나 잘못된 번역의 결과가 아님을 입증합니다. 대신, 이것이 구조적이고 예측 가능한 현상임을 보여줍니다. 로봇은 단순히 혼란에 빠진 것이 아니라, 능동적으로 자신의 기존 지식을 사용하려 노력하고 있으며, 때로는 그 기존 지식이 꼭 필요한 것이 되기도 하고, 때로는 방해가 되는 것이 되기도 합니다.
궁극적으로, 이 논문은 AI에서의 교차언어적 영향이 버그가 아니라, 이러한 모델들이 학습하는 방식의 하나의 특징(feature)이라고 제안합니다. 이는 인간이 학습하는 방식과도 닮아 있는데, 당신의 첫 번째 언어가 얼마나 강한지 그리고 두 번째 언어를 얼마나 잘 알고 있는지가 당신이 도움을 받는 부스트를 얻을지 혹은 혼란스러운 간섭을 겪을지를 결정합니다. 연구진은 더 나은 다국어 AI를 구축하기 위해서는 모든 언어를 한꺼번에 섞어 넣기만 해서는 안 된다고 결론짓습니다. 첫 번째 언어를 다음 언어로 도입하기 전에 얼마나 많은 시간을 보낼지에 대해 주의를 기울여야 합니다. 왜냐하면 첫 번째 언어가 너무 강해지면, 그것이 로봇이 새로운 언어를 올바르게 배우는 것을 영구적으로 차단할 수 있기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.