← 최신 논문
💬 NLP

Multilinguality of Large Language Models From a Structural Perspective

이 논문은 표현 구조 분석을 통해 거대 언어 모델의 다국어성을 조사하며, 저자원 언어가 고자원 및 중자원 언어보다 영어와 구조적으로 더 뚜렷하게 구별된다는 점과 언어 특화적 사후 학습이 언어 간 관계를 유지하면서도 이러한 구조를 수정한다는 점을 밝혀낸다.

원저자: Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 모든 책이 서로 다른 언어를 나타내는 거대하고 다층적인 도서관이라고 상상해 보십시오. 오랫동안 연구자들은 이 도서관이 어떻게 책들을 정리하는지 이해하기 위해 노력해 왔습니다. 기존의 대부분의 연구는 도서관의 선반에 놓인 개별 단어(또는 "토큰")를 조사하며, "영어의 'cat'이라는 단어가 일본어의 'cat'과 얼마나 유사한가?"라고 물었습니다.

하지만 이 논문은 다른 접근 방식을 취합니다. 저자들은 개별 단어를 보는 대신, 도서관 전체의 구조를 살펴봅니다. 그들은 다음과 같이 질문합니다. "건물 전체가 어떻게 배치되어 있는가? 영어 구역과 일본어 구역은 동일한 건축 양식에 속하는 것처럼 보이는가, 아니면 완전히 다른 설계도를 바탕으로 지어졌는가?"

다음은 쉬운 비유를 사용한 연구 결과의 요약입니다.

1. 단어만 보는 것의 문제점

토크나이저(텍스트를 단어로 나누는 도구)를 텍스트를 작고 깔끔한 조각으로 자르는 가위라고 생각해 보십시오. 영어의 경우 가위는 텍스트를 작고 정갈한 조각으로 자릅니다. 하지만 다른 언어의 경우, 가위는 텍스트를 거대한 덩어리로 자르거나 아주 작고 파편화된 조각으로 자를 수도 있습니다. 이 "조각"들의 크기가 다르기 때문에, 단어 대 단어로 비교하는 것은 레고 블록 더미와 모래 더미를 비교하려는 것과 같습니다. 둘 다 "물질"이라는 점은 알 수 있겠지만, 그것들이 어떻게 구성되어 있는지에 대한 큰 그림은 놓치게 됩니다.

2. 새로운 도구: "구조적 X-레이"

저자들은 STRUCTLENS라고 불리는 도구를 사용했습니다. 이것을 단순히 벽돌을 보는 것이 아니라 전체 골격을 스캔하는 X-레이 기계라고 상상해 보십시오. 이 도구는 모델이 문장을 처리할 때 서로 다른 부분들이 어떻게 연결되는지를 보여주는, 각 언어에 대한 "가계도"를 구축합니다.

그들은 이 가계도 사이의 거리를 측정했습니다. 만약 영어의 가계도가 독일어와 매우 유사하다면 거리는 짧습니다. 만약 영어의 가계도가 저자원 언어(징파어와 같은)와 전혀 닮지 않았다면 거리는 매우 멉니다.

3. 주요 발견 사항

"풍요로운" 언어 vs "빈곤한" 언어의 격차
연구는 도서관이 어떻게 조직되어 있는지에 대한 명확한 분리를 발견했습니다:

  • 고자원 및 중자원 언어 ("부유한 동네"): 독일어, 일본어, 중국어, 인도네시아어와 같은 언어는 잘 연결된 동네와 같습니다. 서로 다르더라도, 도서관의 내부 구조는 이들을 매우 유사하게 취급합니다. 이들은 유사한 건축 설계도를 공유합니다.
  • 저자원 언어 ("외딴 마을"): 데이터가 적게 사용 가능한 언어들(아라네스어, 과라니어, 징파어 등)은 영어와 구조적으로 매우 다릅니다. 이들은 완전히 다른 건축 양식을 가진 외딴 마을과 같습니다. 모델이 이 언어들을 "읽을" 수는 있을지라도, 이를 처리하는 내부 방식은 영어를 처리하는 방식과는 근본적으로 다릅니다.

"코사인 유사도"의 함정
저자들은 과학자들이 흔히 사용하는 측정법인 "코사인 유사도(Cosine Similarity)"가 마치 그림의 평균 색상을 보는 것과 같다는 사실을 발견했습니다.

  • 빨간색 물감과 파란색 물감을 섞으면 평균적으로 보라색이 될 수 있습니다.
  • 빨간색과 파란색을 다른 비율로 섞어도 평균은 여전히 보라색일 수 있습니다.
  • 함정: 모델의 영어와 일본어에 대한 "평균" 모습은 매우 유사하여(높은 코사인 유사도), 마치 모델이 두 언어를 똑같이 잘 이해하고 있는 것처럼 보이게 만들 수 있습니다.
  • 실제: "구조적 거리"(X-레이)를 통해 보면, 그 "패턴"은 완전히 다릅다는 것이 드러납니다. 모델은 비록 "평균"은 비슷할지라도, 일본어 단어를 영어 단어와는 완전히 다른 내부 패턴으로 조직하고 있습니다.

"특화 훈련"의 효과 (사후 학습)
연구진은 일반적인 모델을 가져와 특정 언어(일본어와 같은)를 위한 추가 학습을 시켰을 때 어떤 일이 일어나는지도 살펴보았습니다.

  • 비유: 모든 사람을 위해 집을 짓는 일반 건설업자를 상상해 보십시오. 만약 당신이 그에게 특정한 형태의 일본식 집을 짓도록 고용한다면, 그는 그 집의 세부 사항(지붕, 미닫이문 등)에 매우 능숙해질 것입니다.
  • 발견: 모델은 일본어를 더 잘하게 되며, 일본어 섹션의 내부 구조는 더 정교하고 독특해집니다. 하지만, 일본어 섹션과 영어 섹션 사이의 거리는 정확히 그대로 유지됩니다. 모델은 일본어를 영어와 어떻게 연관 짓는지에 대한 방식을 바꾼 것이 아니라, 단지 일본어 섹션 자체를 더 다듬었을 뿐입니다.

요약

요컨대, 이 논문은 AI가 언어를 어떻게 다루는지 진정으로 이해하려면 단순히 단어를 세거나 평균적인 유사성을 보는 것만으로는 부족하다고 주장합니다. 우리는 AI가 생각하는 방식의 구조적 골격을 보아야 합니다.

그들의 결론은 다음과 같습니다:

  1. 친숙한 언어(데이터가 많은 언어)는 유사한 내부 "건축 구조"를 공유합니다.
  2. 생소한 언어(데이터가 적은 언어)는 모델이 기술적으로 읽을 수 있다고 하더라도 완전히 다른 내부 건축 구조를 가집니다.
  3. 특화 훈련은 특정 언어의 내부 구조를 개선하지만, 그 언어가 모델의 마음속에서 다른 언어들과 관계를 맺는 방식은 반드시 바꾸지는 않습니다.

이는 AI 모델이 다국어 능력을 갖추어 가고 있음에도 불구하고, 그들의 "두뇌" 깊은 곳에서는 여전히 "풍요로운" 언어와 "빈곤한" 언어를 근본적으로 다른 방식으로 취급하고 있음을 이해하는 데 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →