← 최신 논문
💬 NLP

Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures

이 논문은 거대 언어 모델의 잠재 표현이 인도-유럽어족과 같은 언어 가족의 계층적 유사성 구조를 정확하게 포착할 때 다국어 벤치마크인 XNLI에서의 성능 향상과 직접적으로 상관관계가 있다는 점을 통해, 이러한 구조적 정렬이 이루어질 때 모델이 언어 간에 더 잘 일반화된다는 것을 입증한다.

원저자: Supantho Rakshit, Adele Goldberg, Henry Conklin

게시일 2026-08-14
📖 5 분 읽기🧠 심층 분석

원저자: Supantho Rakshit, Adele Goldberg, Henry Conklin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보세요. 단순히 사전만 주는 것이 아니라, 수백만 권의 책, 웹사이트, 이야기를 읽게 하는 것입니다. 시간이 흐르면서 로봇은 사물들이 서로 어떻게 연관되어 있는지에 대한 정신적 지도를 구축하기 시작합니다. 컴퓨터 과학에서는 이를 '거대 언어 모델(LLM)'이라고 부릅니다. 이 모델들을 인터넷에 있는 거의 모든 것을 읽은 초지능 디지털 뇌라고 생각하면 됩니다. 하지만 여기에 까다로운 점이 있습니다. 그들이 읽은 내용의 대부분은 영어라는 사실입니다. 만약 그들에게 스와힐리어 나 아이슬란드어처럼 많이 접해보지 못한 언어로 말해달라고 요청하면, 그들은 종종 비틀거리곤 합니다.

과학자들은 오랫동안 이런 일이 발생하는지 궁금해해 왔습니다. 심리학의 핵심 아이디어는 우리의 뇌(그리고 똑똑한 컴퓨터들)가 유사점을 포착함으로써 학습한다는 것입니다. 만약 당신이 '개'가 무엇인지 안다면, 개와 비슷하게 생기고 행동하기 때문에 '늑대'가 무엇인지 추측할 수 있습니다. 이것을 '일반화'라고 부릅니다. 정신적 지도가 유사한 것들을 더 잘 그룹화할수록, 새로운 것을 더 잘 추측할 수 있게 됩니다. 그렇다면 이 동일한 규칙이 전체 언어에도 적용될까요? 이 디지털 뇌들이 족보가 친척들을 정리하는 방식처럼 비밀리에 언어들을 조직하고 있을까요? 그것이 바로 이 논문이 답하고자 하는 거대한 질문입니다.


위대한 언어 가족 재회

영어, 스페인어, 힌디어, 러시아어를 포함한 거대한 그룹인 인도-유럽어족의 모든 언어가 초대받은 거대하고 보이지 않는 파티를 상상해 보세요. 현실 세계에서 우리는 이 언어들이 사촌, 형제, 먼 친척처럼 서로 연관되어 있다는 것을 알고 있습니다. 스페인어와 이탈리아어 같은 언어는 같은 집에서 자란 쌍둥이와 같습니다. 영어와 힌디어 같은 언어는 수천 년 동안 서로 만나지 못한 먼 사촌와 같습니다.

이 논문의 연구진은 거대 언어 모델(LLM)이 이 가족 족보를 비밀리에 알고 있는지 확인하고 싶었습니다. 그들은 모델에게 "헤이, 이 언어들이 서로 연관되어 있니?"라고 묻지 않았습니다. 대신, 모델이 언어들을 어떻게 그룹화하는지 보기 위해 모델의 '생각'(내부 수학)을 들여다보았습니다. 이것은 마치 파티에 온 손님를 관찰하며 그가 누구 옆에 서 있는지를 보는 것과 같습니다. 만약 모델이 스페인어와 이탈리아어는 가깝게 배치하면서 힌디어와는 멀리 떨어뜨려 놓는다면, 이는 모델이 명시적으로 배우지 않았음에도 불구하고 가족 관계를 이해하고 있음을 보여주는 것입니다.

발견: 모델들은 비밀 지도를 가지고 있다

연구팀은 오래된 모델부터 최신 모델까지 38개 언어의 수천 개 문장을 입력하여 12개의 서로 다른 AI 모델을 테스트했습니다. 그런 다음 특별한 수학적 기법을 사용하여 각 언어에 대해 모델이 '느끼는' 방식을 지도화했습니다.

결과는 놀랍고도 즐거웠습니다: 모델들은 우연히 실제 언어의 가족 족보와 거의 똑같이 보이는 지도를 구축했습니다.

계보학자가 가계도를 그리는 것처럼, 모델들은 자연스럽게 언어들을 동일한 하위 가족으로 묶었습니다. 게르만어파(영어와 독일어 등)는 함께 모여 있었고, 로망스어파(프랑스어와 스페인어 등)는 자신들만의 원을 형성했으며, 슬라브어파(러시아어와 폴란드어 등)는 자신들의 그룹에 붙어 있었습니다. 모델들은 자신들에게 "이것들은 로망스어파이다"라고 알려줄 선생님이 필요하지 않았습니다. 그들은 단지 데이터를 읽는 것만으로 스스로 그것을 알아냈습니다.

왜 어떤 모델이 파티에서 더 뛰어난가

하지만 반전이 있습니다: 모든 모델이 똑같이 뛰어난 것은 아닙니다. 연구진은 모델이 언어 지도를 얼마나 잘 조직했는지와 XNLI라고 불리는 어려운 테스트(모델이 서로 다른 언어로 된 문장이 한 문장을 증명하는지, 모순되는지, 혹은 관련이 없는지를 추측해야 하는 테스트)에서 얼마나 잘 수행하는지 사이에 직접적인 연관성이 있다는 것을 발견했습니다.

이렇게 생각해 보세요. 만약 어떤 학생이 역사적 사실들을 뒤섞어 놓은 엉망진창인 노트를 가지고 있다면, 그 학생은 테스트 질문에 답하는 데 어려움을 겪을 것입니다. 하지만 만약 그 노트가 주제별로 완벽하게 정리되어 있다면, 그 학생은 즉시 답을 찾아낼 수 있습니다. 논문은 '언어 노트'를 올바르게 조직한(유사한 언어를 가깝게 유지한) 모델들이 테스트 문제를 훨씬 더 잘 해결한다는 것을 발견했습니다.

구체적으로, 다양한 언어의 데이터로 훈련된(다국어 모델) 모델들이 주로 영어로 훈련된 모델들보다 이 가족 지도를 그리는 데 훨씬 더 뛰어난 성과를 보였습니다. 이는 다국어 모델이 더 크고 명확한 지도를 가진 반면, 영어 전용 모델은 흐릿하고 불완전한 스케치로 길을 찾으려 노력하는 것과 같습니다.

'스크립트' 함정과 다른 놀라운 사실들

모델들이 종이 위에 보이는 모습(알파벳이나 스크립트)에 따라 언어를 그룹화했을 것이라고 추측할 수도 있습니다. 예를 들어, 힌디어와 우르두어가 둘 다 데바나가리 스크립트를 사용하기 때문에 비슷하다고 생각했을 수도 있습니다. 논문은 아니라고 말합니다. 언어가 쓰이는 방식(철자법)이 작은 영향을 미치기는 하지만, 그것이 주된 이유는 아닙니다. 모델들은 힌디어와 우르두어가 서로 다른 스크립트를 사용함에도 불구하고 언어적 사촌임을 알아차렸고, 아랍어 스크립트를 사용하는 페르시아어가 아랍어 계열이 아니라 북인도 언어들과 연관되어 있다는 것도 알아냈습니다. 모델들은 단순히 폰트를 보는 것이 아니라 언어의 구조를 보고 있었던 것입니다.

하지만 모델들이 완벽했던 것은 아닙니다. 그들은 그리스어, 웨일스어, 알바니아어 같은 '고립된(orphan)' 언어들에서 가끔 혼란을 겪기도 했습니다. 일부 모델에서는 그리스어와 웨일스어가 서로 밀접한 관련이 없음에도 불구하고 이상하게 짝지어지기도 했습니다. 이는 모델들이 큰 그림을 보는 데는 뛰어나지만, 가족 나무의 독특하고 고립된 가지들에서는 가끔 발을 헛디딜 수 있음을 시사합니다.

그들은 언제 이것을 배웠나?

연구진은 모델이 훈련되는 과정을 마치 아기가 걷는 법을 배우는 것을 관찰하듯 지켜보았습니다. 그들은 모델이 학습의 아주 초기 단계, 즉 단 100번의 학습 단계만 거친 후에도 이러한 언어 그룹을 조직하기 시작했다는 것을 발견했습니다. 이는 "누가 누구와 친척인가"를 파악하는 것이 똑똑한 언어 모델이 특정 단어의 세세한 디테일을 배우기 전에 가장 먼저 배우는 것 중 하나라는 점을 시사합니다.

결론

이 논문은 언어 모델의 성공 비결이 단순히 더 많은 단어를 암기하는 것이 아니라, 언어들이 서로 어떻게 연관되어 있는지에 대한 좋은 정신적 지도를 구축하는 데 있다는 것을 시사합니다. 모델이 스페인어와 이탈리아어가 가까운 사촌이고, 영어와 독일어가 형제라는 것을 이해할 때, 모델은 한 언어에서 다른 언어로 아이디어를 번역하는 데 훨씬 더 능숙해집니다.

이 디지털 뇌들은 놀라울 정도로 역사에 능숙합니다. 그들은 인도-유럽어족의 족보를 배우기 위해 교과서가 필요하지 않았습니다. 그저 세상을 읽었을 뿐이며, 패턴은 스스로 나타났습니다. 그리고 그 지도를 그리는 능력이 향상될수록, 그 지도가 담고 있는 모든 언어를 말하는 능력 또한 향상됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →