← 최신 논문
💬 NLP

A Systematic Comparison of Multilingual Interpretability Methods Reveals Anisotropy-Driven Failures

이 논문은 21개의 모델에 걸쳐 네 가지 다국어 해석 가능성 방법론을 체계적으로 평가하여, 이방성(anisotropy)이 대부분의 지표를 왜곡하는 반면 ILO는 교차 언어 전이 성능과 독특하고 견고하게 상관관계가 있음을 발견하였으며, 이에 따라 저자들은 이방성 진단과 더불어 ILO를 주요 공유 지표로 권장한다.

원저자: Oskar Holmström, Marcel Bollmann, Marco Kuhlmann

게시일 2026-09-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Oskar Holmström, Marcel Bollmann, Marco Kuhlmann

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어를 이해하는 현대 인공지능 시스템은 단어와 문장을 거대한 다차원 공간으로 매핑하는 수학적 토대 위에 구축되어 있습니다. 이 공간에서 단어의 의미는 특정 지점으로 표현되며, 단어 사이의 관계는 그 지점들 사이의 거리와 방향에 의해 정의됩니다. 여러 언어를 동시에 학습할 때, 모델들은 서로 다른 언어 간에 유사한 개념을 표현하기 위해 동일한 내부 지점들을 사용하기 시작하는 놀라운 능력을 발달시키는데, 이는 효과적으로 공유된 정신적 사전을 만드는 것과 같습니다. '교차 언어 공유(cross-lingual sharing)'라고 알려진 이 현상은 주로 영어로 학습된 모델이 스와힐리어로 질문에 답하거나 일본어 시를 번역할 수 있게 하는 엔진 역할을 합니다. 그러나 수년 동안 과학자들은 이 공유가 정확히 얼마나 잘 일어나는지 측정하는 데 어려움을 겪어 왔습니다. 서로 다른 연구팀들이 동일한 것을 측정하기 위해 각기 다른 자(ruler)를 만들어 냈고, 종종 그 자들은 상충하는 결과를 내놓았습니다. 어떤 팀은 모델이 지식을 완벽하게 공유한다고 말하는 반면, 다른 방법론을 사용한 팀은 모델이 거의 아무것도 공유하지 않는다고 말하기도 했습니다. 이러한 혼란은 어떤 모델이 진정으로 다국어 능력을 갖춘 것인지, 아니면 그저 그런 척하는 것인지 파악하는 것을 어렵게 만들었습니다.

한 연구팀은 서로 대비되는 네 가지 대표적인 측정 도구를 다양한 언어 모델에 대조함으로써 이 혼란을 해결하고자 했습니다. 연구진은 다섯 가지 서로 다른 AI 계열을 대표하며, 1억 2,500만 개에서 140억 개의 파라미터에 이르는 다양성을 포괄하는 21개의 서로 다른 모델을 수집했습니다. 이 모델들의 규모는 분야의 다양성을 포착합니다. 연구진은 이 모델들에게 아랍어, 중국어, 영어, 터키어를 포함한 10가지 언어의 표준 문장 세트를 입력했고, 모델들이 언어를 얼마나 섞고 있는지 확인하기 위해 네 가지 측정 도구를 각각 적용했습니다. 또한, 연구진은 새로운 과업을 영어로 가르친 뒤 추가 학습 없이도 이를 다른 언어로 얼마나 잘 적용할 수 있는지 확인하는 방식으로 모델의 실질적인 성능을 테스트했습니다. 이 기능적 테스트는 측정치가 모델의 지식 전이 능력을 실제로 예측하는지 확인하는 검증 기준 역할을 했으나, 저자들은 전이가 단순히 표현 정렬(representational alignment) 이상의 요인에 의해 구동된다는 점을 언급했습니다.

결과는 측정 도구 간의 불일치가 모델 자체의 문제가 아니라, 도구가 어떻게 설계되었는지에 따른 결함임을 드러냈습니다. 연구진은 모델의 내부 표현이 종종 '이방성(anisotropy)'을 띠고 있다는 사실을 발견했는데, 이는 데이터가 모든 방향으로 고르게 퍼지지 않고 좁고 뾰족한 원뿔 형태로 길게 늘어진 모양을 설명하는 용어입니다. 구(sphere)와 가느다란 연필의 차이를 상상해 보십시오. 연필 모양의 공간에서는 공간 자체가 매우 좁기 때문에 거의 모든 두 지점이 서로 가깝게 보입니다. 네 가지 측정 도구 중 세 가지는 이 형태에 속았습니다. 이 도구들은 모든 지점이 밀집해 있다는 사실을 근거로, 실제로는 언어가 섞이지 않았음에도 불구하고 강력한 공유가 일어나고 있다고 해석했습니다. 특히 한 도구는 패턴을 찾기 위해 가장 중요한 정보의 방향들을 제거하는 방식을 사용했는데, 결과적으로 언어적 정체성이 제거된 방향으로 밀려난 것을 발견하고는 아무것도 찾지 못했습니다. 이는 마치 국물에서 소금기를 제거하여 특정 맛을 찾으려 한 뒤, 소금이 사라졌다는 이유만으로 국물이 싱겁다고 결론 내리는 것과 같았습니다.

반면, '언어 간 국소 중첩(Interlingual Local Overlap)'이라 불리는 특정 측정법은 유일하게 신뢰할 수 있는 자임이 증명되었습니다. 이 도구는 모델의 내부 공간에서 각 단어의 즉각적인 이웃을 살펴보고, 서로 다른 언어의 단어들이 서로 옆에 서 있는지 확인했습니다. 다른 도구들과 달리 이 방식은 엄격한 테스트를 통과했습니다. 이 도구는 모델의 크기나 계열에 관계없이 일관되게 높은 상관관계를 보이며, 모델이 교차 언어 과업에서 얼마나 잘 수행될지를 지속적으로 예측했습니다. 연구진은 이 특정 지표에서 높은 점수를 받은 모델들이 영어를 다른 언어로 성공적으로 지식을 전이할 수 있는 모델이라는 것을 발견했습니다. 다른 도구들은 지식을 공유하는 모델과 그렇지 않은 모델을 구분하는 데 실패하거나, 데이터의 좁은 형태에 너무 큰 영향을 받아 실제로는 공유 능력이 떨어지는 모델에 대해서도 오해의 소지가 있는 높은 점수를 산출했습니다.

본 연구는 데이터의 기하학적 왜곡보다는 실제 언어의 혼합에 민려한 도구들에 의해 학계가 오도되어 왔다고 결론짓습니다. 연구진은 향후 연구에서 '언어 간 국소 중첩'을 주요 공유 지표로 사용할 것을 권장하며, 반드시 이방성 진단(anisotropy diagnostics)과 함께 보고할 것을 권고합니다. 나아가, 누군가 언어 공유 점수를 보고할 때는 반드시 데이터 형태에 대한 진단 체크를 함께 보고하여, 높은 점수가 단순한 좁고 왜곡된 공간 때문이 아니라 진정한 혼합을 반영하는 것임을 보장해야 한다고 제안합니다. 이 작업은 언어 모델이 어떻게 학습하는지에 대한 미스터리를 해결했다고 주장하는 것이 아니라, 무엇을 학습했는지 측정하는 명확하고 신뢰할 수 있는 방법을 제공하는 것입니다. 작동하는 도구와 실패하는 도구를 식별함으로써, 연구진은 안개를 걷어내어 과학계가 마침내 동일한 조건에서 모델들을 비교하고 다국어 지능의 진정한 본질을 이해할 수 있도록 길을 열어주었습니다. 이러한 결과는 글로벌 공유 지표를 부정하는 것이 아니라 교정하는 것입니다. 즉, 단일한 글로벌 점수는 모델 간의 공유를 정량화하고 비교하는 데 여전히 적절한 도구이지만, 공유가 어떻게 구현되는지를 설명하기 위해서는 기계론적인 방법이 필요하다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →