← 최신 논문
💬 NLP

The Geometry of Low-Resource Language Representations

이 논문은 거대 언어 모델 내 저자원 언어가 데이터 부족으로 인해 마지막 레이어에서 표현 퇴화(representational degeneration)를 겪는다는 것을 입증하며, 지속적 사전 학습(continued pretraining) 과정에서 기하학적 정규화(geometric regularisation)를 적용하는 것이 이러한 문제를 효과적으로 완화하여 성능을 향상시킬 수 있음을 보여준다.

원저자: Francois Meyer, Jan Buys

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Francois Meyer, Jan Buys

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 오늘날 우리가 사용하는 많은 인공지능 도구의 엔진이며, 이야기를 쓰고, 문제를 해결하며, 텍스트를 번역할 수 있는 능력을 갖추고 있습니다. 그러나 이러한 시스템들은 모든 인간의 언어에 대해 동일하게 구축되지 않았습니다. 이 모델들은 방대한 양의 디지털 텍스트를 활용할 수 있는 영어 나 스페인어와 같은 언어로는 탁월한 성능을 발휘하지만, 디지털 자원이 적은 언어에는 종종 크게 어려움을 겪습니다. 이러한 격차는 단순히 데이터가 적다는 문제만이 아닙니다. 이는 모델이 정보를 처리하는 내부 방식이 데이터가 부족할 때 무너진다는 것을 시사합니다. 과학자들은 모델이 충분히 접해보지 못한 언어를 마주했을 때 모델의 '두뇌' 내부에서 어떤 일이 일면하는지, 그리고 정보의 양에 따라 의미를 조직하는 방식이 변하는지 오랫동안 궁금해해 왔습니다.

케이프타운 대학교의 연구팀은 그 답을 찾기 위해 이 모델들의 내부를 직접 들여다보기로 했습니다. 그들은 모델의 내부 표현(internal representations)의 기하학적 구조에 집중했습니다. 간단히 말해, 컴퓨터가 단어를 처리할 때, 그것은 의미를 나타내는 숫자 목록으로 변환됩니다. 이 숫자 목록은 거대한 다차원 공간 속에 존재합니다. 연구진은 이 공간의 형태가 언어마다 어떻게 변하는지 확인하고자 했습니다. 그들은 데이터가 풍부한 언어의 경우, 이러한 숫자 목록이 넓게 퍼져 있고 뚜렷하여 모델이 서로 다른 의미들을 분리하여 유지할 수 있다는 것을 발견했습니다. 하지만 저자원 언어의 경우, 모델이 이 공간을 붕괴시켜 많은 서로 다른 의미들을 하나의 좁고 밀집된 클러스터로 몰아넣음으로써 의미의 독특함을 잃게 만드는 것처럼 보였습니다. 연구진이 '표현 퇴화(representational degeneration)'라고 부르는 이 현상은, 모델이 이러한 언어들에 대해 명확하게 생각할 수 있는 공간을 사실상 상실하고 있음을 의미합니다.

이를 조사하기 위해 연구팀은 10억 개의 파라미터를 가진 작은 버전부터 120억 개의 파라미터를 가진 더 큰 버전까지 9가지의 서로 다른 대규모 언어 모델을 검토했습니다. 그들은 매우 높은 자원을 가진 영어부터 오로모어나 월로프와 같은 매우 낮은 자원의 언어까지 30가지의 서로 다른 언어를 어떻게 표현하는지 분석했습니다. 단어의 숫자 표현들이 서로 얼마나 가까운지를 측정함으로써, 그들은 명확한 패턴을 발견했습니다. 즉, 언어의 데이터가 적을수록 모델의 내부 표현은 더 많이 뭉쳐서 붕괴되었습니다. 이 효과는 모델의 마지막 층(final layers)에서 가장 두드러졌는데, 이 부분은 단어의 의미가 무엇인지 또는 다음에 올 단어가 무엇인지에 대한 최종 결정을 내리는 역할을 합니다. 이 최종 단계에서 모델은 저자원 언어에 대한 서로 다른 개념들을 구별하는 능력을 상실하는 것처럼 보였으며, 이는 성능을 제한하는 병목 현상을 만들어냈습니다.

그 후 연구진은 이 문제를 해결할 수 있을지 질문을 던졌습니다. 그들은 단순히 더 많은 훈련 데이터를 추가하는 것이 이 언어들에게는 종종 불가능하다는 것을 알고 있었기에, '지속적 사전 학습(continued pretraining)'이라고 불리는 과정 중에 모델의 내부 기하학을 안내할 방법을 찾았습니다. 지속적 사전 학습이란 이미 다양한 언어가 혼합되어 훈련된 모델에게 특정 저자원 언어에 집중한 두 번째 훈련 과정을 제공하는 방법입니다. 연구팀은 이 훈련 과정 중에 부드러운 가이드 역할을 하는 새로운 기술을 도입했습니다. 그들은 단어의 숫자 표현들이 서로 너무 가까워지도록 내버려 둘 경우 모델에 벌칙을 주는 규칙을 추가했습니다. 이 규칙은 모델이 표현들을 넓고 뚜렷하게 유지하도록 강제하여, 관찰되었던 붕러 현상을 효과적으로 방지했습니다.

그들은 이 접근 방식을 테스트하기 위해 9가지의 서로 다른 기본 모델을 키냐르와다, 하우사, 요루바를 포함한 10개의 아프리카 언어에 적응시켰습니다. 결과는 이러한 기하학적 안내가 효과가 있음을 보여주었습니다. 이 새로운 규칙으로 훈련된 모델들은 그렇지 않은 모델들에 비해 이러한 언어들에 대해 더 건강하고 넓게 퍼진 내부 구조를 유지했습니다. 질문에 답하거나 수학 문제를 푸는 것과 같은 어려운 과제를 수행할 때 모델을 테스트한 결과, 개선 사항은 더 큰 모델들에서 가장 눈에 띄었습니다. 이 더 큰 시스템들의 경우, 기하학적으로 정규화된 훈련이 특히 가장 도전적인 과제들에서 더 나은 성능을 이끌어냈습니다. 이 연구는 모델이 저자원 언어를 더 잘 이해하도록 돕는 핵심은 단순히 더 많은 텍스트를 먹이는 것이 아니라, 그 텍스트를 조직하는 방식이 명확하고 뚜렷하게 유지되도록 보장하는 데 있다는 점을 시사합니다.

이 작업은 이러한 인공적 정신이 학습하는 방식에 대한 근본적인 진실을 강조합니다. 즉, 가용한 데이터의 양이 사고의 구조 자체를 형성한다는 것입니다. 데이터가 부족할 때, 의미가 거주하는 내부 공간은 비좁고 비효율적이 됩니다. 이러한 기하학적 결함을 인식함으로써, 연구진은 이를 개입하여 교정하는 것이 가능하다는 것을 입증했습니다. 일부 영역에서의 개선은 미미했지만, 훈련 과정에 대한 단순한 조정만으로도 개념 간의 구별 능력을 회복할 수 있다는 사실은 유망한 길을 제시합니다. 이는 적절한 종류의 안내가 있다면, 우리가 더 많은 데이터가 나타나기를 기다릴 필요 없이, 이 강력한 도구들이 모든 인간의 언어를 더 효과적으로 지원할 수 있도록 도울 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →