← 최신 논문
💬 NLP

Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

이 논문은 교차 언어 언어 모델 평가에 널리 사용되는 정규화된 지표들이 토큰화 및 철자 차이로 인해 편향을 유발한다는 것을 입증하며, 의미론적으로 동등한 시퀀스들에 대한 문장 수준의 음의 로그 가능도가 언어 간 모델 비교를 위한 더 일관되고 공정한 대안을 제공한다고 제안한다.

원저자: Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiulin Yang, Ethan Gotlieb Wilcox, Catherine Arnett

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급변하는 인공지능의 세계에서 컴퓨터는 수십 가지의 인간 언어로 말하고 쓰는 법을 배우고 있습니다. 언어 모델이라고 불리는 이 디지털 지능들은 문장에서 다음에 올 단어를 예측하기 위해 방대한 텍스트 라이브러리를 학습합니다. 이러한 시스템이 점점 더 강력해짐에 따라, 연구자들은 중대한 과제에 직면해 있습니다. 즉, 모델이 특정 언어에 대해 진정으로 뛰어난 것인지, 아니면 단순히 그 언어가 컴퓨터에 기록되는 방식에 능숙한 것인지 어떻게 알 수 있는가 하는 점입니다. 이를 해결하기 위해 과학자들은 모델이 단순히 원시 문자나 기호를 얼마나 효율적으로 처리할 수 있는지가 아니라, 텍스트의 의미를 얼마나 잘 이해하는지를 측정해야 합니다. 문제는 현재 이 이해도를 측정하는 데 사용되는 도구들이 종-종 숨겨진 함정을 포함하고 있다는 것입니다. 이 도구들은 단어의 글자 수, 언어를 표기하는 데 사용된 특정 스크립트, 또는 컴퓨터가 문장을 처리하기 위해 아주 작은 조각들로 나누는 방식에 의해 왜곡될 수 있습니다. 만약 이러한 도구들이 편향되어 있다면, 모델의 실제 지능 때문이 아니라 데이터를 처리하는 방식의 기술적 특이점 때문에, 어떤 언어에서는 모델을 천재처럼 보이게 하고 다른 언어에서는 서투르게 보이게 만들 수 있습니다. 이는 인공지능이 세계의 다양한 언어 전반에 걸쳐 얼마나 잘 수행되는지 공정하게 비교하는 것을 거의 불가능하게 만듭니다.

조지타운 대학교와 EleutherAI의 연구팀은 이 모델들을 평가하는 데 사용되는 도구 자체를 테스트함으로써 이 수수께를 풀기 위해 나섰습니다. 그들은 각각 열 가지 서로 다른 언어만을 전문적으로 학습한 50개의 개별 컴퓨터 모델을 사용하여 통제된 실험을 구축했습니다. 공정한 테스트를 보장하기 위해, 그들은 병렬 데이터(즉, 서로 다른 언어로 동일한 의미를 표현하는 텍스트)를 통해 모델을 학습시켰습니다. 그런 다음 그들은 해당 분야에서 흔히 사용되는 여섯 가지 측정 방법을 사용하여 이 모델들을 테스트했습니다. 어떤 방법들은 모델이 문장을 이해하는 데 사용하는 작은 구성 요소인 토큰의 총 개수를 세며, 다른 방법들은 디지털 저장 단위인 바이트의 수나 화면상의 개별 문자의 수를 셉니다. 또한 연구진은 문장의 길이에 따라 그 난이도를 나누지 않고, 모델이 전체 문장을 예측하는 데 드는 총체적인 어려움을 단순히 합산하는 방법도 테스트했습니다.

결과는 이러한 측정 방식들이 어떻게 작동하는지에 대한 놀라운 진실을 드러냈습니다. 모델의 성능을 토큰, 바이트, 또는 문자의 수로 나누는 방식들은 서로 다른 언어를 비교할 때 매우 결함이 있는 것으로 밝혀졌습니다. 이러한 지표들은 중국어와 같이 동일한 아이디어를 표현하는 데 자연스럽게 더 적은 문자나 바이트를 사용하는 언어를 일관되게 선호하는 반면, 더 긴 기호 시퀀스를 필요로 하는 언어에는 불리하게 작용했습니다. 한 가지 눈에 띄는 사례로, 영어만 학습한 모델이 이러한 결함이 있는 방법으로 측정했을 때 러시아어에 대해 영어보다 더 "잘" 수행하는 것으로 나타났는데, 이는 단순히 컴퓨터가 러시아어 텍스트를 더 많은 조각으로 나누어 점수를 인위적으로 낮추었기 때문이었습니다. 이는 모델이 러시아어를 본 적이 없고 실제로 러시아어 수행 능력이 낮았음에도 불구하고 발생한 일이었습니다. 이 연구는 이러한 대중적인 지표들이 모델의 실제 지능이나 이해도를 측정하는 것이 아니라, 단지 컴퓨터가 텍ks트를 읽도록 설정되었을 때의 엔지니어링 선택을 반영하고 있을 뿐이라는 것을 보여주었습니다.

반면, 문장의 길이에 따라 나누지 않고 전체 난이도를 합산한 방법은 유일하게 공정한 접근법임이 증명되었습니다. 연구진이 '문장 수준 음의 로그 가능도(sentence-level negative log-likelihood)'라고 부르는 이 척도는 모델이 텍text 전체의 의미를 이해하기 위해 쏟은 총 노력을 살펴보았습니다. 이 척도는 텍스트가 글자나 디지털 저장 공간 측면에서 얼마나 긴지에 따라 점수를 정규화하려고 시도하지 않았기 때문에, 스크립트나 컴퓨터의 어휘 크기에 관계없이 안정적이었습니다. 연구진이 이 방법을 대규모의 실제 다국어 모델에 테스트했을 때, 이 방법만이 모델이 학습한 데이터의 알려진 구성과 일치하도록 어떤 언어를 가장 잘 배웠는지 정확하게 식별해 냈습니다. 다른 방법들은 텍스트가 저장되고 처리되는 기술적 세부 사항에 의해 왜곡된 순위를 계속해서 만들어냈습니다.

연구진은 또한 동일한 의미가 다른 방식으로 표현될 때 이러한 측정치들이 일관성을 유지하는지 조사했습니다. 그들은 일부 지표가 번역이나 바꾸어 쓰기 방식에 따라 크게 요동치는 반면, 문장 수준의 방법은 안정적으로 유지된다는 것을 발견했습니다. 이는 다른 방법들의 겉보기 안정성이 진정한 신뢰성의 징후가 아니라, 표면적인 세부 사항에 대한 민감도가 만들어낸 환상임을 시사합니다. 이 연구는 인공지능이 서로 다른 문화와 언어 전반에서 얼마나 잘 작동하는지 진정으로 이해하려면, 과학자들이 토큰, 바이트, 또는 문자의 수를 세는 지표에 의존하는 것을 멈춰야 한다고 결론짓습니다. 대신, 그들은 텍스트의 전체 의미를 존중하는 척도를 사용하여, 평가가 디지털 표현의 특이점이 아닌 모델의 실제 학습을 반영하도록 해야 합니다. 이러한 변화는 사람들이 사용하는 언어와 상관없이 모두를 위해 진정으로 공정하고 효과적인 시스템을 구축하는 데 필수적입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →