← 최신 논문
🤖 machine learning

Language models suffer from a curse of ambiguity

이 논문은 대규모 언어 모델에서 발생하는 '모호성의 저주(curse of ambiguity)'를 식별하고 이론적으로 분석하며, 모호한 다음 토큰 분포는 용량 요구량, 임베딩 크기, 학습 단계의 증가 및 증폭된 샘플링 노이로 인해 본질적으로 정확하게 학습하기 더 어렵다는 것을 합성 및 실제 실험을 통해 검증된 결과를 바탕으로 입증한다.

원저자: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

글을 쓰고 말을 하는 현대의 컴퓨터들은 단순하면서도 강력한 아이디어, 즉 앞서 나온 단어들을 보고 문장의 다음 단어를 예측한다는 원리에 기반하여 구축되었습니다. 이 과정은 마치 사람이 이야기를 생각하며 이미 말해진 내용을 바탕으로 가장 가능성 있는 다음 단계를 선택하듯, 한 번에 한 단어씩 진행됩니다. 수년 동안 엔지니어들은 이러한 기계가 단 하나의 가장 명확한 답을 찾는 능력을 개선하는 데 집중해 왔습니다. 하지만 이러한 시스템이 더욱 발전함에 따라, 단 하나의 명확한 답이 존재하지 않는 상황을 다루어야 하는 요구를 점점 더 많이 받고 있습니다. 문장이 여러 가지 서로 다른, 똑같이 타당한 방식으로 끝날 수 있을 때, 기계는 단 하나의 최상위 답변만을 고르는 것이 아니라 그 모든 가능성에 걸쳐 확신(confidence)을 분산시키는 법을 배워야 합니다. 이러한 불확실성을 이해하는 능력은 특히 이 기계들이 미래 버전의 학습 데이터를 직접 작성하기 시작하면서 매우 중요해지고 있습니다. 만약 기계가 가능성의 전체 범위를 포착하는 데 실패한다면, 스스로의 학습 품질을 저하시키는 좁고 반복적인 루프를 만들 위험이 있습니다.

스탠퍼드 대학교의 연구팀은 이 과업을 놀라울 정도로 어렵게 만드는 근본적인 장벽을 발견했습니다. 그들은 상황이 모호할수록(즉, 다음에 올 수 있는 그럴듯한 단어가 많을수록) 기계가 올바른 확률 분포를 학습하기가 더 어려워진다는 것을 발견했습니다. 연구진은 이를 "모호성의 저주(curse of ambiguity)"라고 부릅니다. 이는 단순히 기계가 조금 더 느려지거나 더 많은 데이터가 필요한 문제가 아닙니다. 그 어려움은 이러한 모델을 구동하는 신경망의 구조 자체에 내재되어 있습니다. 연구진은 가능한 정답의 수가 증가함에 따라, 기계가 훨씬 더 많은 내부 저장 공간, 더 큰 단어 내부 표현, 그리고 수학적 정확도를 맞추기 위한 훨씬 더 많은 학습 단계가 필요하다는 것을 보여주었습니다. 설령 기계가 마침내 학습하더라도, 여러 가능성 중 하나의 단어를 선택하는 과정에서 발생하는 일종의 노이즈가 기계가 언어의 실제 분포와 완벽하게 일치하는 것을 방해합니다.

이 현상이 왜 발생하는지 이해하기 위해, 연구팀은 문제를 가장 작은 단위로 나누어 분석했습니다. 그들은 기계의 최종 의사결정 계층을 문맥을 일련의 결과 집합으로 매핑하는 단순한 분류기(classifier)로 취급했습니다. 실험에서 연구진은 정확한 정답(ground truth)을 알고 있는 합성 과업들을 만들었습니다. 즉, 특정 구절 뒤에 동일하게 나타날 수 있는 단어의 수를 정해둔 것입니다. 연구진은 열 개의 가능한 결과가 있는 패턴을 저장하는 데는 단 하나의 결과가 있는 패턴보다 약 열 배 더 많은 용량이 필요하다는 것을 발견했습니다. 이는 마치 기계가 기억해야 할 각 옵션마다 별도의 구별된 경로를 구축해야 하는 것과 같습니다. 나아가, 연구진은 이러한 문맥을 보유하기 위해 기계가 사용하는 내부 "어휘(vocabulary)"의 크기도 모호함에 맞춰 커져야 한다는 것을 발견했습니다. 만약 기계가 너무 작은 표현을 사용하여 여러 유효한 결말이 있는 상황을 나타내려 한다면, 아무리 많이 학습하더라도 그 옵션들을 구별해낼 수 없습니다.

이러한 어려움은 저장 공간의 문제를 넘어 확장됩니다. 연구진은 기계가 시간이 지남에 따라 어떻게 학습하는지도 분석했습니다. 그들은 상황에 가능한 결과가 많을 때 학습 과정이 훨씬 더 느리게 시작된다는 것을 발견했습니다. 가능한 정답이 많아지면 기계가 접하는 특정 정답 단어의 빈도가 낮아지기 때문에, 내부 설정을 조정하기 위한 신호가 약해지기 때문입니다. 이는 진전을 보이기까지 더 오랜 시간이 걸림을 의미합니다. 더욱 심각한 것은, 기계가 한 번에 하나의 무작위적인 정답 예시만을 보는 실제 데이터로 학습할 때 지속적인 오류가 발생한다는 점입니다. 대상이 단 하나의 확실한 단어일 때는 기계가 결국 완벽하게 학습할 수 있습니다. 하지만 대상이 여러 단어의 분포일 때, 매 단계에서 단 하나의 예시만을 보는 무작위성은 기계가 넘을 수 없는 오차의 하한선(floor of error)을 만듭니다. 아무리 오래 학습하더라도 기계는 항상 약간의 오차를 가질 수밖에 없으며, 실제 확률의 분포를 완벽하게 재현하지 못합니다.

연구팀은 통제된 합성 테스트뿐만 아니라 실제 텍テキスト로 학습된 거대 언의 모델에서도 이러한 발견을 확인했습니다. 실제 데이터에 대한 모델의 성능을 분석한 결과, 연구진은 문맥의 모호성이 증가함에 따라 모델의 예측력이 떨어지고, 있어서는 안 될 단어들로 확률 질량(probability mass)이 새어 나가는 현상을 관찰했습니다. 이는 모호성의 저주가 소규모 실험 모델부터 오늘날 사용되는 조 단위의 파라미터를 가진 거대 시스템에 이르기까지, 이러한 시스템의 보편적인 특성임을 시사합니다. 연구진은 이 한계가 단순한 소프트웨어 업데이트로 해결할 수 있는 버그가 아니라, 네트워크가 불확실성을 표현하는 방식의 근본적인 제약이라고 주장합니다.

이 발견은 인공지능의 역량을 바라보는 우리의 관점을 변화시킵니다. 이는 모델의 규모를 키우는 것이 도움이 되기는 하지만, 모호성이라는 핵심 문제를 해결해주지는 못한다는 점을 시사합니다. 가장 거대한 모델이라 할지라도 여러 가지 그럴듯한 결과가 존재하는 상황을 완벽하게 모델링하는 데는 항상 어려움을 겪을 것이며, 학습되지 않은 진실의 잔여 부분이 남게 될 것입니다. 이는 우리가 이러한 시스템을 얼마나 신뢰할 것인가에 대한 실질적인 함의를 갖습니다. 의료 진단이나 법률적 추론처럼 정밀함이 요구되는 분야에서, 우리는 모델의 확신 분포가 명확한 답이 없을 때 본질적으로 노이즈를 포함할 수 있음을 인지해야 합니다. 이 연구는 기계의 출력을 언제 신뢰해야 하는지, 그리고 기계의 불확실성이 데이터의 부족 때문인지 아니면 더 깊은 구조적 한계 때문인지를 이해하는 새로운 틀을 제공합니다. 궁극적으로 이 논문은 인간의 언어를 풍요롭고 유연하게 만드는 바로 그 요소, 즉 다양한 방식으로 많은 것을 말할 수 있는 능력이 기계에게는 가장 배우기 어려운 요소라는 점을 밝혀내고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →