Information-Theoretic Limits of Reliability and Scaling in Language Models
이 논문은 작업의 모호성과 토큰 간 의존성에 기반하여 내재적인 신뢰성 상한선을 정의하는 정보 이론적 프레임워크를 구축함으로써, 스케일링만으로는 완벽한 신뢰성을 달성할 수 있다는 가설에 이의를 제기하며, 이를 통해 훈련 데이터와 모델 용량 사이의 병목 구간을 식별하고 검색 증강 및 파괴적 망각과 같은 현상을 설명하는 통합 스케일링 법칙을 도출한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 이야기를 들려주거나, 수학 문제를 풀게 하거나, 시를 쓰도록 가르치려 한다고 상상해 보십시오. 당신은 그저 로봇에게 더 많은 두뇌(더 많은 컴퓨터 칩)를 주고 더 많은 책(더 많은 데이터)을 먹이면, 결국 모든 것에 완벽해질 것이라고 생각할지도 모릅니다. 이 아이디어는 인공지능의 급격한 성장을 이끌어온 원동력이었습니다. 하지만 만약 숨겨진 천장이 있다면 어떨까요? 만약 로봇이 아무리 똑똑해지더라도 결코 100% 완벽하게 해낼 수 없는 작업들이 존재한다면 어떨까요? 이 논문은 정보 이론(information theory)이라는 과학의 한 분야를 사용하여 이 질문을 파고듭니다. 정보 이론을 메시지에 얼마나 많은 "놀라움(surprise)"이나 "불확실성(uncertainty)"이 담겨 있는지를 연구하는 학문이라고 생각하십시오. 만약 당신이 로봇에게 "2+2는 무엇인가?"라고 묻는다면, 놀라움은 제로입니다. 답은 언제나 4이기 때문입니다. 하지만 만약 "슬픈 구름에 대한 시를 써줘"라고 요청한다면, 단 하나의 정답이 없기 때문에 엄청난 놀라움이 발생합니다. 저자들은 묻고 있습니다. 로봇이 그 놀라움을 실제로 얼마나 해결할 수 있으며, 어디에서 벽에 부딪히게 되는가?
이 논문은 "모델이 커질수록 결국 어떤 작업에서도 완벽한 신뢰성을 달성할 것"이라는 대중적인 믿음이 수학적으로 틀렸다고 주장합니다. 저자들은 모든 작업에는 "신뢰성 천장(reliability ceiling)", 즉 모델이 도달할 수 있는 정확도의 엄격한 한계가 있음을 보여줍니다. 이 한계는 모델의 크기에 관한 것이 아니라, 작업 자체의 본질에 관한 것입니다. 수학 문제의 경우, 천장은 하늘에 있습니다(100% 정확도가 가능합니다). 하지만 창의적인 글쓰기의 경우, 천장은 훨씬 낮습니다. 왜냐하면 '정답'은 로봇이 진정으로 알 수 없는 주관적인 감정과 문화적 맥락에 달려 있기 때문입니다. 이 논문은 당신이 규모를 키우는 것만으로는 이 천장을 넘어설 수 없음을 증명합니다.
나아가, 저자들은 이러한 모델들이 텍밀하게 텍스트를 생성하는 방식—마치 연쇄 반응처럼 단어 하나하나를 생성하는 방식—이 상황을 더 악화시킨다는 것을 발견했습니다. 만약 모델이 초기에 작은 실수를 저지른다면, 그 오류는 눈덩이처럼 불어나 나머지 이야기나 코드를 엉망으로 만들 수 있습니다. 그들은 코딩과 같은 일부 작업이, 벽돌 하나가 빠진다고 해서 전체가 무너지지 않는 튼튼한 벽돌 담장과 같다는 것을 발견했습니다. 반면, 시를 쓰는 것과 같은 다른 작업들은 카드 집(house of cards)과 같아서, 초기의 잘못된 움직임 하나가 전체 구조를 무너뜨릴 수 있습니다.
마지막으로, 이 논문은 모델을 성장시키는 방법에 대한 새로운 규칙을 제시합니다. 단순히 문제에 더 많은 데이터나 더 많은 컴퓨터 전력을 쏟아붓는 대신, 저자들은 성능이 더 희소한 자원에 의해 병목 현상을 일으킨다고 제안합니다. 만약 당신에게 엄청난 양의 데이터가 있지만 아주 작은 뇌를 가지고 있다면, 데이터를 더 추가하는 것은 도움이 되지 않습니다. 만약 거대한 뇌를 가졌지만 데이터가 없다면, 더 많은 두뇌 능력을 추가하는 것도 도움이 되지 않습니다. 당신은 이 둘을 완벽하게 균형 잡아야 합니다. 이 새로운 규칙은 왜 어떤 작업은 규모 확장에 따라 좋아지는 반면 다른 작업은 정체기에 빠지는지를 설명하며, 더 많은 자원을 추가하는 것이 실제로 효과가 있는 때와 시간 낭비일 뿐인 때를 알려주는 수학적 지도를 제공합니다.
보이지 않는 천장
당신이 "다음 단어 맞히기" 게임을 하고 있다고 상상해 보십시오. 때때로 이 게임은 쉽습니다. 문장이 "태양은 동쪽에서..."라면, 다음 단어는 거의 확실하게 "떠오른다"입니다. 미스터리가 없습니다. 하지만 다른 경우에는 뒤틀린 추측 게임이 됩니다. 만약 문장이 "고양이가 ... 위에 앉았다"라면, 다음 단어는 "매트", "러그", "소파" 또는 "바닥"이 될 수 있습니다. 모두 정답이 될 수 있지만, 느낌이 서로 다릅니다.
논문의 저자들은 "동쪽" 시나리오를 **완전 검증 가능한 작업(fully verifiable task)**이라고 부릅니다. 수학 방정식을 풀거나 오류 없이 실행되어야 하는 코드를 작성하는 것과 같은 경우, 답은 질문에 의해 완전히 결정됩니다. 숨겨진 정보가 없습니다. 이러한 작업들의 "신뢰성 천장"은 100%입니다. 완벽한 모델을 가지고 있다면, 완벽한 점수를 얻게 됩니다.
하지만 창의적인 글쓰기나 인생 조언을 주는 것과 같은 **검증 불가능한 작업(unverifiable tasks)**이 있습니다. 여기서 '정답'은 작가의 기분, 독자의 취향, 또는 문화적 순간과 같이 모델이 볼 수 없는 것들에 달려 있습니다. 저자들은 이 누락된 정보를 "잠재적 맥락(latent context)"이라고 부릅니다. 이 맥락은 숨겨져 있고 주관적이기 때문에, 어떤 양의 데이터나 컴퓨터 전력도 모델을 100% 신뢰할 수 있게 만들 수 없습니다. 천장은 더 낮으며, 이는 영구적입니다. 당신은 의견의 문제인 작업에 대해 규모를 키워 완벽함에 도달할 수 없습니다.
논문은 이를 두 가지 유형의 간극으로 나눕니다. 첫 번째는 **해결 가능한 간극(resolvable gap)**입니다. 이는 제공될 수 있는 누락된 정보입니다. 예를 들어, 모델이 특정 인물에 대한 이야기를 쓰고 있는데 그 사람의 이름을 모른다면, 그것은 해결 가능한 간극입니다. 만약 당신이 모델에게 그 이름을 제공한다면(입력에 추가함으로써), 간극은 닫히고 모델은 더 나아집니다. 두 번째는 **주관적 간극(subjective gap)**입니다. 이는 고정된 값을 갖지 않기 때문에 제공될 수 없는 누락된 정보입니다. 만약 작업이 "웃긴" 농담을 쓰는 것이라면, 한 사람에게 웃긴 것이 다른 사람에게는 지루할 수 있습니다. 어떤 양의 추가 데이터도 이 문제를 해결할 수 없습니다. 논문은 이러한 작업들에 대해 모델이 영구적인 불신뢰의 바닥을 갖게 될 것임을 증명합니다.
도미노 효과
이제, 모델이 블록을 하나씩 쌓아 타워를 만들고 있다고 상상해 보십시오. 모델은 첫 번째 블록을 놓고, 그다음 두 번째를 놓고, 그다음 세 번째를 놓습니다. 이것이 대규모 언어 모델이 작동하는 방식입니다; 토큰 단위로 텍스트를 생성합니다. 문제는 모델이 첫 번째 블록을 약간 비뚤게 놓는다면, 두 번째 블록은 비뚤어진 기초 위에 놓여야 한다는 것입니다.
저자들은 이를 **자기회귀적 퇴화(autoregressive degradation)**라고 부릅니다. 이것은 메시지가 속삭임이 전달될 때마다 왜곡되는 "전화기 게임(Telephone game)"과 같습니다. 만약 모델이 문장 초기에 작은 실수를 한다면, 그 실수는 다음 단어를 위한 맥락을 바꾸고, 그 맥것은 그다음 단어의 맥락을 바꿉니다. 오류는 복리로 쌓입니다.
하지만 모든 타워가 똑같이 지어지는 것은 아닙니다. 논문은 **의존성 커널(dependency kernel)**이라는 개념을 도입하는데, 이는 각 단어가 이전 단어들에 얼마나 의존하는지를 설명하는 세련된 방식입니다.
- 밴드 의존성 (벽돌 담장): 코딩이나 수학을 생각해보십시오. 코드 한 줄에서 다음 단어는 보통 바로 앞의 단어에 의존합니다(열린 괄호에 닫는 괄호를 맞추는 것처럼). 만약 실수를 하더라도, 대개 그 작은 영역 안에 국한됩니다. 나머지 코드는 여전히 말이 될 수 있습니다. 여기서의 "의존성 커널"은 벽돌 담장처럼 좁습니다. 한 벽돌의 실수가 전체 벽을 무너뜨리지는 않습니다.
- 밀집 의존성 (카드 집): 시나 창의적인 글쓰기를 생각해보십시오. 시에서 당신이 선택한 단어는 시 전체의 각운(rhyme scheme)을 결정할 수도 있습니다. 만약 초기에 잘못된 단어를 선택한다면, 시 전체의 리듬이나 의미가 깨질 수 있습니다. 여기서의 "의존성 커널"은 카드 집처럼 밀집되어 있습니다. 첫 번째 카드의 실수는 전체 구조를 망칠 수 있습니다.
논문은 밀집된 의존성을 가진 작업의 경우, 텍s가 길어짐에 따라 모델의 성능이 훨씬 더 빠르게 저하된다는 것을 보여줍니다. 단 한 번의 초기 오류가 전체 실패로 이어지는 연쇄 반응을 일으킬 수 있습니다. 이것이 모델이 짧고 논리적인 작업에는 뛰어나지만, 길고 창의적인 작업에는 어려움을 겪는 이유를 설명합니다.
균형 잡기
마지막으로, 논문은 규모 확장(scaling)에 대한 질문을 다룹니다: "우리가 모델을 더 크게 만들고 더 많은 데이터를 준다면, 더 좋아질까?"
대답은 이렇습니다: 당신이 무엇을 더 적게 가지고 있느냐에 달려 있습니다.
저자들은 단순한 수학 방정식 형태의 새로운 "스케일링 법칙(scaling law)"을 도출합니다. 이는 모델의 성능이 더 희소한 자원에 의해 제한된다고 말합니다.
- 만약 당신에게 방대한 양의 데이터가 있지만 아주 작은 모델을 가지고 있다면, 모델이 그 데이터를 다 학습하기에는 너무 작기 때문에 데이터를 더 추가하는 것은 큰 도움이 되지 않습니다.
- 만약 당신에게 거대한 모델이 있지만 데이터가 매우 적다면, 모델에 배울 것이 없기 때문에 파라미터를 더 추가하는 것은 도움이 되지 않습니다.
가장 많은 개선을 얻을 수 있는 최적의 지점은 두 가지를 균형 있게 맞출 때입니다. 이는 연구자들이 이미 알고 있던 "친칠라(Chinchilla)" 법칙과 유사하지만, 이 논문은 그것이 왜 작동하는지를 설명하고 중요한 세부 사항인 max 함수를 추가합니다. 이는 당신이 한 가지를 너무 많이 가지고 있다고 해서 추가 점수를 받지는 못한다는 것을 의미합니다. 만약 당신이 모델이 처리할 수 있는 것보다 100배 많은 데이터를 가지고 있다면, 그 추가 데이터는 쓸모가 없습니다. 당신은 데이터를 모델 크기에 맞춰야 합니다.
이것이 미래에 의미하는 바
이 논문은 우리가 더 나은 모델을 만드는 법만을 알려주는 것이 아니라, 우리가 할 수 없는 것을 알려줍니다. 이는 모든 것에 완벽한 "범용 AI(General AI)"라는 개념이 신화임을 시사합니다. 규모를 키운다고 해서 100% 정확도에 도달할 수 없는 작업들이 존재합니다.
또한 이 논문은 왜 특정 기법들이 효과가 있는지 설명합니다. 예를 들어, 모델이 답변하기 전에 데이터베이스에서 사실을 찾아보는 **검색 증강 생성(RAG, Retrieval-Augmented Generation)**이 효과적인 이유는, 그것이 "해결 가능한 간극"을 채워주기 때문입니다. 그것은 모델이 더 높은 천장에 도달하는 데 필요한 누락된 맥락을 제공합니다. 하지만 주관적인 작업의 경우, RAG조차도 "주관적 간극"을 메울 수는 없습니다.
논문은 또한 **파괴적 망각(catastrophic forgetting)**에 대해 경고합니다. 모델을 새로운 작업에 대해 훈련시킬 때, 기존의 작업을 "잊어버릴" 수 있습니다. 저자들은 이를 자원의 재할당으로 설명합니다. 모델은 제한된 "두뇌 용량 예산"을 가지고 있습니다. 만약 당신이 모델에게 매우 다른 구조(다른 의존성 커널)를 가진 새로운 작업에 집중하도록 강요한다면, 모델은 새로운 공간을 만들기 위해 기존의 구조를 버려야 합니다. 이것은 새로운 언어를 배우는 것과 같습니다. 만약 프랑스어에 너무 집중한다면, 스페인어의 문법 규칙을 잊기 시작할 수 있습니다.
요약하자면, 이 논문은 AI가 모든 문제를 해결할 마법 지팡이가 아니라는 것을 말해줍니다. 그것은 특정한 한계를 가진 도구입니다. 어떤 문제는 충분한 데이터와 연산량으로 해결할 수 있지만, 다른 문제들은 근본적으로 모호합니다. 미래의 핵심은 단순히 "더 크게" 만드는 것이 아니라, 우리가 모델에게 무엇을 요구할지, 그리고 자원을 어떻게 균형 있게 배분할지에 대해 "더 똑똑하게" 접근하는 것입니다. 우리는 불가능한 곳에서 완벽을 기대하는 것을 멈추고, 각 작업의 자연스러운 천장을 존중하는 솔루션을 설계하기 시작해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.