A Pre-Training Analogue of Grokking in Language Models: Tracing Delayed Grammatical Generalization
본 논문은 BLiMP 최소 쌍(minimal pairs)을 사용하여 LLM 사전 학습 중 발생하는 그로킹(grokking) 유사 역학을 연구하기 위한 노출 기반 프레임워크를 제안하며, 모델이 더 예측력이 높고 고차원적인 문법 개념 벡터 및 집중된 어텐션 패턴의 출현과 함께 지연된 문법적 일반화를 보인다는 점을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
아이에게 거대한 도서관의 책들을 읽어주며 말을 가르치고 있다고 상상해 보세요. 하지만 당신은 아이에게 퀴즈를 내거나 시험을 치르게 하지 않고, 그저 계속 읽어주기만 합니다. 이 논문이 던지는 핵심 질문은 이것입니다: 아이가 들었던 특정 문장들을 암기한 지 한참이 지난 후에야, 갑자기 "깨달음"을 얻게 되는가?
AI 연구 분야에서, 이러한 갑작스러운 "아하!(aha!)" 모먼트를 **그로킹(Grokking)**이라고 부릅니다. 보통 과학자들은 컴퓨터에게 특정 수학 퍼즐을 학습시키고, 컴퓨터가 정답을 암기하게 만든 다음, 나중에 새로운 퍼즐을 풀 수 있는지 관찰하는 방식으로 이를 연구합니다. 하지만 현대의 AI(대규모 언 언어 모델, LLM)는 그런 방식으로 작동하지 않습니다. 이들은 문장에서 다음에 올 단어를 예측하는 과정을 통해 인터넷 전체(또는 인터넷의 아주 큰 부분)를 학습합니다. 학습 과정 중에 내장된 "테스트"나 "퀴즈"는 없습니다.
그렇다면, 테스트를 치르지 않으면서 어떻게 "그로킹"의 순간을 포착할 수 있을까요? 이 논문의 저자들은 영리한 트릭을 고안해 냈습니다.
"플래시카드" 비유
AI를 도서관을 읽는 학생이라고 상상해 보세요. 이 학생이 정말로 문법을 배우고 있는 것인지, 아니면 단순히 암기하고 있는 것인지 확인하기 위해, 연구진은 특별한 "플래시카드"(논문에서는 BLiMP라고 부름) 세트를 만들었습니다. 각 플래시카드에는 두 문장이 들어 있습니다:
- 옳은 문장: "The cat sleeps." (고양이가 잠을 잔다.)
- 틀린 문장: "The cat sleep." (고양이가 잠을...)
차이는 아주 미미합니다(단 한 단어의 차이). 하지만 이는 특정 문법 규칙(예: 주어-동사 일치)을 테스트합니다.
트릭:
연구진은 AI가 학습하는 동안 읽었던 방대한 텍스트 라이브러리를 살펴보았습니다. 그리고 물었습니다: "AI가 이전에 'The cat sleeps'라는 정확한 구절을 읽은 적이 있는가?"
- "본 적 있는" 그룹 (Proxy-Train): 만약 AI가 라이브러리에서 그 정확한 구절을 읽은 적이 있다면, 이를 "본 적 있는(Seen)" 더미에 넣었습니다.
- "본 적 없는" 그룹 (Proxy-Validation): 만약 AI가 이전에 그 정확한 구절을 한 번도 읽은 적이 없다면, 이를 "본 적 없는(Unseen)" 더미에 넣었습니다.
결정적인 점은, AI가 문법이라는 규칙은 배웠을지 몰라도, 이 특정한 문장은 아직 본 적이 없을 수도 있다는 것입니다.
발견한 내용: "지연된" 순간
연구진은 AI의 성능이 시간이 지남에 따라 어떻게 변하는지 관찰했습니다(마치 학생이 매일 시험을 치르는 것을 지켜보는 것처럼 말이죠). 결과는 다음과 같았습니다:
- 먼저, "본 적 있는" 그룹의 점수가 좋아졌습니다. AI는 라이브러리에서 실제로 읽었던 문장들에 대해 빠르게 높은 점수를 기록했습니다. 이는 단순히 자신이 본 것을 기억해 내는 과정이었습니다.
- 그다음, 정체기가 왔습니다. AI는 "본 적 있는" 문장들에 대해서는 계속해서 나아졌지만, "본 적 없는" 문장들에 대해서는 여전히 형편없는 성적을 보였습니다. 마치 막혀 있는 것처럼 보였습니다.
- 마침로, "그로킹"의 순간이 왔습니다. 갑자기 "본 적 없는" 문장들에 대한 AI의 점수가 급상승했습니다. AI가 단순히 특정 단어를 외우는 것이 아니라, 문장 뒤에 숨겨진 규칙을 깨달은 것입니다.
"본 적 있는" 문장에 익숙해진 시점과 "본 적 없는" 문장을 해결하게 된 시점 사이의 이 간극이 바로 **지연된 일반화(Delayed Generalization)**입니다. 이는 마치 어떤 학생이 자신이 완벽하게 외운 시는 잘 읊조리지만, 그 시와 같은 운율을 가진 새로운 시를 쓰기까지는 몇 주가 걸려 마침내 개념이 머릿속에 들어올 때까지 기다려야 하는 것과 같습니다.
AI의 뇌 내부에서는 무슨 일이 일어날까?
논문은 단순히 점수만을 관찰한 것이 아니라, 이 "아하!" 모먼트가 일어날 때 AI의 "뇌"(내부 수학 구조) 내부에서 무엇이 변하는지 들여다보았습니다. 그들은 두 가지 흥미로운 사실을 발견했습니다:
1. "문법 지도"가 더 복잡해졌습니다.
AI의 문법 이해를 하나의 '지도'라고 상상해 보세요. "아하!" 모먼트 이전에는 이 지도가 단순하고 평평한 선 하나와 같았습니다. 하지만 AI가 마침내 규칙을 이해한 후에는, 지도는 훨씬 더 많은 차원을 가진 3D 구조가 되었습니다. AI는 단순히 하나의 단순한 기술을 사용하는 것이 아니라, 문법을 이해하기 위해 풍부하고 복잡한 연결망을 사용하고 있었습니다.
2. "스포트라이트"가 집중되었습니다.
AI는 문장에서 어떤 단어가 중요한지 결정하기 위해 "주의(attention)"라고 불리는 메커니즘을 사용합니다. "아하!" 모먼트 이전에는 AI의 주의력이 너무 넓은 빛을 내뿜는 손전등처럼 다소 분산되어 있었습니다. 하지만 AI가 규칙을 배운 후에는, 손전등 빛이 매우 날카롭고 집중되어 중요한 단어들(예를 들어 "The cat"과 "sleeps"를 연결하는 것)에 초점을 맞추게 되었습니다. 이러한 집중 현상은 AI의 뇌 전체가 아니라 몇몇 특정 부분에서 일어났습니다.
결론
이 논문은 거대하고 무질서한 텍st 더미를 가지고 테스트 없이 학습하더라도, AI가 여전히 먼저 암기하고 나중에 이해하는 단계를 거친다는 것을 증명합니다.
연구진은 AI가 이전에 정확한 단어를 본 적이 있는지 확인하는 방식으로 이를 측정하는 새로운 방법을 만들어 냈습니다. 그들은 AI가 "본 적 있는" 단어들은 빠르게 익히지만, "본 적 없는" 퍼즐을 해결하는 "이해" 단계까지는 시간이 걸린다는 것을 발견했습니다. 그리고 그 격차가 메워질 때, AI가 문법을 생각하는 내부 방식은 더욱 복잡해지고 집중됩니다.
요약하자면: AI는 단순히 기계적으로 암기하는 것이 아닙니다. AI는 점들이 마침내 연결되는 '지연된 명료함의 순간'을 경험하며, 우리는 이제 그 순간이 정확히 언제, 어떻게 일어나는지 볼 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.