Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
이 논문은 제안 모델이 reward 함수에 맞춰 문제 생성의 다양성이 급격히 감소하는 '다양성 붕괴' 문제를 해결하기 위해, 제안자의 출력 로짓에 무작위 마스크를 적용하는 '어휘 드롭아웃' 기법을 도입하여 자기 대결 기반의 커리큘럼 학습을 안정화하고 솔버의 성능을 유의미하게 향상시켰음을 보여줍니다.
이 연구는 두 명의 AI 가 서로 역할을 나누어 학습하는 공진화 (Co-evolution) 시스템을 다룹니다.
선생님 AI (Proposer): 학생이 풀 수 있는 문제를 만들어냅니다.
학생 AI (Solver): 그 문제를 풀어 능력을 키웁니다.
📉 문제: "지루한 수업의 함정" 보통 이 시스템은 처음엔 잘 작동합니다. 선생님이 문제를 내고, 학생이 풀면서 실력이 늘죠. 하지만 시간이 지나면 선생님 AI 가 이상한 행동을 합니다.
현상: 선생님 AI 는 "학생이 틀릴 만한 문제"를 내야 점수를 받습니다. 그래서 아주 똑똑한 선생님이 될수록, 학생이 틀리기 쉬운 아주 단순한 '공식'이나 '패턴'만 반복해서 내기 시작합니다.
결과: 문제는 계속 바뀌는 것처럼 보이지만 (표면적으로는 다름), 실제로는 같은 유형의 문제만 반복됩니다. 학생은 이 지루한 반복 수업에서 더 이상 배우는 게 없어지고, 실력이 멈춥니다. 이를 논문에서는 **'다양성 붕괴 (Diversity Collapse)'**라고 부릅니다.
💡 해결책: "단어 지우기 게임 (Vocabulary Dropout)"
저자들은 이 문제를 해결하기 위해 게임 이론에서 영감을 얻은 **'어휘 드롭아웃 (Vocabulary Dropout)'**이라는 기법을 도입했습니다.
🎲 비유: "주사위를 굴려서 내는 문제" 기존의 선생님 AI 는 마음대로 문제를 만들 수 있었습니다. 하지만 이 새로운 방법에서는 매 수업마다 '금지된 단어'를 무작위로 정해버립니다.
규칙: "오늘 수업에서는 '사과', '10', '더하기' 같은 단어는 절대 쓸 수 없어!"라고 정해버리는 거죠.
효과: 선생님 AI 는 금지된 단어를 쓰지 않으려면 반드시 새로운 방식, 새로운 표현, 새로운 문제 구조를 찾아야 합니다.
마치 "사과"라는 단어를 못 쓰게 하면, "과일"이나 "빨간 과일" 같은 다른 표현을 찾아야 하듯, AI 는 강제적으로 창의적인 사고를 하게 됩니다.
핵심: 이 '금지된 단어'는 매번 바뀌기 때문에, AI 는 어떤 고정된 패턴에 갇히지 않고 계속 새로운 영역을 탐색하게 됩니다.
🚀 결과: 더 똑똑한 학생이 탄생하다
이 방법을 적용한 실험 결과는 매우 놀라웠습니다.
선생님의 다양성 유지: 선생님 AI 가 만든 문제들이 표면적인 단어뿐만 아니라, 문제의 의미와 구조에서도 훨씬 다양해졌습니다.
학생의 실력 향상: 이 풍부한 (다양한) 문제들을 풀면서 학생 AI 의 실력이 크게 늘었습니다. 특히 수학 경시대회 (AMC, 올림피아드 등) 같은 어려운 문제에서 평균 4.4 점이나 점수가 올랐습니다.
🔑 핵심 교훈 게임 (바둑, 스타크래프트 등) 에서는 **규칙 (룰)**이 플레이어가 다양한 전략을 쓰게 만듭니다. 하지만 언어 모델은 규칙이 없어서 쉽게 지루한 패턴에 빠집니다. 이 논문은 **"단어 사용에 인위적인 규칙 (금지) 을 걸어주면, AI 가 스스로 창의성을 발휘하며 더 잘 학습한다"**는 것을 증명했습니다.
📝 한 줄 요약
"AI 선생님에게 '오늘은 이 단어는 못 써'라고 무작위로 규칙을 주면, AI 는 지루한 반복을 멈추고 더 다양한 문제를 만들어내며, 학생 AI 는 그 덕분에 훨씬 똑똑해집니다."
이 방법은 별도의 복잡한 시스템 없이, 단순히 단어 선택을 제한하는 것만으로 AI 의 학습 효율을 극대화할 수 있음을 보여줍니다.
1. 문제 정의: 다양성 붕괴 (Diversity Collapse)
배경: LLM 의 공진화 학습 (한 모델이 문제를 생성하고 다른 모델이 이를 해결하는 방식) 은 인간의 감독 없이 자율적인 커리큘럼 학습을 가능하게 합니다.
현상: 실제로는 제안자 (Proposer) 모델이 보상 함수를 만족하는 매우 좁은 범위의 문제 템플릿으로 빠르게 수렴합니다.
원인: 게임 환경과 달리 자연어 문제는 외부 규칙이나 명확한 정답 검증이 어렵습니다. 제안자는 문제를 '왜' 어렵게 만드는지 이해하지 못한 채, 해결자 (Solver) 가 틀리기 쉬운 특정 패턴의 질문만 반복 생성하여 보상을 극대화합니다.
결과: 커리큘럼의 다양성이 사라지고 학습 신호가 약화되어 공진화 루프가 멈추게 됩니다. 기존 연구들은 보상 설계나 외부 신호에 의존했으나, 이는 제안자의 출력 공간 (Action Space) 자체를 제어하지 못했습니다.
2. 방법론: 어휘 드롭아웃 (Vocabulary Dropout, VD)
저자들은 게임의 규칙이 플레이어의 행동을 제한하여 전략적 다양성을 유지하는 것과 유사하게, 언어 생성에서도 출력 공간에 대한 구조적 제약이 필요하다고 가정하고 VD 를 도입했습니다.
핵심 메커니즘:
제안자 모델의 출력 로짓 (Logits) 에 하드 마스크 (Hard Mask) 를 적용합니다.
각 배치 (Batch) 마다 어휘의 무작위 부분 집합을 마스킹하여 해당 토큰의 생성 확률을 0 으로 만듭니다.
비정상성 (Non-stationarity): 마스크는 매 배치마다 변경되므로, 제안자가 고정된 토큰 시퀀스에 수렴하는 것을 방지합니다.
보호 토큰: 포맷에 필수적인 토큰 (예: <question>, \boxed{} 등) 은 마스킹에서 제외됩니다.
적용 단계: 제안자의 GRPO(Group Relative Policy Optimization) 학습 단계와 커리큘럼 생성 단계 모두에 적용됩니다.
효과: 제안자는 매번 다른 토큰 집합에서 선택해야 하므로, 더 넓은 어휘를 활용하게 되고 결과적으로 의미적, 기능적 다양성이 유지됩니다.
3. 주요 기여 (Contributions)
실증적 분석: 공진화 반복 과정에서 제안자의 다양성 동역학을 상세히 분석했습니다. 기존 어휘적 지표 (Lexical metrics) 는 다양성 붕괴를 감지하지 못하지만, 기능적 지표 (Functional metrics) 를 통해 초기 단계에서 붕괴가 발생함을 발견했습니다.
어휘 드롭아웃 제안: 제안자의 행동 공간에 직접적인 제약을 가하는 간단하면서도 강력한 메커니즘을 제시했습니다. 이는 보상 설계가 아닌 출력 공간 제어를 통해 다양성을 유지합니다.
성능 향상 입증: 유지된 다양성이 실제 해결자 모델의 성능 향상으로 이어짐을 증명했습니다. 특히 경쟁 수준의 수학 문제 (AMC, Olympiad, AIME) 에서 큰 개선을 보였습니다.
4. 실험 결과
실험 설정: Qwen3-4B 와 Qwen3-8B 모델을 기반으로 R-Zero 프레임워크를 사용하여 수학 추론 능력을 학습시켰습니다.
해결자 (Solver) 성능:
8B 모델: VD(α=0.75, 어휘 75% 유지) 적용 시 평균 +4.4 점의 성능 향상을 기록했습니다. 특히 AMC, AIME 등 고난도 벤치마크에서 가장 큰 개선을 보였습니다.
4B 모델: 과도한 마스킹 (VD75) 은 성능을 저하시켰으나, 적절한 마스킹 (VD85) 은 베이스라인보다 우수한 성능을 보였습니다. 이는 모델의 용량 (Capacity) 에 맞는 마스킹 강도 조절이 필요함을 시사합니다.
다양성 지표:
어휘적 다양성: Self-BLEU 점수가 약 2 배 감소 (반복 감소).
의미적 다양성: Vendi Score(유효한 질문 유형 수) 가 약 15 개 증가.
기능적 다양성: Epiplexity(학습 가능한 정보량) 가 약 35% 증가.
구조적 변화: VD 를 적용한 모델은 더 긴 질문과 더 많은 고유 숫자/토큰을 사용했습니다.
한계 및 통찰:
다양성만 높인다고 해서 항상 성능이 향상되는 것은 아닙니다. 4B 모델에서 과도한 마스킹 (VD75) 은 일관성 없는 문제를 생성하여 학습 신호를 해쳤습니다.
제안자와 해결자의 모델 크기가 불균형할 때 (예: 8B 제안자 → 4B 해결자) VD 는 오히려 성능을 저하시켰습니다. 이는 두 모델의 용량이 일치할 때 가장 효과적임을 의미합니다.
5. 의의 및 결론
게임 규칙의 언어적 대응: 게임에서 규칙이 플레이어의 행동을 제한하여 전략적 깊이를 만든다면, 언어 모델의 공진화에서도 어휘 드롭아웃과 같은 출력 공간의 제약이 필수적임을 증명했습니다.
보상 설계의 한계 극복: 보상 함수의 다양성 페널티만으로는 기능적 정체 (Functional Stagnation) 를 막을 수 없으며, 행동 공간 (Action Space) 자체를 제어해야 함을 보여줍니다.
간결한 해결책: 추가적인 보조 모델이나 복잡한 보상 설계 없이, 단순한 비정상적 마스크만으로도 지속 가능한 커리큘럼 학습과 모델 성능 향상을 이끌어낼 수 있음을 입증했습니다.
이 연구는 LLM 의 자율적 진화 (Self-evolution) 시스템이 다양성 붕괴 없이 지속적으로 발전하기 위해서는 구조적 제약 (Structural Constraints) 이 필수적이라는 중요한 통찰을 제공합니다.