Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study
본 연구는 RL로 훈련된 Lean 정리 증명기가 추론 시 모드 붕괴를 겪음을 밝히며, 이는 다양한 전술 골격에 대한 고정된 일정을 적용하여 상당한 성능 향상을 회복함으로써 효과적으로 완화될 수 있는 반면, 프롬프트 재작성과 관련 없는 주장은 비효과적이거나 해로움임이 입증되었다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
어떤 천재 학생이 Lean 이라는 특수한 컴퓨터 언어를 사용하여 매우 어려운 수학 퍼즐을 풀도록 훈련받았다고 상상해 보세요. 이 학생을 'DeepSeek'이라고 부르겠습니다. 이 학생은 지극히 영리하지만, 이상한 버릇이 하나 있습니다. 퍼즐을 풀라고 요청하면 정신적으로 고착되는 습관이 있다는 것입니다.
이 논문은 왜 이런 일이 발생하는지, 그리고 어떻게 해결할 수 있는지에 대한 진단 보고서입니다. 여기 연구자들이 발견한 내용을 일상적인 용어로 풀어낸 이야기가 있습니다.
1. 문제: '부서진 레코드' 효과
연구자들은 DeepSeek 에게 같은 수학 퍼즐을 반복해서 풀도록 요청했을 때 (단, 주사위를 굴리는 것과 같은 약간 다른 무작위 시드를 사용하여), 이 학생이 정확히 같은 첫 번째 단계를 계속 시도하는 것을 발견했습니다.
- 비유: 잠긴 문을 열려고 한다고 상상해 보세요. 자물쇠에 열쇠를 꽂아 봅니다. 작동하지 않습니다. 다시 시도해 봅니다. 여전히 작동하지 않습니다. 세 번째 시도, 그리고 백 번째 시도까지 해 봅니다. 64 번을 시도하더라도, 당신은 여전히 같은 자물쇠에 같은 방식으로 같은 열쇠를 끼워 넣는 것뿐입니다. 다른 열쇠나 문을 여는 다른 방법을 탐색하지 않는 것입니다.
- 결과: 연구에서 시도 횟수를 32 회에서 64 회로 두 배로 늘렸음에도 불구하고, 단 하나의 새로운 퍼즐도 해결되지 않았습니다. 학생은 '모델 붕괴 (mode collapsed)' 상태에 빠졌습니다. 그들은 좁은 길에 갇혀 다른 생각을 할 수 없게 된 것입니다.
2. 해결책: '첫 번째 단계' 힌트 제공
연구자들은 이 학생이 게으른 것이 아니라, 단지 자신의 루틴에 너무 깊이 빠져 있었음을 깨달았습니다. 그래서 그들은 새로운 방법을 시도했습니다. 학생에게 퍼즐을 풀도록 요청하기 전에, 어떻게 시작할지에 대한 구체적인 지시를 준 것입니다.
- 비유: 단순히 "이 퍼즐을 풀어라"라고 말하는 대신, 연구자들은 "숫자를 단순화하는 것부터 시작하라"거나 "새로운 변수를 도입하는 것부터 시작하라"고 말했습니다. 마치 학생이 추측하게 내버려 두는 대신, 먼저 시도해 볼 구체적인 열쇠를 주는 것과 같습니다.
- 결과: 이 간단한 자극이 고착 상태를 깨뜨렸습니다. 학생은 갑자기 훨씬 더 많은 퍼즐을 풀기 시작했습니다. 이 '고착'은 학생이 수학이 서툴렀기 때문이 아니라, 시작하는 방식이 너무 경직되어 있었기 때문입니다.
3. '이유': 뇌의 문제가 아닌 훈련의 문제
연구자들은 궁금해했습니다. 이 학생은 본래 수학이 서툴러서 그런가, 아니면 훈련이 그들을 경직시켰을까요?
- 실험: 그들은 특수 수학 훈련 (기초 모델) 을 받기 전의 학생을 테스트했습니다.
- 발견: 훈련받지 않은 학생은 퍼즐을 단 하나도 풀지 못했습니다. 그냥 포기하거나 질문을 반복했을 뿐입니다.
- 결론: 특수 훈련 (강화 학습) 이 바로 학생에게 퍼즐을 푸는 법을 처음부터 가르친 것입니다. 하지만, 그 동일한 훈련이 그들을 경직시키고 고착되게 만든 원인이기도 합니다. 훈련은 기술을 길러냈지만, 동시에 '부서진 레코드' 문제를 만들어낸 것입니다.
4. 누가 이 문제를 겪고 있는가?
연구자들은 이것이 보편적인 문제인지 확인하기 위해 다른 '학생들' (서로 다른 AI 모델) 을 테스트했습니다.
- 'SFT' 학생: 한 학생은 다르게 훈련받았습니다 (지도 미세 조정). 이 학생은 전반적으로 퍼즐을 푸는 데 실제로 더 뛰어났지만, '고착' 문제는 겪지 않았습니다. 연구자들이 힌트를 주었을 때, 오히려 그 학생은 약간 나빠졌습니다. 그들은 이미 스스로 길을 찾을 만큼 유연했기 때문입니다.
- 'RL' 학생들: 특수한 '강화 학습' 방법으로 훈련받은 학생들 (DeepSeek 와 같은) 이 갇히는 문제를 겪었습니다. 그들은 좁은 사고에서 벗어나기 위해 '첫 번째 단계' 힌트가 필요했습니다.
5. '첫 번째 수' 증거
이것이 단순한 우연이 아님을 증명하기 위해, 연구자들은 학생들이 실제로 취한 '첫 번째 수'들을 살펴보았습니다.
- 발견: 단일 퍼즐에 대한 64 번의 시도 중, '고착된' 학생은 거의 절반의 경우에서 정확히 같은 첫 번째 수를 사용했습니다. 그들은 놀라울 정도로 예측 가능했습니다.
- 비유: 만약 인간에게 64 번 이야기를 쓰게 한다면, 그들은 "옛날 옛적에", "해가 빛나고 있었을 때", 또는 "어두운 밤이었다" 등으로 시작할 수 있습니다. 하지만 이 AI 학생은 32 번은 "옛날 옛적에"로, 30 번은 "해가 빛나고 있었을 때"로 시작했습니다. 그들의 서두에는 거의 다양성이 없었습니다.
요약
이 논문은 강화 학습 (AI 를 훈련시키는 특정 방식) 이 양날의 검을 만든다고 결론 내립니다.
- 그것은 AI 가 이전에 할 수 없었던 형식적인 수학 증명을 푸는 법을 가르칩니다.
- 하지만 동시에 AI 를 몇 가지 '승리' 전략에 너무 집중하게 만들어 새로운 전략을 탐색하는 것을 멈추게 합니다.
해결책은 AI 에게 더 많은 컴퓨팅 파워를 주거나 더 많은 생각 시간을 주는 것이 아닙니다. 대신 구조적 지침—증명을 어떻게 시작할지에 대한 간단한 자극—을 주는 것입니다. 이는 AI 가 자신의 루틴을 깨고 새로운 경로를 탐색하도록 강요하여, 이전에는 너무 고집스러워 찾지 못했던 해결책을 열어줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.