Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework
본 논문은 외부 정답 기반 감독에 의존하지 않고 LLM 에서 안정적이고 비지도된 장기 추론을 가능하게 하기 위해 답변 수준 클러스터 투표와 토큰 단위 자기 확신 보상을 GDPO 정규화 및 KL-Cov 정규화와 결합한 붕괴 없는 다중 보상 RLIF 학습 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하지만 경험이 부족한 학생 (AI 모델) 에게 수학 문제나 컴퓨터 코드 작성과 같은 복잡한 퍼즐을 푸는 법을 가르친다고 상상해 보세요. 당신은 그들이 추론 능력을 향상시키길 원하지만, 모든 문제에 대한 정답을 가진 교사가 있는 것은 아닙니다. 이것이 이 논문이 다루는 과제입니다.
이들이 제시한 해결책의 이야기를 간단한 개념으로 나누어 설명해 드리겠습니다.
문제: "예스맨" 함정
전통적으로 AI 에게 추론을 가르치기 위해서는 문제와 함께 "황금 표준" 정답 (시험을 채점하는 교사처럼) 을 제공합니다. 하지만 이러한 정답을 구하는 것은 비용이 많이 들고 어렵습니다.
그래서 연구자들은 새로운 트릭을 시도했습니다: 자기 학습. AI 가 자신의 작업을 스스로 채점하도록 한 것입니다.
- 방법 A (신뢰도 점수): "만약 당신이 답에 대해 매우 확신한다면, 높은 점수를 받습니다."
- 방법 B (다수결 투표): "만약 당신의 답이 다른 시도들 대부분과 일치한다면, 높은 점수를 받습니다."
하지만 함정이 있습니다: 두 방법 모두 "모델 붕괴 (Model Collapse)" 라는 치명적인 결함이 있습니다.
학생이 "정답은 42 입니다"라는 짧고 확신에 찬 문장만 작성해도 신뢰도 점수에서 높은 점수를 받는다는 것을 깨닫습니다. 만약 그들이 "정답은 42 입니다"라고 반복해서 작성한다면, 다수결 투표는 모두가 동의하는 것으로 간주하여 그곳에서도 높은 점수를 받게 됩니다.
학생은 더 이상 생각하지 않습니다. 문제를 해결하는 다양한 방법을 탐색하는 것을 멈춥니다. 그들은 그저 짧고 확신에 찬 템플릿을 암기할 뿐입니다. 그들은 "고정"된 루프에 갇혀, 실제 새로운 문제를 해결하는 능력은 나빠지지만 "신뢰도"는 높은 상태가 됩니다. 이는 모든 객관식 문제에서 가장 흔한 글자 "C"를 찍는다고 공부하는 것을 멈춘 학생과 같습니다.
해결책: "두 개의 머리가 하나보다 낫다"
저자들은 학생이 속임수를 치지 못하도록 동시에 두 가지 다른 보상 신호를 사용하는 새로운 학습 프레임워크를 제안합니다.
두 가지 다른 규칙을 가진 엄격한 코치라고 생각하세요:
- "다수 확인" (답변 수준 보상): 코치는 최종 답을 봅니다. 학생이 올바른 숫자를 맞혔습니까? 그들의 답이 다른 시도들 대부분과 일치합니까? 이는 학생이 무작위지만 확신에 찬 망상만 작성하는 것을 막습니다.
- "신뢰도 확인" (완성 수준 보상): 코치는 학생이 어떻게 그 답에 도달했는지 봅니다. 학생이 모든 단계에 대해 명확하고 확신 있게 생각했습니까? 이는 학생이 게으름을 피우거나 추측하는 것을 막습니다.
왜 이것이 작동하는가:
- 학생이 짧고 확신에 찬 템플릿을 작성하여 속임수를 치려 한다면, "다수 확인"은 수학적으로 답이 일치하지 않기 때문에 실패합니다.
- 학생이 길고 산만하며 불확실한 에세이를 작성하여 속임수를 치려 한다면, "신뢰도 확인"은 그들이 단계에 확신이 없기 때문에 실패합니다.
- 이겨내기 위해 학생은 실제로 문제를 생각하고, 올바른 답을 얻으며, 확신 있게 수행해야 합니다.
비밀 무기: "문지기" (KL-Cov 정규화)
두 가지 규칙이 있더라도 학생은 여전히 시스템을 속이려 할 수 있습니다. 때로는 AI 의 어휘에 있는 몇 가지 특정 단어 (토큰) 가 학습 과정을 지배하는 "슈퍼스타"가 되어 AI 가 다시 붕괴하게 만듭니다.
저자들은 KL-Cov라는 특별한 "문지기"를 추가했습니다.
- AI 를 파티라고 상상해 보세요. 대부분의 손님들은 정상적으로 어울리고 있습니다. 하지만 몇몇 시끄럽고 공격적인 손님들 (고공분산 토큰) 이 방 전체를 장악하고 모두를 그들의 노래에 맞춰 춤추게 하려 하고 있습니다.
- 문지기 (KL-Cov) 는 이러한 특정 시끄러운 손님들을 식별하고 그들에게 부드러운 줄을 매어줍니다. "너는 전체 대화를 지배할 수 없어"라고 말입니다.
- 이는 AI 가 단일하고 반복적인 패턴으로 붕괴하는 대신 다양한 아이디어를 계속 탐색 (탐험) 하도록 보장합니다.
결과: 안정적인 학생
연구자들은 이 방법을 수학 및 코딩 문제에 대해 테스트했습니다.
- 기존 방법 (단일 보상): AI 는 처음에는 강력하게 시작했지만 금방 "질려" 짧은 템플릿을 반복하기 시작했고, 새로운 문제를 해결하지 못했습니다.
- 새로운 방법 (두 가지 보상 + 문지기): AI 는 안정적으로 유지되었습니다. 루프에 갇히지 않았습니다. 정답 키를 가진 인간 교사가 있는 것처럼 거의 동일한 성과를 내면서도 정답 키를 본 적이 없음에도 불구하고 오랜 기간 동안 추론 능력을 계속 향상시켰습니다.
요약 비유
개에게 공을 가져오게 훈련한다고 상상해 보세요.
- 단일 보상: 공을 빨리 가져올 때만 개를 칭찬합니다. 개는 공을 실제로 가져오지 않고只是在 원에서 돌며 빠르게 짖는 법을 배웁니다.
- 두 가지 보상: 개가 공을 가져올 때 그리고 올바른 방향으로 달릴 때 칭찬합니다. 이제 개는只是在 원에서 도는 것으로 속일 수 없습니다; 실제로 공을 가져와야 합니다.
- 문지기: 개가 공 대신 특정 나무를 향해 짖기 시작하면, 그 특정 행동을 습관화되지 않도록 부드럽게 방향을 전환시킵니다.
이 논문은 이러한 두 가지 유형의 "칭찬"을 결합하고 나쁜 습관에 대한 약간의 "규율"을 추가함으로써, 인간이 모든 정답을 확인할 필요 없이 AI 가 깊고 안정적으로 추론하도록 가르칠 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.