Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
Agon은 두 모델이 서로를 상대로 문제를 초안하고 해결하며 반복적으로 맞서는 과정에서 상호 채점자 역할을 수행함으로써, 프로세스 라벨 없이도 우수한 추론에 암묵적으로 보상하는 경쟁적 교차 모델 강화 학습 프레ك워크를 도입하여 복잡한 추론 작업에서 표준적인 단일 모델 RL 방식보다 현저히 뛰어난 성능을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 학생에게 매우 어려운 수학 문제를 푸는 법을 가르치고 있다고 상상해 보세요.
과거의 방식: "정답만 보는" 코치
현재의 표준 방식(GRPO라고 불림)은 시험의 최종 정답만을 확인하는 코치와 같습니다.
- 만약 학생이 정답을 맞히면, 금메달을 줍니다.
- 만약 틀리면, 빨간색 X표를 줍니다.
- 문제점: 코치는 학생이 어떻게 그 답에 도달했는지는 전혀 보지 않습니다. 만약 학생이 정답을 우연히 맞히기 위해 혼란스러운 횡설수설, 추측, 그리고 시행착오로 가득 찬 10페이지짜리 에세이를 썼더라도, 코치는 여전히 금메달을 줍니다.
- 결과: 학생은 더 나은 사고를 하는 법이 아니라, 더 많은 글자를 쓰는 법을 배우게 됩니다. 그들은 정답을 맞힐 확률을 높이기 위해 "음, 생각해보자...", "잠깐, 아마도..." 같은 문구들로 페이지를 채우기 시작합니다. 그들은 말이 많아질 뿐, 반드시 똑똑해지는 것은 아닙니다.
새로운 방식: 아곤 (Agon, "토론 클럽")
이 논문은 아곤(Agon)(그리스어로 '경쟁'을 의미)이라는 새로운 방법을 소개합니다. 한 명의 학생이 혼자 문제를 푸는 대신, 아곤은 두 명의 학생을 한 방에 넣어 같은 문제를 함께 풀게 하되, 서로를 능가하기 위해 경쟁한다는 반전이 있습니다.
이 "아곤" 게임의 작동 방식은 다음과 같습니다:
- 초안 작성 (The Draft): 학생 A가 먼저 문제를 풀려고 시도합니다. 그들은 자신의 추론 과정과 단계별 요약을 작성합니다 (단, 최종 정답은 숨깁니다).
- 도전 (The Challenge): 학생 B가 학생 A의 요약본을 읽습니다. 학생 B의 목표는 학생 A보다 더 잘 문제를 푸는 것입니다.
- 만약 학생 A가 실수(예: 방정식의 부호 오류)를 했다면, 학생 B는 이를 찾아내어 수정하고 정답을 맞힙니다. 학생 B가 승리합니다.
- 만약 학생 A가 맞았다면, 학생 B는 그것을 증명할 수 있는 더 짧고 깔끔한 방법을 찾으려 노력합니다.
- 역할 교대 (The Switch): 다음 라운드에서 그들은 역할을 바꿉니다. 이제 학생 B가 초안을 작성하고, 학생 A가 도전합니다.
왜 이것이 효과적인가 ( "라이벌 채점"의 마법)
과거의 방식에서 학생은 "좋은 사고"가 무엇인지 알려주는 사람이 없었기 때문에 스스로 그것을 추측해야 했습니다. 하지만 아곤에서는 라이벌이 채점을 합니다.
- 암묵적 피드백 (Implicit Feedback): 만약 학생 A의 추론에 구멍이 많다면, 학생 B는 쉽게 그를 이길 것입니다. 이는 학생 A에게 "횡설수설"이나 "미사여구"가 통하지 않는다는 것을 가르쳐 줍니다. 왜냐하면 똑똑한 라이벌은 반드시 그들을 잡아낼 것이기 때문입니다.
- 라벨이 필요 없음: 인간 교사가 "이 단계는 훌륭했다"라거나 "이 단계는 불필요했다"라고 말해줄 필요가 없습니다. 한 학생이 다른 학생을 이겼다는 사실 자체가 그 추론이 더 훌륭하다는 증거가 됩니다.
- "군비 경쟁" (The Arms Race): 두 학생이 동시에 똑똑해지기 때문에, 기준선은 계속 높아집니다. 학생 A는 더 이상 단순히 운 좋게 맞히는 식의 추측을 할 수 없습니다. 학생 B 역시 점점 똑똑해지고 있기 때문에, 학생 A는 실제로 잘 추론해야만 그를 이길 수 있습니다.
결과
연구진은 매우 어려운 수학 문제들(Qwen3라는 모델 사용)을 대상으로 테스트를 진행했습니다.
- 표준 방식: 모델은 어려운 문제의 약 30%를 맞혔지만, 매우 길고 방대한 설명을 작성했습니다.
- 아곤 방식: 경쟁하는 두 모델은 문제의 약 **61%**를 맞혔습니다.
- 보너스: 설명은 오히려 더 짧아졌습니다. 모델들이 효율적이고 정확해지기 위해 경쟁했기 때문에, 불필요한 군더더기를 쓰는 것을 멈추게 된 것입니다.
"2단계" 트릭
이 시스템이 실제로 사용자 문제를 해결할 때 작동하는 방식은 계주 경기와 같습니다:
- 모델 A가 초안 솔루션을 작성합니다.
- 모델 B가 그 초안을 읽고, 오류를 점검한 뒤, 최종 답안을 작성합니다.
이 과정은 자동으로 이루어집니다. 논문은 두 모델을 이렇게 서로 싸우도록 훈련시키는 것이, 두 모델이 서로 협력하거나 한 모델이 자신의 실수를 스스로 고치도록 하는 것보다 훨씬 더 효과적임을 보여줍니다.
요약하자면
아곤은 AI 모델이 운 좋게 정답을 맞히기 위해 "재잘거리는" 것을 막습니다. 대신, 자신의 실수를 끊임없이 찾아내는 라이벌을 배치함으로써 모델이 예리하고, 간결하며, 정확해지도록 강제합니다. 이는 훈련 과정을 단순한 개인 연습 세션에서, 명확하게 생각하는 것만이 유일한 승리 방법인 고도의 심리전이 담긴 토론으로 변화시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.