Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation
이 논문은 프런티어 AI 모델들을 실행 기반 검증을 통해 순위를 매기고 이를 통해 공동으로 커리큘럼을 구축하는 '경쟁 후 협력(compete-then-collaborate)' 프레임워크를 소개하며, 이 프레임워크가 검증 가능한 보상을 활용한 강화 학습에 사용될 경우 코딩 학습자의 어려운 문제 해결 능력을 크게 향상시키는 반면, 동일한 솔루션에 대한 전통적인 모방 학습은 오히려 성능을 저하시킨다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
네 명의 서로 다른 테크 거물들—Anthropic, OpenAI, xAI, 그리고 Google 스쿼드라고 부릅시다—로부터 고용된 네 명의 슈퍼스타 교사들이 아주 똑똑한 한 명의 학생(Qwen2.5-Coder라는 이름의 모델)을 가르치는 코딩 교실을 상상해 보세요. 목표는 무엇일까요? 어떤 선생님이 최고인지 확인하고, 그들의 레슨을 결합하여 학생을 코딩의 마법사로 만드는 것입니다.
연구진은 거대하고 이해관계가 걸린 코딩 토너먼트를 설정했습니다. 선생님들이 서로를 채점하게 하면(이는 종종 친구라는 이유로 서로에게 A+를 주는 결과를 초래합니다), 보통은 서로 친해서 점수를 잘 주게 됩니다) 대신, 그들은 엄격하고 로봇 같은 심판인 컴퓨터 그 자체를 사용했습니다. 만약 선생님이 작성한 코드가 실제로 실행되고 숨겨진 테스트를 통과한다면 승리였습니다. 만약 코드가 충돌하거나 멈춘다면 패배였습니다.
토너먼트: 누가 최고의 선생님인가?
먼저, 선생님들은 두 가지 유형의 과제에 맞섰습니다:
- 쉬운 문제들: 표준 코딩 문제입니다. 여기서 네 명의 선생님 모두 매우 뛰어났으며, 약간의 "자기 수정"(실수를 바로잡을 두 번째 기회를 얻는 것)을 거친 후 모두 거의 완벽한 **99–100%**의 점수를 기록했습니다. 논문은 이것이 네 명 모두가 똑같이 천재이기 때문이 아니라, 이들이 이미 훈련 데이터에서 본 적 있는 특정 문제들을 접했기 때문이라고 시사합니다. 이는 마치 학생이 이미 암기한 연습 시험에서 만점을 받는 것과 같습니다.
- 어려운 문제들: 까다로운 경쟁 수준의 문제입니다. 여기서 진짜 차이가 드러났습니다.
- Gemini가 어려운 문제의 **77%**를 해결하며 선두를 차지했습니다.
- Claude와 Codex(OpenAI)는 서로 막상막하로, 둘 다 **69%**를 해결했습니다.
- Grok은 **50%**로 뒤처졌습니다.
논문은 Gemini가 앞서긴 했지만 그 격차가 엄청나게 크지는 않았으며, 순위는 선생님들이 무엇을 했다고 '말했는지'가 아니라 코드가 실제로 무엇을 '했는지'에 엄격히 기초했다는 점을 주의 깊게 명시하고 있습니다.
큰 반전: 선생님을 따라 하는 것이 오히려 해가 된다
이것은 일반적인 학교의 규칙을 깨뜨리는 반전입니다. 보통 여러 명의 똑똑한 선생님이 있다면, 그들의 숙제를 베끼는 것이 배우는 가장 좋은 방법이라고 생각합니다. 연구진은 이를 실험해 보았습니다: 그들은 모든 선생님으로부터 검증된, 작동하는 코드를 가져와서 학생 모델이 단순히 그것을 모방하게 했습니다(SFT라고 불리는 방식입니다).
결과는 이랬습니다. 학생의 실력이 오히려 떨어졌습니다.
- 표준 테스트에서 학생의 점수는 **76.7%**에서 **72.7%**로 하락했습니다.
- 어려운 경쟁 문제에서 학생의 점수는 **5.9%**에서 **2.9%**로 폭락했습니다.
논문은 학생이 이미 유능한 상태라면, 단순히 정답을 베끼는 것은 도움이 되지 않으며 오히려 혼란을 줄 수 있다고 주장합니다. 이는 재능 있는 농구 선수가 네 명의 서로 다른 프로 선수들의 하이라이트 영상을 보고 나서, 그들의 동작을 한꺼번에 흉내 내려고 노력하는 것과 같습니다. 그러면 자신의 리듬을 망치게 됩니다. 다른 사람이 되려고 노력하는 "지식의 충돌"이 그들을 자기 자신으로서의 능력을 떨어뜨리게 만든 것입니다.
승리 전략: 베끼는 것이 아니라 직접 하며 배우기
그렇다면 베끼기가 실패한다면, 무엇이 효과적일까요? 연구진은 RLVR(검증 가능한 보상을 통한 강화 학습)이라는 다른 접근 방식을 시도했습니다.
선생님들의 최종 정답을 복사하기 위해 학생에게 건네주는 대신, 그들은 선생님들의 검증된 문제들을 연습장으로 사용했습니다. 학생은 문제를 스스로 해결할 수 있도록 허용되었습니다.
- 만약 학생의 코드가 실행되고 테스트를 통과하면, "보상"(컴퓨터로부터의 하이파이브)을 받았습니다.
- 만약 실패하면, 보상을 받지 못하고 다시 시도해야 했습니다.
이 방법은 효과가 있었습니다!
- 학생의 어려운 경쟁 문제 점수는 정점 기준으로 **5.9%**에서 **8.8%**로 뛰어올랐습니다.
- 이는 49%의 상대적 개선입니다.
논문은 여러 명의 선생님을 갖는 것의 가치는 학생이 복사할 정답을 모으는 데 있는 것이 아니라, 학생이 직접 일을 수행하고 그것이 실제로 작동하는지에 대한 피드백을 받으며 배울 수 있는 거대한 "검증된 체육관"을 구축하는 데 있다고 시사합니다.
핵심 요약
논문은 우리가 코드 실행 능력에 기반해 이러한 AI 선생님들의 순위를 매길 수는 있지만, 진정한 마술은 학생에게 선생님을 모방하라고 요구하는 것을 멈추고, 학생이 시행착오를 통해 배우고 그것이 실제로 작동하는지에 대한 명확한 신호를 얻을 수 있는 도전적인 환경을 만드는 데서 일어난다고 결론짓습니다.
그것은 방 안에 가장 똑똑한 선생님을 두는 문제가 아닙니다. 그것은 학생이 연습하고, 실패하고, 무엇이 잘못되었는지에 대한 명확한 신호를 얻고, 성공할 때까지 다시 시도할 수 있는 놀이터를 만드는 것에 관한 것입니다. 연구진은 누구나 이 테스트를 직접 실행하여 숫자가 유효함을 확인할 수 있도록 모든 코드와 데이터를 공개했으며, 이는 때때로 배우는 가장 좋은 방법이 베끼기를 멈추고 직접 하는 것임을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.