← 최신 논문
🤖 machine learning

Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling

본 논문은 온-정책 강화 학습을 통해 후보 프로그램들을 순위 매기는 '이중 판단 공간'을 생성하기 위해 테스트 시간 샘플링을 활용하는 자기 학습 프레임워크인 DuST를 소개하며, 이를 통해 올바른 생성에 대한 직접적인 보상 없이도 코드 정확성 판단 능력과 고품질 솔루션 생성 능력을 모두 향상시킵니다.

원저자: Yizhu Jiao, Ruixiang Zhang, Richard Bai, Jiawei Han, Ronan Collobert, Yizhe Zhang

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yizhu Jiao, Ruixiang Zhang, Richard Bai, Jiawei Han, Ronan Collobert, Yizhe Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 컴퓨터 코드를 작성하는 법을 가르친다고 상상해 보세요. 전통적으로는 "이 문제가 있습니다. 해결책을 작성하세요. 실행해 보세요. 작동하면 훌륭합니다! 충돌하면 다시 시도하세요"라고 말하며 가르칩니다. 이는 로봇의 시도 하나하나에 대해 단일한 '합격' 또는 '불합격' 점수를 부여하는 것과 같습니다. 로봇은 학습하지만, 실패했다는 사실은 알지만 다른 가능성 있는 작성 내용과 비교했을 때 왜 실패했는지는 알지 못합니다.

이 논문은 DuST(Dual Self-Training, 이중 자기 학습)라는 새로운 교수법을 소개합니다. 이는 '원시 생성 (Primal Generation)' 대 '이중 판단 (Dual Judgment)'이라는 개념을 사용하여 게임의 규칙을 바꿉니다.

간단한 비유를 사용하여 내용을 분해해 보겠습니다:

1. 구식 방법: '합격/불합격' 퀴즈

**원시 생성 **(Primal Generation)
로봇을 시험을 치르는 학생이라고 생각해 보세요.

  • 과정: 학생이 하나의 답안을 작성합니다. 교사가 이를 확인합니다.
  • 피드백: 교사는 단일한 빨간색 'X' 또는 초록색 체크마크를 부여합니다.
  • 문제점: 학생이 'X'를 받으면 틀렸다는 것을 알지만, 정답에 얼마나 근접했는지, 혹은 다른 가능성 있는 답안보다 왜 자신의 특정 답안이 더 나쁜지 알지 못합니다. 그들은 단지 "이것은 하지 마라"는 것만 알 뿐입니다.

2. 새로운 아이디어: '시식' 패널

**테스트 시간 확장 **(Test-Time Scaling, 설정)
이 논문의 방법 이전에는 연구자들이 로봇이 한 번에 여러 개의 답안 (예: 4 개 또는 5 개) 을 작성하게 하고 그중 가장 좋은 것을 고르도록 하여 도움을 주려 했습니다. 이는 '시식 테스트'와 같습니다.

  • 결함: 구식 방법에서는 로봇이 가장 좋은 답안을 고르면 나머지 4 개의 답안은 쓰레기통에 버려집니다. 로봇은 답안 #2 가 '거의 맞았음'을 알면서도 답안 #4 가 '완전히 틀렸음'이라는 사실로부터 아무것도 배우지 못합니다. 그 귀중한 비교 데이터가 낭비되는 것입니다.

3. DuST 해결책: '준우승자'들로부터 배우기

**이중 판단 공간 **(Dual Judgment Space)
저자들은 로봇이 단순히 최종 승자로부터가 아니라, 자신의 답안들 간의 비교로부터 학습해야 한다고 주장합니다.

  • 비유: 요리 대회를 상상해 보세요.
    • 구식 방법: 심사위원이 한 요리를 맛보고 "타버렸다. 불합격"이라고 말합니다. 셰프는 어떤 요리를 좋게 만드는지 아무것도 배우지 못합니다.
    • DuST 방식: 셰프가 같은 요리의 4 가지 다른 버전을 만듭니다. 심사위원이 4 개를 모두 맛봅니다.
      • 요리 A: 완벽함.
      • 요리 B: 약간 짜다.
      • 요리 C: 덜 익었다.
      • 요리 D: 타버렸다.
    • 교훈: 단순히 "요리 A 가 훌륭하다"고 말하는 대신, 교사는 "요리 A 가 균형 잡혀 있어 우승자입니다. 요리 B 는 소금 때문에 실패했습니다. 요리 C 는 열 때문에 실패했습니다"라고 말합니다. 셰프는 성공과 실패 사이의 차이를 배웁니다.

4. DuST 의 작동 원리 (레시피)

이 논문은 로봇이 거치는 구체적인 루프를 설명합니다:

  1. 생성: 로봇은 코드 해결책의 일괄 처리 (batch) 를 작성합니다 ('시식 테스트' 일괄 처리).
  2. 판단: 로봇은 모든 것을 안전한 샌드박스에서 실행하여 실제로 작동하는 것들을 확인합니다 (합격/불합격).
  3. 그룹화: 로봇은 일괄 처리를 살펴봅니다. 모두 실패했거나 모두 합격했다면 그 일괄 처리를 버립니다. 일부는 작동하고 일부는 실패한 일괄 처리만 유지합니다. 이것이 '혼합 그룹'입니다.
  4. **순위 매기기 **(학습) 로봇은 이 혼합 그룹들을 '최고'에서 '최악'까지 순위 매기기를 하도록 요청받습니다.
    • 중요한 점: 로봇은 코드를 작성했다는 이유로 결코 보상을 받지 않습니다. 오직 어떤 코드가 더 좋은지 정확히 식별했을 때만 보상을 받습니다.
    • "이 작동하는 코드가 이 고장 난 코드보다 낫다"고 말하는 것에 점수를 받습니다.
  5. 마법 같은 전이: 로봇은 오직 심사관이 되도록 훈련되었음에도 불구하고 놀랍게도 작성자가 되는 데도 능숙해집니다. 작동하는 해결책과 고장 난 해결책 사이의 미묘한 차이를 포착하는 법을 배우면서, 로봇은 코드가 작동하게 만드는 요인을 '이해'하기 시작합니다. 로봇은 이러한 규칙을 내면화하고 스스로 더 나은 코드를 작성하기 시작합니다.

5. 결과: 왜 중요한가

이 논문은 LiveCodeBench라는 표준 코딩 테스트를 사용하여 (작은 것부터 매우 큰 것까지) 여러 다른 AI 모델에서 이를 테스트했습니다.

  • 더 나은 심사관: 모델들은 올바른 코드를 식별하는 데 훨씬 더 능숙해졌습니다 ('순위 매기기' 점수가 향상됨).
  • 더 나은 작성자: 놀랍게도 모델들은 "올바른 프로그램을 작성하라"는 직접적인 지시를 받지 않았음에도 불구하고 처음부터 코드를 작성하는 능력도 향상되었습니다.
  • **"원샷 **(One-Shot) 이 훈련 이전에는 모델이 높은 점수를 얻으려면 4 개의 답안을 작성하고 그중 가장 좋은 것을 골라야 할 수도 있었습니다. DuST 훈련 후에는 모델이 단 하나의 답안만 작성해도 동일한 높은 점수를 얻을 수 있었습니다. 이는 추측하고 확인하는 과정이 필요 없이 즉시 '최고'의 답안을 생성하는 법을 배웠기 때문입니다.

6. 비밀 소스: RL 과 단순한 복사

저자들은 이것이 왜 작동했는지 알아보기 위해 마지막 실험을 수행했습니다.

  • SFT(지도 미세 조정) 그들은 로봇이 올바른 순위 매기기를 복사하도록 가르치는 것 (학생이 정답지를 외우는 것과 같음) 을 시도했습니다. 이는 로봇을 더 나은 심사관으로 만들었지만, 더 나은 작성자로 만들지는 못했습니다.
  • RL(강화 학습) 그들은 GRPO 라는 방법을 사용했는데, 여기서 로봇은 시도하고, 실패하고, 보상에 기반하여 자신의 행동을 조정함으로써 학습합니다. 이것이 핵심이었습니다. 순위 매기기의 '능동적 학습'은 로봇이 사고 방식을 바꾸게 하여 작성 능력을 향상시켰습니다.

요약

DuST는 AI 가 자신의 작업에 대한 마스터 비평가로 변모함으로써 코딩을 학습하는 방법입니다. AI 가 자신의 '좋은' 시도와 '나쁜' 시도 사이를 구별하도록 훈련시킴으로써, 그것은 정확성의 숨겨진 규칙을 학습합니다. 이 지식은 다시 작성 능력으로 스며들어, 결코 완벽한 프로그램을 작성하는 법을 직접 가르침 받지 않고도 더 나은 코더가 됩니다. 이는 실패한 시도의 '낭비된' 데이터를 강력한 교사로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →