← 최신 논문
📊 statistics

Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems

이 논문은 개별적인 시도가 아닌 샘플 집합의 집단적 성공(pass@k)을 직접 최적화하기 위해 편향되지 않은 추정치를 도출함으로써, k-어닐링(k-annealing)을 통해 pass@1 성능을 유지하거나 개선하는 동시에 탐색을 강화하고 더 어려운 문제를 해결하는 새로운 강화 학습 프레임워크인 Pass-at-k 정책 최적화(PKPO)를 소개한다.

원저자: Christian Walder, Deep Karkhanis

게시일 2026-06-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Christian Walder, Deep Karkhanis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 어려운 수학 문제를 푸는 법을 배우려는 학생을 돕는 선생님이라고 상상해 보세요.

과거의 방식: "첫 번째 시도"의 함정
전통적으로 AI 모델(코드를 작성하거나 수학 문제를 푸는 모델 등)을 훈련할 때, 컴퓨터는 문제를 풀려고 시도하고 점수를 받은 뒤, 그 단 한 번의 시도를 바탕으로 자신의 뇌를 조정합니다. 만약 첫 번째 시도가 실패한다면, 컴퓨터는 배경에서 수행했을지도 모르는 다른 시도들로부터 아무것도 배우지 못합니다. 이는 마치 학생이 시험을 보다가 한 문제를 틀리자마자, 만약 계속 진행했더라면 두 번째나 세 번째 시도에서 정답을 맞혔을 수도 있다는 사실을 무시한 채 즉시 포기해 버리는 것과 같습니다.

이 방법은 Pass@1을 최적화합니다: "첫 번째 답이 맞았는가?" 이는 AI가 안전하고 보수적으로 행동하게 만들며, 정말 어려운 문제를 풀기 위해 필요한 위험하고 창의적인 추측을 피하게 만듭니다.

새로운 아이디어: "배치 중 최고(Best of the Batch)" 접근법
이 논문의 저자들은 **Pass@K 정책 최적화(PKPO)**라고 불리는 새로운 전략을 제안합니다.

단 하나의 정답에만 신경 쓰는 대신, 이 방법은 이렇게 말합니다: "모든 문제에 대해 K개의 서로 다른 시도(예: 8개 또는 16개)를 생성하자. 첫 7개가 틀려도 상관없다. 우리는 적어도 하나가 맞기만 하면 된다."

낚시 그물로 생각해 보세요.

  • 과거의 방식: 낚싯줄 하나를 던집니다. 물고기를 놓치면 줄을 끌어올리고 아무것도 배우지 못합니다.
  • PKPO 방식: 16개의 줄이 달린 그물을 던집니다. 16개의 줄 중 단 하나라도 물고기를 잡으면, 그 그물 전체는 성공입니다. AI는 모든 줄의 평균이 아니라, 그물 속의 최고의 수확물에 대해 보상을 받습니다.

마법의 기술: 점수판(Score Card)
어려운 점은 AI에게 이 방식을 어떻게 가르칠 것인가 하는 것입니다. 만약 당신이 단순히 AI에게 "너는 4번 줄에서 물고기를 잡았다"라고 말한다면, AI는 1, 2, 3번 줄을 무시할 수도 있습니다. 하지만 만약 "물고기를 잡았으니, 너는 잘했다"라고 말한다면, AI는 어떤 줄이 영웅이었는지 깨닫지 못할 수도 있습니다.

저자들은 스마트한 심판 역할을 하는 특별한 수학적 "점수판(추정치)"을 발명했습니다.

  1. 그것은 16개의 시도를 모두 살펴봅니다.
  2. 그룹 내에 어떠한 정답이라도 존재한다면 보상을 주는 방식으로 점수를 계산합니다.
  3. 결정적으로, 이 방식은 "틀린" 답들에게도 약간의 공로를 인정합니다. 왜냐하면 그 답들도 결국 승자를 만들어낸 그룹의 일부였기 때문입니다. 이는 AI가 설령 나중에 "좋은" 추측이 나타나더라도, 팀의 성공에 기여할 수 있다는 것을 알게 함으로써 더 과감하고 위험한 아이디어를 계속 탐색하도록 장려합니다.

이것이 중요한 이유
이 논문은 이 방법이 어려운 과업에서 어떻게 초능력처럼 작용하는지 보여줍니다:

  • 어려운 문제를 풀어냅니다: 기존의 "첫 번째 시도" 방식이 막히는 매우 까다로운 수학 및 코딩 챌린지에서, 이 새로운 방법은 학습을 지속하여 결국 문제를 해결해 냅니다.
  • 유연합니다: 당신은 AI에게 이렇게 지시할 수 있습니다: "훈련 전반부에는 위험을 감수하며 8번의 시도 중 최고를 목표로 해라. 후반부에는 첫 번째 시도를 맞히는 데 집중해라." 이러한 "어닐링(annealing, 서서히 규칙을 바꾸는 것)"은 AI가 먼저 탐색을 하고, 그 후에 숙련도를 높이도록 돕습니다.
  • 실제 모델에서 작동합니다: 저자들은 이를 GEMMA2와 LLAMA3.1 같은 인기 있는 오픈 소스 모델에 테스트했으며, 이전 방법들과 비교했을 때 수학 문제 해결 능력과 코드 작성 능력이 유의미하게 향 향상되었음을 발견했습니다.

요약하자면
이 논문은 AI에게 첫 번째 추측에서 완벽해야 한다는 걱정을 멈추라고 가르칩니다. 대신, 다양한 아이디어를 생성하고, 그룹 내에 어떤 승자가 있더라도 그 집단 전체에 보상을 주며, 그 집단적 성공을 통해 가장 어려운 퍼즐을 푸는 법을 배우도록 가르칩니다. 이는 단일한 추측의 개별적 성과보다는 여러 번의 추측이 만드는 팀워크의 가치를 중시하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →