← 최신 논문
🤖 machine learning

PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

이 논문은 롤아웃 상호작용을 대조 그래프(contrast graph)로 모델링하고 쌍별 인지 포함 재가중치(pairwise-aware inclusion reweighting)를 적용함으로써 포인트와이즈 추정량(pointwise estimator)의 통계적 편향을 교정하여, 기존 방식들에 비해 생성된 토큰 수를 현저히 줄이면서도 더 높은 정확도를 달달성하는 검증 가능한 보상이 있는 강화 학습(RLVR)을 위한 새로운 적응형 롤아웃 할당 방법인 PAIR를 소개한다.

원저자: Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 셰프에게 완벽한 수플레를 만드는 법을 가르치기 위해 거대한 요리 경연 대회를 운영하고 있다고 상상해 보십시오. 인공지능의 세계에서 이것은 "검증 가능한 보상을 통한 강화 학습(Reinforcement Learning with Verifiable Rewards, RLVR)"이라고 불립니다. 로봇은 요리를 시도하고, 컴퓨터 심사위원이 맛을 본 뒤, 요리가 훌륭하다면 로봇에게 점수를 줍니다. 빠르게 배우기 위해 로봇은 단 하나의 요리만 만드는 것이 아니라, 한 번에 한 그룹의 요리를 만듭니다. 그런 다음 그 그룹을 살펴보며 이렇게 말합니다. "좋아, 이게 최고였고 저건 최악이었어. 나는 그 차이로부터 배울 거야."

까다로운 점은 이 요리들을 만드는 데 비용이 많이 든다는 것입니다. 모든 레시피의 단계를 생성하는 데는 많은 컴퓨터 연산 능력과 시간이 소요됩니다. 그래서 연구자들은 어떤 레시피를 완성할지 영리하게 결정하려고 노력해 왔습니다. 보통은 레시피의 시작 부분(접두사, prefix)을 보고, "이것은 유망해 보이니 끝까지 완성하자"라거나 "이것은 지루해 보이니 여기서 멈추자"라고 추측합니다. 그들은 각 레시피를 개별적인 참가자로 취급합니다. 하지만 만약 레시피의 가치가 그 자체로 얼마나 훌륭한가에서 오는 것이 아니라, 주변 이웃들과 어떻게 비교되느냐에서 오는 것이라면 어떨까요? 만약 진짜 교훈이 단일 레시피가 아니라 레시피의 '쌍(pair)' 속에 숨겨져 있다면 어떨까요? 이것이 새로운 논문이 해결하고자 하는 퍼즐입니다.

PAIR(Pairwise-Aware Inclusion Reweighting)라는 제목의 이 논문은 기존의 레시피 선택 방식이 중요한 통계적 기법을 놓치고 있다고 주장합니다. 저자들은 로봇이 그룹으로부터 학습할 때, 실제로 개별 요리로부터 배우는 것이 아니라 그룹 내의 가능한 모든 요리 쌍 사이의 '관계'로부터 배운다는 사실을 발견했습니다. 그것은 마치 춤추는 사람의 실력이 아니라, 플로어 위의 모든 커플 사이의 케미스트리(chemistry)에서 재미가 결정되는 무도회와 같습니다.

현재 방식의 문제는 '가장 잘 어울리는' 무용수만을 들여보내는 문지기처럼 행동한다는 점입니다. 만약 문지기가 초반 몇 걸음만 보고 최고의 무용수들을 뽑는다면, 결국 모두가 똑같이 춤추는 사람들로 구성된 그룹을 만들게 됩니다. 거기에는 대비도, 긴장감도 없으며, 따라서 흥미로운 교훈을 얻을 수 없습니다. 논문은 일부 레시피의 생성을 조기에 중단하고 다른 레시피는 완성함으로써, 연구자들이 의도치 않게 편향된 그룹을 만들어냈다고 설명합니다. 즉, '쌍'이 더 이상 무작위가 아니게 된 것입니다. 그들은 너무 유사한 쌍들을 선택했고, 이는 수학적 오류를 일으켰습니다.

이를 해결하기 위해 저자들은 PAIR라는 새로운 시스템을 구축했습니다. 단순히 어떤 단일 레시피가 최고인지 추측하는 대신, PAIR는 전체 그룹을 하나의 거대한 연결망으로 취급합니다. 모든 레시피를 점(정점, vertex)으로 보고, 두 레시피 사이의 가능한 모든 비교를 그 점들을 잇는 선(간선, edge)으로 생각하는 그래프를 상상해 보십시오. 컴퓨터 작업 비용은 점(레시피)을 생성하는 데 지불되지만, 학습의 가치는 선(비교)에서 발생합니다.

실제 과정에서 PAIR가 작동하는 방식은 다음과 같습니다:

  1. 맛 테스트: 시스템은 모든 후보 레시피에 대해 짧은 "접두사(prefix)"를 생성합니다. 맛을 살짝 느낄 수 있을 정도의 분량입니다.
  2. 수정구슬: 이 짧은 시작 부분을 사용하여 작은 예측기가 두 가지를 추측합니다. "이 레시피가 성공할 가능성이 있는가?" 그리고 "이것을 완성하는 데 얼마나 많은 컴퓨터 연산력이 더 필요할 것인가?"
  3. 스마트 예산: 단순히 "최고"인 것들을 고르는 대신, PAIR는 영리한 수학적 기법(볼록 설계, convex design)을 사용하여 어떤 레시피를 완성할지 결정합니다. 이는 설령 어떤 레시피가 위험해 보이더라도, 그것이 완성될 작은 가능성을 여전히 갖도록 보장합니다. 이는 "연결망"을 열린 상태로 유지하는 데 매우 중요합니다.
  4. 보정: 이것이 마법의 소스입니다. 시스템이 모든 레시피를 선택하지 않았기 때문에 일부 연결(쌍)은 누락되었습니다. PAIR는 각 쌍이 나타날 확률을 정확히 계산하여 그 숫자를 사용하여 학습 내용을 "재가중치(re-weight)" 합니다. 만약 어떤 쌍을 관찰하기 어려웠다면, 누락된 데이터를 보완하기 위해 그 교훈의 비중을 더 높게 설정합니다.

결과는 인상적입니다. Qwen3-1.7B 및 Qwen3-4B와 같은 AI 모델을 사용한 테스트에서, PAIR는 표준 방식보다 약 51%에서 52% 적은 생성 토큰(컴퓨터 단계)을 사용하여 로봇 셰프를 더 똑똑하게 만들었습니다. 또한 차세대 최고 방법보다 평균 정확도를 +1.2에서 +1.4 포인트 더 높였습니다.

저자들은 이것이 단순히 운이 좋았던 것이 아님을 매우 신중하게 강조합니다. 그들은 자신들의 방식이 "설계 불편 편향이 없음(design-unbiased)"을 수학적으로 증명했습니다. 즉, 실험을 충분히 반복한다면, 비록 데이터의 일부만 보고 있더라도 평균 결과는 실제 목표치에 완벽하게 도달하게 된다는 의미입니다. 또한 그들은 "고정된 모집단(frozen population)" 감사를 실시했습니다. 이는 고정된 레시피 그룹의 스냅샷을 찍고 선택 과정을 수천 번 다시 실행하여 수학이 제대로 작동하는지 확인하는 작업입니다. 결과는 성공적이었습니다.

하지만 논문은 또한 이 시스템이 "수정구슬(예측기)"이 어느 정도 정확해야 한다는 점에 의존한다고 경고합니다. 만약 예측기가 어떤 레시피가 성공할지 맞히는 데 형편없다면, 시스템은 잘못된 쌍에 예산을 낭비하게 될 것입니다. 그러나 예측기가 훌륭할 때, PAIR는 AI 훈련이라는 혼란스러운 과정을 매우 효율적이고 수학적으로 견고한 '점 잇기 게임'으로 탈바꿈시키며, 때로는 가장 많이 배우기 위해 모든 것을 볼 필요는 없으며, 오직 '올바른 연결'을 보는 것이 중요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →