← 최신 논문
🤖 AI

Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR

이 논문은 추론 마커 이후 첫 번째 토큰을 다양화하여 롤아웃 탐색을 확장함으로써 검증 가능한 보상을 활용한 강화 학습 (RLVR) 을 개선하는 경량화 방법인 REFT 를 소개하며, 이는 핵심 학습 파이프라인을 변경하지 않고도 다양한 크기와 난이도 수준에서 모델 성능을 향상시킵니다.

원저자: Soeun Kim, Albert No

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Soeun Kim, Albert No

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

)는 거의 항상 동일합니다.

  • 유사성: 수학 문제를 풀도록 학생 그룹에게 요청한다고 상상해 보세요. 그들이 똑똑하다 하더라도, 모두 본능적으로 "먼저, ~해 봅시다..." 또는 "이 문제를 풀기 위해..."로 문장을 시작합니다.
  • 문제점: 로봇은 이러한 시작 단어에 너무 확신하고 있어, 거의 "해 봅시다..."나 "주어진 바에 따르면..." 또는 "초기에..."로 시작해 보려 하지 않습니다. 이는 같은 시작 구절을 반복하며 고착된 상태에 빠집니다.

저자들은 놀라운 사실을 발견했습니다: 첫 번째 단어는 실제로 수학 문제를 바꾸지 않습니다.

  • 유사성: 같은 도시로 가는 빨간 버스, 파란 버스, 또는 초록 버스 중 하나를 선택하는 여행자와 같습니다. 버스의 색상 (첫 번째 단어) 은 목적지나 버스 내부에서 취하는 경로를 바꾸지 않습니다. 그러나 로봇에게 빨간 버스만 타도록 한다면, 파란 버스나 초록 버스가 어떻게 생겼는지 결코 볼 수 없습니다.
  • 발견: 로봇이 "빨간 버스"(가장 흔한 첫 번째 단어) 가 최선의 선택이라고 생각하더라도, "파란"과 "초록" 버스 (덜 흔한 첫 번째 단어) 도 정답으로 이어질 가능성이 동일합니다. 로봇은 단순히 버스의 색상에 대해 지나치게 까다로울 뿐입니다.

해결책: REFT(첫 번째 토큰 다양화를 통한 롤아웃 탐색)

저자들은 REFT라는 간단한 해결책을 고안했습니다. 로봇이 자연스럽게 첫 번째 단어를 선택하게 하는 대신 (이는 보통 같은 단어로 이어짐), REFT 는 로봇이 고의로 몇 가지 다른 시작 단어를 시도하도록 강요합니다.

  • 작동 방식:

    1. 로봇이 가장 선호하는 상위 20 개의 시작 단어를 확인합니다.
    2. REFT 는 해당 목록에서 4 개의 서로 다른 단어를 선택합니다 (예: "First," "Let," "Given," "Initially").
    3. 그런 다음 각 시작 단어에 대해 로봇을 4 개의 서로 다른 경로로 보냅니다.
    4. 첫 번째 단어가 설정되면, 로봇은 나머지 문제를 평소와 exactly 동일하게 풀이를 계속합니다.
  • 유사성: 코치가 선수 팀에게 "모두 같은 워밍업 노래로 시작하는 대신, 네 개의 그룹이 네 가지 다른 노래로 시작하게 합시다"라고 말하는 상황을 상상해 보세요. 음악이 시작되면 모두 같은 경주를 달립니다. 코치는 경주를 바꾸는 것이 아니라, 팀이 더 나은 결승점으로 이어질지 확인하기 위해 다양한 시작 분위기를 탐색하도록 보장할 뿐입니다.

왜 이것이 중요한가

이 논문은 로봇에게 이러한 다른 "시작 문장"을 시도하도록 강요함으로써, 더 많은 계산 능력이나 훈련 뒤의 복잡한 수학을 변경하지 않고도 더 많은 정답을 발견할 수 있음을 보여줍니다.

  • 더 나은 결과: 로봇은 수학 문제 해결 능력이 향상되었습니다 (1 회, 8 회, 또는 64 회 시도 중 정답을 맞춘 빈도로 측정됨).
  • 추가 비용 없음: 훈련에 더 많은 시간이 걸리지 않았습니다. 사실, 로봇이 정답을 더 빠르게 발견했기 때문에 때로는 작업을 약간 더 빠르게 완료하기도 했습니다.
  • "모두 틀림" 그룹 회피: 때로는 전체 시도 그룹이 모두 같은 "잘못된" 사고방식으로 시작했기 때문에 실패합니다. 시작을 다양화함으로써 REFT 는 적어도 한 그룹이 올바른 경로를 찾도록 보장합니다.

요약

이 논문은 AI 추론에서 우리는 종종 사고 과정의 중간(어려운 수학 단계) 에서 다양성을 찾지만, 저자들은 정말 첫 번째 단어가 "낮은 부하, 높은 레버리지" 지점임을 발견했다고 주장합니다. 바꾸기 쉽습니다 (단어 하나일 뿐이지만) AI 가 탐색하는 해결책의 다양성에 막대한 영향을 미칩니다. 단순히 첫 번째 단어를 흔들어 줌으로써 AI 는 더 나은 문제 해결사가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →