← 최신 논문
💬 NLP

Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow

이 논문은 롤아웃과 학습 모두에 일관된 FP8 정밀도를 적용함으로써 혼합 정밀도 전략으로 인해 발생하는 학습 불안정성과 정확도 붕괴를 해결하고, 이를 통해 안정적인 수렴을 유지하면서도 상당한 속도 향상을 달성하는 통합 FP8 강화 학습 프레임워크인 Jet-RL을 소개한다.

원저자: Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

게시일 2026-01-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 Jet-RL 논문을 일상적인 비유를 사용하여 쉬운 개념으로 풀어낸 설명입니다.

핵심 문제: AI 학습의 "느린 걸음"

당신이 매우 똑똑한 로봇(거대 언어 모델)에게 복잡한 수학 문제를 풀도록 훈련시키고 있다고 상상해 보세요. 로봇이 이 문제에 능숙해지려면, 정답을 내놓기 전에 "생각을 밖으로 내뱉는 과정"(긴 추론 체인을 생성하는 것)을 연습해야 합니다.

AI 학습의 세계에서 이 연습 세션을 **롤아웃(Rollout)**이라고 부릅니다.

  • 병목 현상: 이 논문은 이 "생각을 밖으로 내뱉는" 단계가 믿기 힘들 정도로 느리다는 점을 지적합니다. 이 단계는 전체 학습 시간의 **70%**를 차지합니다. 이는 마치 학생이 시험 공부를 위해 7시간을 쓰는데, 그중 5시간을 첫 문장을 어떻게 시작할지 고민하며 빈 페이지를 멍하니 바라보는 데 쓰는 것과 같습니다.
  • 목표: 우리는 로봇을 멍청하게 만들지 않으면서 이 "생각하는" 단계를 가속화하고 싶습니다.

실패한 지름길: "이중 장부의 실수"

속도를 높이기 위해 엔지니어들은 간단한 트릭을 시도했습니다. 바로 **양자화(Quantization)**입니다.

  • 비유: 로봇의 뇌는 보통 고화질인 16비트 "HD" 숫자로 작동합니다. 속도를 높이기 위해, 그들은 연습 세션 동안만 로봇의 "생각 모드"를 저화질인 8비트 "SD" 모드(FP8)로 전환하고, "채점" 세션은 HD 모드로 유지하려고 했습니다.
  • 아이디어: "길고 긴 생각 부분은 빠르고 낮은 해상도 모드를 사용하되, 실제 학습 업데이트는 고해상도 모드를 유지하자."
  • 재앙: 논문에 따르면 이 접근 방식은 길거나 어려운 작업에서 재앙이 되었습니다.
    • 불일치: 이것은 마치 학생에게 연필(저해상도)로 10페이지짜리 에세이를 쓰게 한 뒤, 채점은 잉크(고해상도)로 쓴 것처럼 하는 것과 같습니다. 연필 스케치의 미세한 오류들이 쌓여갑니다. 에세이가 길어지면(16,000 단어), "연필" 버전은 "잉크" 버전과 전혀 달라져 버립니다.
    • 결과: 로봇은 혼란에 빠집 됩니다. 환각 현상이 발생하기 시작하고, 학습이 중단되며, 로봇의 성능이 무너집니다. 논문에서는 이를 "파괴적인 정확도 붕괴(catastrophic accuracy collapse)"라고 부릅니다.

해결책: Jet-RL ("통합된 언어" 접근법)

저자들은 Jet-RL이라는 새로운 시스템을 제안합니다. 연습과 채점 사이에서 언어를 바꾸는 대신, 로봇이 모든 과정에서 **동일한 언어(FP8)**를 사용하도록 만듭니다.

  • 비유: 이제 로봇은 연습 에세이를 연필로 쓰고, 선생님 또한 연필 기반의 채점 기준표를 사용하여 에세이를 채점한다고 상상해 보세요.
    • 일관성: "생각하는" 과정과 "학습하는" 과정이 정확히 동일한 저해상도 형식으로 이루어지기 때문에 혼란이 없습니다. 로봇은 자신이 연습한 그대로를 배웁니다.
    • 안정성: 매우 긴 에세이(긴 롤아웃)나 매우 어려운 주제에서도, "연필"의 오류가 전체 과정에서 일관되게 나타나므로 로봇은 안정성을 유지합니다.

작동 원리 (기술적 마법)

이것이 작동하게 만들기 위해, 팀은 수학을 다루는 방식에 매우 영리하게 대처해야 했습니다:

  1. 통합된 흐름 (Unified Flow): 그들은 생각의 첫 단계부터 뇌를 업데이트하는 마지막 단계까지 데이터가 컴퓨터 칩을 통해 흐르는 방식이 FP8(저해상도)로 처리되도록 보장했습니다.
  2. 스마트 그룹화 (Smart Grouping): 단순히 모든 것을 무작정 줄인 것이 아닙니다. 그들은 숫자들을 함께 그룹화하여(마치 책장에 책을 정리하듯), "저해상도" 버전이 학습하기에 충분히 정확한 수준을 유지하도록 했습니다.
  3. 보정 불필요 (No Calibration): 보통 형식을 바꿀 때는 제대로 작동하는지 확인하기 위해 "보정"(테스트 및 조정)하는 시간이 필요합니다. 하지만 Jet-RL은 시스템이 처음부터 일관되게 설계되었기 때문에 이 단계를 건너뜁니다.

결과: 빠르고 정확함

논문은 이 시스템을 여러 모델에 테스트하여 다음과 같은 결과를 얻었습니다:

  • 속도: "생각하는" 단계를 33% 더 빠르게 만들었으며, 전체 학습 과정을 16% 더 빠르게 만들었습니다.
  • 정확도: 기존의 실패한 지름길(로봇을 실패하게 만든 방식)과 달리, Jet-RL은 로봇의 지능을 고화질 버전과 거의 동일하게 유지했습니다. 성능 저하는 무시할 수 있는 수준(1% 미만)이었습니다.
  • 신뢰성: 로봇이 매우 긴 답변(16,000 단어)을 쓰거나 매우 어려운 수학 문제를 풀어야 하는 상황에서도, 기존 방식은 무너졌지만 Jet-RL은 성공적으로 작동했습니다.

요약

Jet-RL은 로봇이 "빠른 모드"와 "스마트 모드" 사이를 오가며 혼란을 겪는 것을 방지하는 새로운 AI 학습 방식입니다. 생각하기와 학습하기 모두에 동일한 "빠른 언어"를 사용함으로써, AI를 멍청하게 만들지 않고도 학습 속도를 훨씬 빠르게 만듭니다. 이는 깨지기 쉽고 불안정한 지름길을 신뢰할 수 있는 고속도로로 탈바꿈시킨 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →