← 최신 논문
💬 NLP

GFlowRL: Scaling Distribution-Matching RL to Large Language Models

GFlowRL은 인-배치 몬테카를로 추정치와 특화된 안정화 장치를 사용하여 학습된 분할 함수(partition function)의 필요성을 제거함으로써, 최대 235B 파라미터에 달하는 밀집 및 희소 아키텍처 모두에서 수학, 코드 및 적대적 벤치마크에 걸쳐 최첨단 성능을 달래는 확장 가능하고 안정적인 GFlowNet 스타일의 강화 학습 알고리즘을 도입합니다.

원저자: Xiaodong Liu, Michael Xu, Jack W. Stokes, Paul Smolensky, Doug Burger, Jianfeng Gao

게시일 2026-07-16
📖 5 분 읽기🧠 심층 분석

원저자: Xiaodong Liu, Michael Xu, Jack W. Stokes, Paul Smolensky, Doug Burger, Jianfeng Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하고 학습 속도가 빠른 학생에게 복잡한 수학 문제부터 절대 충돌(crash)하지 않는 컴퓨터 코드 작성에 이르기까지, 세상에서 가장 어려운 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 인공지능의 세계에서 이 학생은 '대규모 언어 모델(LLM)'이며, 우리가 그들을 가르치는 방법은 '강화 학습(Reinforcement Learning)'이라고 불립니다. 이것을 AI가 옳은 행동을 했을 때 점수(보상)를 받는 비디오 게임이라고 생각하면 됩니다. 오랫동안 표준 전략은 탐욕스러운 게이머처럼 행동하는 것이었습니다. 즉, "지금 당장 가장 많은 점수를 주는 단 하나의 움직임을 찾아내고, 그것을 반복해서 수행하라"는 것이었습니다. 이 방식은 잘 작동하지만, 한 가지 결함이 있습니다. 이는 마치 어떤 학생이 수학 문제를 푸는 특정한 한 가지 방법만을 암기하고, 설령 다른 방법이 똑같이 훌륭하더라도 다른 시도를 거부하는 것과 같습니다. 그들은 사고의 다양성과 창의성을 놓친 채 한 가지 사고방식에 '갇히게' 됩니다.

이를 해결하기 위해, 과학자들은 최근 'GFlowNets(Generative Flow Networks)'라고 불리는 다른 접근 방식을 시도했습니다. 단순히 최고의 한 수를 찾는 대신, 이 방법은 AI가 모든 유효한 경로를 탐색하도록 가르치며, 각 경로가 얼마나 잘 작동하는지에 따라 사용될 기회를 부여합니다. 이는 학생에게 "가장 빠른 길만 찾으려 하지 말고, 미로 속의 모든 유효한 경로를 시도해 봐"라고 말하는 것과 같습니다. 목표는 다양하고 유연한 사고를 하는 존재를 만드는 것입니다. 하지만, 이 방식을 거대하고 똑똑한 AI 모델로 확장하는 것은 악몽과 같았습니다. 과학자들이 구축한 도구들은 너무 복잡하고 불안정하여, 모델이 거대해지거나 작업이 복잡해지면 종종 AI를 충돌시키거나 아무것도 배우지 못하게 만들었습니다.

'GFlowRL'이라는 제목의 이 논문은 바로 그 골칫거리를 다룹니다. 저자들은 기존의 '다양한 사고' 레시피에서 가장 복잡한 부분이 사실 문제의 원인이었다는 것을 발견했습니다. 그들은 특정 수학적 도구가 학습의 균형을 잡는 데 도움을 주기는커녕, 오히려 도움이 되는 가이드가 아니라 노이즈가 심한 고장 난 라디오처럼 작동하고 있다는 것을 발견했습니다. 연구진은 그 고장 난 도구를 버리고 훨씬 더 단순한 '온더플라이(on-the-fly, 즉석)' 계산법으로 대체함으로써, GFlowRL이라는 새로운 방법을 만들어냈습니다. 이 새로운 방식은 안정적이고 빠르며 놀라울 정도로 효과적입니다. GFlowRL은 거대한 AI 모델이 충돌 없이도 어렵고 복잡한 수학 및 코딩 과제를 해결하며 다양한 문제 해결 전략을 배울 수 있게 해줍니다. 실제로 이들의 새로운 방법은 이전의 기록 보유자들을 능가하여, 현재 이용 가능한 최고 수준의 AI와 맞먹는 경쟁 프로그래밍 실력에 도달하면서도 학습 과정을 매끄럽고 안정적으로 유지했습니다.

문제점: 모든 것을 망가뜨린 "마법의 계산기"

이 혁신을 이해하려면 먼저 기존의 방식을 살펴봐야 합니다. 연구자들이 GFlowNets를 사용하여 AI에게 다양성을 가르치려 했을 때, 그들은 보상의 균형을 맞추기 위해 특별한 '계산기'(기술적으로는 *분배 함수(partition function)*라고 불림)에 의존했습니다. 여러분이 1,000명의 학생을 채점하는 교사라고 상상해 보세요. 독특하고 기발한 해결책을 찾아낸 학생에게 점수를 주고 싶지만, 동시에 전체 시스템이 무너지지 않도록 점수가 너무 높게 책정되지 않도록 관리해야 합니다.

기존 방식은 이 계산기 역할을 하기 위해 완전히 새로운 작은 AI 모델을 구축하려고 했습니다. 문제는 이 작은 계산기가 이미 천재적인 거대 학생(메인 AI)이 결정 내리고 있는 와중에 처음부터 학습해야 했다는 점입니다. 이는 마치 억만장자 기업의 예산을 관리하기 위해 갓 돌이 지난 아기에게 회계 업무를 맡기는 것과 같았습니다. 아기(계산기)는 혼란에 빠져 무작위 숫자를 외쳐댔고, 결국 전체 시스템을 패닉에 빠뜨렸습니다. 연구진은 이 '계산기'가 오히려 해가 되고 있다는 것을 발견했습니다. 이 계산기는 너무 불안정해서 AI의 학습 과정을 오류로 폭발하게 만들었으며, 많은 경우 계산기를 그냥 무작위 노이즈로 대체했을 때보다 더 나쁜 결과를 초래했습니다.

해결책: 계산기를 버리고, 그룹을 활용하라

GFlowRL의 저자들은 단순하고 대담한 질문을 던졌습니다. "우리가 정말 이 고장 난 계산기가 필요한가?"

그들은 AI가 이미 계산기가 해야 할 일을 이미 수행하고 있다는 사실을 깨달았습니다. AI가 연습할 때, AI는 단 하나의 답만 내놓는 것이 아니라 한 번에 전체 그룹의 답을 시도합니다(마치 표적 집단 조사처럼). 연구진은 AI가 이미 생성한 답변 그룹을 살펴보는 것만으로도 필요한 균형을 파악할 수 있다는 점을 발견했습니다. 별도의 취약한 기계를 만들어 수학을 계산하는 대신, 바로 눈앞에 있는 데이터를 활용한 것입니다.

이것을 이렇게 생각해보세요. 팀이 얼마나 벌었는지 알려줄 불안해하는 별도의 회계사를 고용하는 대신, 팀이 방금 제출한 영수증을 직접 확인하는 것입니다. 정보는 동일하지만, 즉각적이고 실제적이며, 고장 날 위험이 있는 비싼 기계를 새로 만들 필요가 없습니다.

이 단순한 전환—복잡하고 학습이 필요한 계산기를 대신해 그룹으로부터 얻은 빠른 즉석 추정치를 사용하는 것—이 모든 것을 바꾸어 놓았습니다.

  1. 안정성: 통제 불능의 오류들이 사라졌습니다. 학습 과정은 오늘날 사용되는 표준 방식만큼 매끄러워졌습니다.
  2. 단순성: 두 번째의 추가 모델을 훈련할 필요가 없었습니다. 이는 엄청난 양의 컴퓨팅 자원과 시간을 절약해 주었습니다.
  3. 성능: 놀랍게도, AI는 단순히 충돌을 멈춘 것에 그치지 않고 오히려 더 좋아졌습니다.

결과: 충돌에서 챔피언으로

연구팀은 이 새로운 방법인 GFlowRL을 AI에게 가장 어려운 도전 과제들에 테스트했습니다.

  • 수학: 그들은 어려운 수학 경시대회 데이터를 통해 모델을 훈련했습니다. 새로운 방식은 다양성을 장려하려 했던 이전의 어떤 방법보다 더 많은 문제를 풀 수 있도록 도왔습니다.
  • 코딩: 그들은 Codeforces와 같은 경쟁 프로그래밍 사이트에서 테스트를 진행했습니다. GFlowRL로 훈련된 140억 개의 파라미터를 가진 모델은 2048의 레이팅에 도달했습니다. 이를 설명하자면, 이는 매우 높은 수준의 기술로, 이전의 오픈 소스 기록을 경신했으며 현재 가장 뛰어난 폐쇄형 AI(o3-mini)와 단 25점 차이밖에 나지 않습니다.
  • 안전성 (레드 티밍): 그들은 또한 AI의 안전 규칙이 제대로 작동하는지 확인하기 위해 규칙을 깨뜨리려는 시도인 '레드 티밍(red-teaming)' 테스트를 진행했습니다. 이전의 방식들이 완전히 실패했던 이 노이즈 많고 혼란스러운 환경에서, GFlowRL은 성공적으로 공격 필터를 뚫는 데 성공하며 복잡하고 다양한 전략을 학습할 수 있음을 증명했습니다.

가장 인상적인 부분은 이 방식이 얼마나 잘 확장(scale up)되는가였습니다. 이 방식을 수천억 개의 파라미터를 가진 '전문가 혼합(Mixture of Experts, MoE)' 모델에 적용했을 때, 이전의 방식들은 즉시 충돌했습니다. 그러나 GFlowRL은 2,350억 개의 파라미터를 가진 모델에서도 완벽하게 작동을 유지했습니다.

이것이 왜 중요한가

이 연구의 핵심적인 교훈은 단순히 더 나은 AI 훈련법을 만들었다는 것이 아닙니다. '최선'의 방법이 항상 가장 복잡한 방법은 아니라는 사실을 깨달았다는 점입니다. 기존 레시피에서 불필요하고 불안정한 부분을 제거함으로써, 더 단순하면서도 강력한 길을 찾아낸 것입니다.

GFlowRL은 AI를 진정으로 똑똑하고 다양하게 만들기 위해 더 복잡한 기계 장치를 덧붙일 필요가 없다는 것을 시사합니다. 때로는 초지능적인 학생을 가르치는 가장 좋은 방법은, 수업 계획을 지나치게 정교하게 만드는 것을 멈추고, 그들이 이미 생성하고 있는 아이디어의 그룹으로부터 스스로 배우게 하는 것입니다. AI의 추론 능력을 확장하는 열쇠는 더 많은 도구를 추가하는 것이 아니라, 정확히 어떤 도구를 버려야 할지 아는 것이었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →