← 최신 논문
🤖 machine learning

Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models

이 논문은 수천 개의 환경에서 얻은 다양한 궤적을 통해 오프라인으로 학습된 대규모 멀티태스크 트랜스포머 정책인 LDM-v0를 소개하며, 단일 통합 모델이 로보틱스에서 사이버 보안에 이르는 다양한 영역에 걸쳐 특화된 정책들의 성능과 일치할 수 있음을 입증한다.

원저자: Thibaut Kulak

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thibaut Kulak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 비디오 게임 하기, 자동차 운전하기, 창고 관리하기, 그리고 로봇 팔 제어하기와 같은 모든 것을 가르치려 한다고 상상해 보십시오. 전통적인 방식이라면 각 작업마다 서로 다른 전문가 코치를 고용해야 했을 것입니다. 비디오 게임 코치는 운전에 대해 전혀 모르며, 창고 관리자는 슈퍼 마리오를 하는 법을 모릅니다. 이는 느리고 비용이 많이 들며, 매 작업마다 엄청난 맞춤형 조정이 필요합니다.

이 논문은 이 문제를 해결하기 위해, 한 번에 이 모든 다양한 일들을 배울 수 있는 **단 하나의 "슈퍼 코치"**를 훈련하는 새로운 접근 방식인 LDM-v0를 소개합니다.

다음은 이들이 어떻게 이 일을 해냈는지 쉬운 비유를 들어 설명한 내용입니다.

1. 문제점: 너무 많은 서로 다른 "언어들"

강화 학습(Reinforcement Learning, RL)은 학생에게 무언가를 시도하게 하고, 잘했을 때 점수(보상)를 주는 방식으로 가르치는 것과 같습니다. 문제는 모든 환경(비디오 게임이나 로봇 시뮬레이터 등)이 서로 다른 "언어"를 사용한다는 점입니다.

  • 어떤 환경은 로봇 팔을 설명하기 위해 숫자를 사용합니다.
  • 다른 환경은 이미지를 사용합니다.
  • 또 다른 환경은 텍스트를 사용합니다.
  • 무엇이 "좋은 움직임"인지에 대한 규칙도 각 환경마다 완전히 다릅니다.

이 모든 것을 한꺼번에 하나의 모델에 학습시키려는 것은, 학생에게 프랑스어, 일본어, 모스 부호를 동시에 배우면서 저글링까지 배우라고 가르치는 것과 같습니다.

2. 해결책: "만능 번역기" (LDM-v0)

연구진은 LDM-v0(Large Decision Model)라는 거대한 모델을 구축했습니다. 이 모델을 만능 번역기라고 생각하십시오. 이 모델은 그 모든 서로 다른 "언어"들을 컴퓨터가 이해할 수 있는 단일하고 공통된 형식으로 변 conversion(변환)합니다.

  • 입력(Input): 모델에 가공되지 않은 데이터를 직접 입력하는 대신, 그들은 모든 것을 "토큰"(문장의 단어와 같은 것)으로 변환합니다. 이미지든, 숫자든, 로봇의 위치든, 모두 표준화된 토큰으로 바뀝니다.
  • 두뇌(Brain): 그들은 긴 이야기를 기억하는 데 매우 뛰어난 특정 유형의 AI 아키텍처(챗봇에 사용되는 "Llama"와 유사한 방식)를 사용했습니다. 여기서 "이야기"란 로봇이 무엇을 보았고, 무엇을 했으며, 어떤 점수를 받았는지에 대한 기록(history)을 의미합니다.

3. 학습 방법: "섀도잉(Shadowing)" 방식

모델을 그냥 1,000개의 서로 다른 게임 속에 던져놓고 스스로 깨우치기를 기대할 수는 없습니다. 모델에게는 스승이 필요합니다. 하지만 모든 게임을 완벽하게 할 줄 아는 인간은 없기 때문에, 연구진은 **자동 참조 정책 감독(Automated Reference-Policy Supervision)**이라는 영리한 트릭을 사용했습니다.

체스, 축구, 포커를 배우고 싶다고 가정해 봅시다. 인간이 가르치는 대신, 1,000명의 서로 다른 전문가 봇을 고용하는 것입니다.

  1. 전문가 고용: 그들은 특정 환경을 숙달한 수천 개의 특화된 AI 에이전트(PPO 또는 DQN과 같은 표준 알고리즘 사용)를 훈련시켰습니다.
  2. 마스터의 기록: 이 전문가 봇들이 수행한 "완벽한" 움직임들을 기록했습니다.
  3. 섀도잉 게임: 그런 다음 이 기록들을 LDM-v0에 입력했습니다. 모델의 역할은 "생각"하거나 "탐색"하는 것이 아니라, 단순히 **전문가 봇을 흉내 내는 것(mimic)**이었습니다. 모델은 게임의 기록을 보고 "전문가라면 다음에 무엇을 할 것인가?"를 예측했습니다.

이 과정을 통해 LDM-v0는 각 규칙을 명시적으로 배우지 않고도 1,000개의 서로 다른 환경에서 최고의 전략을 모방하는 법을 배웠습니다.

4. 결과: 모든 것을 지배하는 하나의 모델인가?

팀은 이 단일 모델을 로보틱스(로봇 팔 및 드론 제어), 운전(고속도로 자동차 시뮬레이션), 비즈니스(재고 및 주식 거래 관리), 게임(고전 아케이드 게임 및 슈퍼 마리오)을 포함한 약 1,000개의 서로 다른 환경에서 테스트했습니다.

큰 성과:
단일 모델인 LDM-v0는 약 1,000개의 환경에서 특화된 "전문가" 봇들과 대등한 성능을 보여주었습니다. 즉, 하나의 일반적인 모델이 1,000개의 서로 다른 전문가 모델의 역할을 수행할 수 있었던 것입니다.

또한, 모델을 더 크게 만들수록(더 많은 "두뇌 능력"을 부여할수록) 일정 수준까지는 성능이 전반적으로 향상된다는 것을 발견했습니다.

5. 이것이 의미하는 바 (그리고 의미하지 않는 것)

  • 증명된 것: 하나의 거대한 AI 모델을 방대한 양의 서로 다른 작업들에 대해 학습시켜 모든 작업에서 잘 수행하게 만드는 것이 가능하다는 점입니다. 이는 서로 다른 작업들이 모델이 학습할 수 있는 숨겨진 패턴을 공유하고 있음을 시사합니다.
  • 주장하지 않는 것: 이 논문은 이 모델이 내일 당장 당신의 차를 운전하거나 실제 주식 포트폴리오를 관리할 준비가 되었다고 말하는 것이 아닙니다. 모든 테스트는 시뮬레이션(비디오 게임 및 디지털 트윈) 환경에서 수행되었습니다.
  • 한계점: 이 모델은 이전에 본 적이 있는 작업(또는 매우 유사한 작업)에는 매우 능숙합니다. 저자들은 이 모델이 한 번도 본 적 없는 완전히 새로운 유형의 작업을 처리할 수 있는지에 대해서는 아직 충분히 테스트하지 않았음을 인정합니다. 이 모델은 모방의 달인이지만, 아직 발명의 달인은 아닙니다.

요약 비유

이전의 AI 모델들을 특화된 견습생이라고 생각해 보십시오. 의자만 만들 줄 아는 목수나, 싱크대만 고칠 줄 아는 배관공 같은 존재입니다.
LDM-v0는 수천 개의 목수, 배관공, 전기공, 요리사 영상을 본 슈퍼 견습생과 같습니다. 아직 집을 짓거나 요리를 직접 해본 적은 없지만, 새로운 상황에 직면하면 즉시 "아, 전문 배관공이라면 이렇게 하겠지"라고 떠올리며 정확하게 수행할 수 있는 상태입니다.

이 논문은 이러한 "슈퍼 견습생" 접근 방식이 놀라울 정도로 잘 작동한다는 것을 보여주며, 단 한 번의 거대한 학습 세션을 통해 많은 기술을 배울 수 있는 미래의 AI 시스템을 향한 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →