← 최신 논문
💻 computer science

RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents

RODS는 경계 수준의 과업을 동적으로 식별하고 재샘플링하여 훈련 풀을 공동 진화시키는 보상 주도형 온라인 데이터 합성 프레임워크를 구현함으로써, 훨씬 적은 궤적만으로도 방대한 오프라인 데이터셋에 필적하는 성능을 달성하며 멀티 턴 도구 사용 강화 학습에서의 정보성 샘플 고갈이라는 병목 현상을 해결한다.

원저자: Ruishan Fang, Siyuan Lu, Chenyi Zhuang, Tao Lin

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ruishan Fang, Siyuan Lu, Chenyi Zhuang, Tao Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하지만 경험이 부족한 로봇에게 복잡한 도구들(스마트폰, 자동차, 은행 앱 등)을 사용하여 문제를 해결하는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇이 직접 해보고, 실수도 해보며, 시간이 흐름에 따라 점점 더 나아지는 방식으로 배우기를 원합니다. 이것이 연구자들이 "강화 학습(Reinforcement Learning)"이라고 부르는 것입니다.

하지만 큰 문제가 하나 있습니다: 로봇이 연습할 수 있는 좋은 문제들이 바닥나 버립니다.

문제점: "너무 쉽거나 너무 어려운" 함정

로봇의 학습 여정을 비디오 게임에 비유해 보겠습니다.

  • 쉬운 단계: 만약 로봇에게 이미 할 줄 아는 작업(예: "불 켜기")을 준다면, 로봇은 매번 성공할 것입니다. 하지만 새로운 것을 배울 수 없습니다. 도전 과제가 없기 때문입니다.
  • 불가능한 단계: 만약 작업이 너무 어렵다면(예: 렌치를 잡는 법조차 모르는데 "로켓을 처음부터 제작하기"를 시키는 경우), 로봇은 매번 실패할 것입니다. 로봇은 어디서부터 시작해야 할지 알 수 없기에 좌절하게 되고, 아무것도 배우지 못합니다.
  • 스위트 스팟 (최적의 지점): 로봇은 작업이 딱 적당할 때 가장 잘 배웁니다. 즉, 성공과 실패의 확률이 50/50인 지점입니다. 이곳에서 뇌(또는 AI)는 개선을 위한 가장 유용한 "피드백 신호"를 얻습니다.

이 논문은 기존 방식들이 **정적인 라이브러리(static library)**를 사용한다고 주장합니다. 로봇이 라이브러리에 있는 "중간 난이도" 문제를 마스터하고 나면, 그 라이브러리는 쓸모가 없어집니다. 로봇은 자신이 이미 풀 수 있는 문제(지루함)를 보거나, 아직 풀 수 없는 문제(불가능함)를 마주하며 멍하니 서 있게 됩니다. "좋은" 문제들이 사라져 버리는 것입니다.

해결책: RODS (자기 생성형 체육관)

저자들은 RODS(Reward-Driven Online Data Synthesis)라고 불리는 새로운 시스템을 제안합니다. 정적인 라이브러리를 사용하는 대신, RODS는 마치 선수의 수행 능력에 맞춰 실시간으로 새로운 운동법을 만들어내는 개인 트레이너와 같습니다.

RODS가 작동하는 방식은 다음과 같습니다. 쉬운 비유를 들어 설명하겠습니다.

1. 경계 탐지기 (스위트 스팟 찾기)

RODS는 로봇의 수행 능력을 끊임없이 관찰합니다. 로봇이 얼마나 자주 성공하는지를 보기 위해 "진전 보상(Progress Reward)"이라는 특별한 지표를 사용합니다.

  • 로봇이 100%의 확률로 성공한다면, 그 작업은 너무 쉽습니다.
  • 로봇이 100%의 확률로 실패한다면, 그 작업은 너무 어렵습니다.
  • RODS는 50% 구간을 찾습니다. 로봇이 배우기 위해 딱 적당히 고군분투하면서도, 그렇다고 절망적이지는 않은 특정 작업들을 식별합니다. 이것이 바로 "경계(boundary)" 작업입니다.

2. 모양 변형기 (새로운 문제 생성)

RODS는 "경계" 작업을 찾으면 단순히 로봇에게 같은 문제를 다시 주는 것이 아닙니다. RODS는 창의적인 요리사처럼 완벽한 레시피(시드 작업)를 가져와서, 그 구조는 유지하되 재료만 바꾼 새로운 요리를 만들어냅니다.

  • 예시: 만약 로봇이 "파리로 가는 항공권을 예약하고 택시를 부르는" 작업에서 어려움을 겪었다면, RODS는 새로운 작업인 "런던으로 가는 기차를 예약하고 피자를 주문하기"를 생성합니다.
  • 난이도(단계의 수, 의존성)는 정확히 동일하게 유지되지만, **이야기(스토리)**는 완전히 새롭습니다. 이는 로봇이 특정 정답을 암기하는 것이 아니라, 작업의 논리를 배우도록 강제합니다.

3. 동적 라이브러리 (신선한 선반 유지하기)

RODS는 슬라이딩 윈도우(sliding window) 역할을 하는 "리플레이 버퍼(replay buffer, 훈련 풀)"를 관리합니다.

  • 로봇이 특정 작업에 능숙해지면, 그 작업은 이제 "너무 쉽다"고 판단되어 풀에서 쫓겨납니다.
  • 그 자리에 새롭게 합성된 "경계" 작업들이 미끄러지듯 들어옵니다.
  • 이를 통해 로봇은 항상 자신의 능력치 경계선에서 훈련하게 되며, 이미 알고 있는 것들에 시간을 낭비하거나 도저히 할 수 없는 것에 매달리는 일을 방지합니다.

결과: 작은 라이브러리, 거대한 뇌

이 논문은 단 400개의 인간 작성 예시라는 매우 작은 시작 세트로 이 시스템을 테스트했습니다.

  • 기존 방식: 유사한 결과를 얻기 위해 다른 시스템들은 17,000개의 예시가 담긴 거대한 라이브러리가 필요했습니다.
  • RODS 방식: 끊임없이 타겟팅된 새로운 연습 문제를 생성함으로써, RODS는 약 20배 적은 데이터를 사용하고도 동일하거나 더 나은 성능을 달 ext했습니다.

핵심 요약

이 논문은 더 크고 더 큰 라이브러리를 구축하려고 노력하는 대신, AI를 위해 매 순간 최적의 도전 과제를 동적으로 생성하는 시스템을 구축해야 한다고 주장합니다. 이는 학생에게 고정된 장(chapter)이 있는 교과서를 주는 것과, 학생이 어제 틀린 문제를 바탕으로 매일 맞춤형 퀴즈를 써주는 튜터를 붙여주는 것의 차이와 같습니다.

핵적인 결론: RODS는 "좋은 연습 문제가 바닥나는" 문제를 해결합니다. 최고의 연습이란 고정된 문제 목록이 아니라, 학습자의 성장하는 기술과 함께 끊임없이 움직이는 목표라는 점을 깨달았기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →