← 최신 논문
🤖 AI

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

이 논문은 약 400개의 실제 프로토콜로부터 방대한 훈련 환경을 자동으로 구축하고, 도구 의존성 그래프를 통해 장기 과제를 생성하며, LLM의 복잡하고 역동적인 도구 통합 시나리오에서의 강건성과 추론 능력을 크게 향상시키는 Turn-Aware Relative Advantage 알고리즘을 채택함으로써 에이전트 강화 학습을 확장하는 포괄적인 프레임워크인 ToolVerse를 소개한다.

원저자: Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, feng hong, Cao Liu, Ke Zeng

게시일 2026-07-20
📖 6 분 읽기🧠 심층 분석

원저자: Shuaiyu Zhou, Fengpeng Yue, Zengjie Hu, Yuanzhe Shen, Chenyang Zhang, feng hong, Cao Liu, Ke Zeng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하고 빠른 로봇에게 거대하고 혼란스러운 도시를 항해하는 법을 가르치고 있다고 상상해 보세요. 처음부터 수백만 개의 상점, 신호등, 낯선 사람들이 북적이는 대도시에 로봇을 떨어뜨리지는 않을 것입니다. 로봇은 즉시 길을 잃고 말 것입니다. 대신, 당신은 아마도 로봇이 빵을 사거나 길을 묻는 법을 배울 수 있는 작고 조용한 마을에서 시작할 것입니다. 이것은 과학자들이 "AI 에이전트(AI agents)"를 훈련할 때 하는 일과 본질적으로 같습니다. AI 에이전트는 인간처럼 행동하며 결정을 내리고 문제를 해결하기 위해 도구를 사용하는 컴퓨터 프로그램입니다. 이 에이전트들은 인터넷의 거의 모든 것을 읽은 초지능적인 뇌와 같은 '대규모 언어 모델(LLM)'을 기반으로 작동합니다. 이들은 대화를 나누거나 간단한 퍼즐을 푸는 데는 뛰어나지만, 복잡하고 다단계적인 임무를 처리해야 하는 무질서한 실제 환경에 던져지면 종종 비틀거리곤 합니다. 연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 이 디지털 뇌들이 혼란에 빠지거나 포기하지 않고 길고 복잡한 여정을 처리하도록 가르칠 수 있을까?

여기에 AI 에이전트를 위한 궁극적인 "훈련 도시"로 설계된 새로운 프레임워크인 ToolVerse가 등장합니다. 이것을 약 422개의 서로 다른 실제 도구 키트와 약 4,438개의 서로 다른 도구를 포함하여, 거대하고 자동화된 건설팀이 만든 광활하고 상호작용 가능한 놀이터라고 생각해보세요. AI가 그저 목적 없이 방황하게 두는 대신, ToolVerse는 "도구 의존성 그래프(Tool Dependency Graph)"라는 특정한 지도를 만듭니다. 이것은 마치 보물 찾기와 같습니다. 마지막에 있는 상자를 열려면 먼저 열쇠를 찾아야 하고, 열쇠를 찾으려면 수수께러를 풀어야 하는 것과 같습니다. 이 시스템은 "동적 잠금 해제(Dynamic Unlocking)"라는 영리한 방법을 사용하여 긴 다단계 퀘스트를 생성하며, 이를 통해 AI가 논리적인 순서에 따라 서로 다른 도구들 사이의 연결 고리를 학습하도록 보장합니다.

하지만 한 가지 문제가 있습니다. AI가 문제를 해결하는 데 오랜 시간이 걸릴 때, 어떤 단계가 천재적인 움직임이었고 어떤 단계가 실수였는지 정확히 알기가 어렵다는 점입니다. 이는 마치 학생이 화이트보드에 수학 문제를 푸는 것을 지켜보는 것과 같습니다. 만약 최종 답이 맞았다면, 그것은 세 번째 단계에서 운 좋게 맞춘 것일까요, 아니면 일곱 번째 단계에서의 놀라운 통찰력 덕분일까요? 이를 해결하기 위해 연구자들은 "턴 인지 상대적 이점(Turn-Aware Relative Advantage)"이라는 새로운 점수 산정 시스템을 도입했습니다. 단순히 마지막에 성적을 매기는 대신, 이 시스템은 매 단계마다 AI에게 작은 "하이파이브"를 주거나 부드럽게 "다시 시도해봐"라고 말합니다. 이때 AI의 움직임을 그 순간에 수행 중인 다른 AI 에이전트들의 움직임과 비교합니다. 이를 통해 AI는 훨씬 더 빠르고 정확하게 학습할 수 있습니다. 결과에 따르면, 이 접근 방식은 AI가 복잡하고 긴 호흡의 과제를 처리하는 능력을 크게 향상시켜, 서툰 초보자를 번화한 도시를 항해할 수 있는 자신감 넘치는 탐험가로 변화시킨다고 합니다.

문제점: 왜 AI는 대도시에서 길을 잃는가?

한동안 AI 에이전트들은 작고 통제된 환경에서는 훌륭한 성능을 보여왔습니다. 규칙이 단순하고 경로가 짧다면 코드를 작성하거나 웹 검색을 할 수 있습니다. 하지만 현실 세계는 조용한 마을이 아니라 혼란스러운 메트로폴리스입니다. 연구자들이 여러 도구를 특정 순서대로 사용해야 하는 크고 복 복잡한 작업을 처리하도록 AI 에이전트를 만들려고 했을 때, 상황은 무너졌습니다.

이 논문은 AI가 이러한 "거대한 환경"에서 어려움을 겪는 세 가지 주요 이유를 밝혀냈습니다:

  1. 너무 작은 놀이터: 대부분의 훈련 환경은 AI가 계산기나 검색 엔진 같은 한두 개의 도구만 사용하도록 제한합니다. 하지만 실제 삶은 수십 개의 도구를 동시에 다루는 것을 요구합니다.
  2. 퀘스트 설계의 어려움: 긴 추론 체인(예: "여행 계획을 짜고, 호텔을 예약한 다음, 티켓을 구매한다")을 요구하는 과제를 만드는 것은 매우 어렵습니다. AI가 단계를 하나라도 틀리면 전체 계획이 무너지며, 어떻게 다시 회복하는지 가르치기도 어렵습니다.
  3. "누구의 잘못인가?" 문제: 긴 작업 과정에서 어떤 구체적인 행동이 성공이나 실패를 이끌었는지 알기 어렵습니다. 만약 AI가 20단계 후에 실패했다면, 그것은 1단계 때문일까요, 아니면 19단계 때문일까요? 전통적인 훈련 방식은 종종 마지막에만 보상을 주는데, 이는 학생에게 어느 문제를 틀렸는지 알려주지 않고 그냥 "시험에 떨어졌다"라고 말하는 것과 같습니다.

해결책: 궁극의 훈련장 구축

이 문제를 해결하기 위해 연구자들은 ToolVerse를 구축했습니다. 이것은 단순한 하나의 환경이 아니라, 환경을 만들어내는 공장입니다.

1. 도구 공장 (The Tool Factory)
팀은 거의 422개의 실제 도구 정의(오픈 소스 프로젝트 및 기타 저장소로부터 가져온 것)를 모았습니다. 그들은 정적인 정의들을 실제로 실행 가능한 도구로 바꾸는 자동화된 파이프라인을 만들었습니다. 지침을 정리하고, 모의 데이터베이스(가짜 인벤토리나 사용자 프로필 등)를 구축했으며, 모든 도구가 실제로 작동하도록 코드를 작성했습니다. 그 결과, AI가 실제로 사용하고 상호작용할 수 있는 약 4,438개의 도구를 가진 다양하고 거대한 세계가 탄생했습니다.

2. 보물 찾기 지도 (GUST 데이터셋)
단순히 도구가 있는 것만으로는 부족합니다. AI에게는 도구를 사용해야 할 이유가 필요합니다. 연구자들은 "도구 의존성 그래프"를 사용하여 과제를 생성하는 새로운 방법을 설계했습니다. 모든 도구가 노드가 되고, 화살표가 어떤 도구를 먼저 사용해야 하는지를 보여주는 그래프를 상상해 보세요.

  • 동적 잠금 해제 (Dynamic Unlocking): 그들은 도구를 하나씩 "잠금 해제"하는 특별한 알고리즘을 사용했습니다. "호텔 예약" 도구를 사용하려면 먼저 "항공편 검색" 도구를 사용해야 합니다. 이는 AI가 논리적인 순서를 학습하도록 강제합니다.
  • GUST 데이터셋: 이 과정은 GUST(Graph Unlocking Sampling Tasks)라는 데이터셋을 생성했습니다. 이것은 무작위 질문이 아닙니다. 여러 단계를 연결하고, 한 도구에서 얻은 정보를 다음 도구로 전달해야 하는 정교하게 설계된 장기적 관점의 과제들입니다.

3. "턴 인지" 코치 (TARA)
이것은 아마도 가장 영리한 부분일 것입니다. 표준 훈련에서는 AI가 긴 작업이 끝난 후에 단 하나의 점수를 받습니다. ToolVerse는 **턴 인지 상대적 이점(Turn-Aware Relative Advantage, TARA)**을 도입합니다.

  • 작동 방식: 마지막까지 기다리는 대신, 시스템은 *매 턴(모든 단계)*마다 AI의 성과를 확인합니다.
  • 비교: 시스템은 동일한 과제를 수행 중인 다른 AI 에이전트들의 움직임과 해당 AI의 움직임을 비교합니다. 만약 당신의 AI가 다른 이들에 비해 좋은 움직임을 보였다면 보너스를 받고, 나쁜 움직임을 보였다면 페널티를 받습니다.
  • 문지기 (The Gatekeeper): 그들은 "일관성 게이트(consistency gate)"를 추가했습니다. 만약 AI가 1단계에서 실수를 했다면, 시스템은 2단계부터 10단계까지 발생하는 어떤 "운 좋은" 성공에 대해서도 점수를 주지 않습니다. 이는 AI가 "지금은 좀 망쳐도 나중에 만회하면 된다"라고 학습하는 것을 방지합니다. 이는 AI가 성공하기 위해 반드시 모든 단계를 제대로 수행하도록 강제합니다.

연구 결과

연구자들은 여러 AI 모델(Qwen3 및 Qwen2.5 포함)을 대상으로 실험을 진행하고 이를 다른 방법들과 비교했습니다.

  • 장기 과제 수행 능력 향력: ToolVerse와 TARA 알고리즘으로 훈련된 모델은 표준 방식으로 훈련된 모델보다 복잡한 다단계 벤치마크에서 현저히 우수한 성능을 보였습니다. 예를 들어, ACEBench-Agent라는 테스트에서 모델은 새로운 훈련 방식을 사용함으로써 점수가 13점 이상 향상되었습니다.
  • "턴 인지" 코치의 힘: 새로운 TARA 방식과 표준 "그룹 상대적 정책 최적화(GRPO)"를 비교했을 때, TARA가 일관되게 승리했습니다. 이는 보상을 작은 단계별 피드백으로 나누는 것이 마지막에 최종 성적을 받는 것보다 훨씬 효과적임을 시사합니다.
  • 더 많은 도구 = 더 나은 뇌: 그들은 더 다양한 환경(100개에서 422개의 도구 세트로 확장)에서 훈련할수록 AI가 더 견고해지고 보지 못한 새로운 과제에도 더 잘 일반화된다는 것을 발견했습니다.

결론

ToolVerse는 AI 에이전트가 진정으로 현실 세계를 다룰 수 있게 하려면, 단순히 작고 단순한 방에서 훈련하는 것을 멈추고, 명확한 지도와 즉각적인 피드백이 있는 거대하고 복잡한 도시를 만들어야 한다는 점을 시사합니다. 환경 생성을 자동화하고 모든 움직임을 지켜보는 "코치"를 제공함으로써, 연구자들은 AI가 길을 잃지 않고 길고 복잡한 과제를 추론할 수 있는 유망한 경로를 보여주었습니다. 비록 이 작업이 아직 연구 단계에 있고 시뮬레이션과 특정 벤치마크에 의존하고 있지만, 결과는 이 접근 방식이 차세대 진정한 자율 AI 어시스턴트의 핵심 요소가 될 수 있음을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →