← 최신 논문
💬 NLP

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments

이 논문은 상태 저장 서버 라이브러리, 의존성 기반 데이터 합성 파이프라인, 그리고 새로운 프로그래밍 방식의 보상 시스템을 결합하여 실시간 환경에서 다단계 도구 사용을 위한 효과적인 강화 학습을 가능하게 하는 프레임워크인 PROVE를 소개하며, 이는 여러 벤치마크와 모델 제품군에 걸쳐 상당한 성능 향상을 결과로 가져왔다.

원저자: Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 경험은 부족한 도제에게 실제 집을 수리하기 위해 거대하고 복잡한 공구함을 사용하는 법을 가르치고 있다고 상상해 보십시오. 목표는 도제가 단순히 올바른 도구를 고르는 것뿐만 아니라, 올바른 순서로 사용하는 법, 실수를 처리하는 법, 그리고 자신이 무엇을 해야 할지 모를 때 멈추는 법을 배우는 것입니다.

PROVE라는 제목의 이 논문은 AI 모델(도제)이 정확히 이와 같이 수행할 수 있도록 훈련하는 새로운 방법을 설명합니다. 저자들은 이전 방식들이 세 가지 주요 이유로 실패하고 있다는 것을 발견했으며, 이를 해결하기 위해 새로운 시스템을 구축했습니다.

다음은 쉬운 비유를 사용한 그들의 해결책에 대한 요약입니다:

해결한 세 가지 문제점

  1. "가짜 집" 문제:

    • 기존 방식: 대부분의 훈련은 "시뮬레이션"이나 정적인 지도에서 이루어졌습니다. 이는 마치 집의 그림을 보고 연습하는 것과 같았습니다. 만약 도제가 실제로는 존재하지 않는 문을 열려고 시도한다면, 시스템은 훨씬 나중에야 그것이 틀렸다는 것을 알게 됩니다.
    • 해결책: PROVE는 Live MCP 환경을 사용합니다. 이것은 도제에게 실제 배관과 전기가 있는 실제 집에서 훈련시키는 것과 같습니다. 만약 그들이 전구가 없는 곳에서 불을 켜려고 한다면, 시스템은 즉시 "그것은 작동하지 않았습니다"라고 말합니다. 이는 실시간으로, 실제 결과와 함께 일어납니다.
  2. "가상의 가구" 문제:

    • 기존 방식: 연습 문제를 생성할 때, 컴퓨터는 종종 가짜 세부 정보를 만들어냈습니다. 예를 들어, "404번 방에 있는 빨간 의자를 옮기세요"라고 요청했지만, 404번 방은 존재하지도 않고 빨간 의자도 없었습니다. 도제는 명령을 따르려다 즉시 실패하게 됩니다.
    • 해결책: 그들은 Grounded Data Pipeline을 구축했습니다. 질문을 던지기 전에, 시스템은 먼저 "집"을 확인하여 실제로 어떤 가구가 존재하는지 살핍니다. 만약 101번 방에 빨간 의자가 있다면, 시스템은 "101번 방의 빨간 의자를 옮기세요"라고 요청합니다. 이를 통해 모든 연습 과제가 완수 가능하도록 보장합니다.
  3. "수다쟁이" 문제:

    • 기 기존 방식: 보상 시스템이 마치 학생이 체크리스트의 모든 항목을 하나하나 다 체크해야만 금메달을 주는 선생님과 같았습니다. 이는 학생이 신중하게 생각하기보다, 우연히라도 맞는 것을 맞추기 위해 자신이 아는 모든 도구를 마구 호출하도록 유도하여 게으르게 만들었습니다.
    • 해결책: 그들은 Programmatic Reward System을 만들었습니다. 단순히 올바른 도구가 사용되었는지만 확인하는 대신, 새로운 시스템은 도제가 다음을 수행했을 때 보상을 줍니다:
      • 유효성(Validity): 도구가 실제로 작동했는가?
      • 범위(Coverage): 필요한 모든 단계를 수행했는가?
      • 효율성(Efficiency): 시간을 낭비하거나 불필요한 추가 호출을 하지 않고 수행했는가? (이것이 "안티-수다쟁이" 규칙입니다.)
      • 정밀도(Precision): 올바른 도구 이름과 설정을 사용했는가?

시스템 작동 방식 (The "Coach")

저자들은 훈련 세션을 운영하는 "코치"(상태 머신 오케스트레이터)를 구축했습니다:

  1. 지도: 코치는 먼저 도구들이 서로 어떻게 의존하는지(예: 돈을 송금하기 전에 반드시 "잔액 확인"을 해야 함)에 대한 지도를 그립니다.
  2. 정찰: 코치는 질문에 사용할 실제 아이템을 찾기 위해 라이브 환경을 살펴봅니다.
  3. 연습: 코치는 AI에게 다단계 질문을 던집니다. AI는 도구를 호출하여 문제를 해결하려고 시도합니다.
  4. 성적표: 시스템은 다른 AI를 사용하여 작업을 채점하지 않습니다(이는 느리고 비용이 많이 듭니다). 대신, 코드를 사용하여 즉시 확인합니다: "도구가 실행되었는가? 올바른 데이터를 반환했는가? 단계를 너무 많이 사용했는가?"
  5. 루프: AI는 점수를 받고 다시 시도하며, 매번 더 발전합니다.

결과

팀은 네 가지 서로 다른 AI 모델(소형부터 중형까지)을 테스트했습니다. 그들은 수백만 개의 예시가 필요하지 않았으며, 약 13,000개의 고품질 연습 세션을 사용했습니다.

결과는 인상적이었습니다:

  • 모델들은 다단계 문제를 해결하는 능력이 눈에 띄게 향고되었습니다.
  • 세 가지 주요 테스트(BFCL, τ 2-bench, T-Eval)에서 최대 10점까지 향상되었습니다.
  • 결정적으로, 모델들은 효율적으로 변했습니다. 불필요한 도구 호출을 멈추고, 무턱대고 추측하는 대신 정보가 충분하지 않을 때는 멈추는 법을 배웠습니다.

핵심 결론

이 논문은 로봇에게 도구 사용법을 가르치기 위해 거대한 인간 주석가 군단이나 초지능적인 "판사 AI"가 필요하지 않다는 것을 증명합니다. 대신, 그들에게 연습할 수 있는 실제 환경과, 작업할 수 있는 실제 데이터, 그리고 효율성을 보상하는 스마트한 점수 시스템을 제공한다면, 매우 빠르게 복잡한 과업을 조율하는 법을 배울 수 있습니다.

핵심적인 교훈은, 현실 세계에서 도구를 사용하는 AI를 가르칠 때 데이터의 양보다 **훈련의 질(실제 상태, 실제 보상)**이 더 중요하다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →