← 최신 논문
💬 NLP

PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use

PEARL은 오프라인 도구 탐색과 온라인 GRPO(Group Relative Policy Optimization)를 결합하여 복잡한 멀티홉 도구 사용에 대한 대규모 언어 모델의 계획 및 실행 능력을 크게 향상시키고, ToolHop 벤치마크에서 56.5%라는 새로운 최고 성공률을 달성한 혁신적인 2단계 프레임워크입니다.

원저자: Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

게시일 2026-01-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 세상에 대해 아주 많이 알고 있는 매우 똑똑하고 박식한 비서(대규모 언어 모델)가 있다고 상상해 보십시오. 이 비서는 세상의 온갖 일에 대해 말할 수는 있지만, 실제로 손을 써서 무언가를 해본 적은 없습니다. 자동차를 수리하는 법이나 케이크를 굽는 법에 대해 이야기할 수는 있지만, 만약 당신이 그들에게 렌치를 사용하거나 오븐을 사용하라고 요청한다면, 그들은 잘못된 도구를 선택하거나, 다이얼을 반대로 돌리거나, 존재하지 않는 도구를 사용하려고 할 수도 있습니다.

이 논문은 이 "말만 잘하는" 비서를 복잡한 문제를 해결하기 위해 일련의 디지털 도구(API)를 사용할 수 있는 신뢰할 수 있는 "실행가"로 바꾸기 위해 설계된 새로운 훈련 방법인 PEARL을 소개합니다.

PEARL이 어떻게 작동하는지 간단한 개념으로 나누어 설명하면 다음과 같습니다.

문제점: "공상하는" 비서

현재의 AI 비서들은 다단계 작업에서 어려움을 겪는 경우가 많습니다. 만약 당신이 "공원을 찾고, 그 공원을 누가 만들었는지 찾은 다음, 그 이름의 글자 수를 세어줘"라고 요청한다면, 그들은 흔히 다음과 같은 실수를 합니다:

  1. 계획을 잊어버림: 첫 번째 단계 이후에 길을 잃습니다.
  2. 환각 현상(Hallucination): 존재하지 않는 도구를 지어냅니다.
  3. 실수를 저지름: 올바른 도구를 사용하지만 설정값을 잘못 사용합니다(예: 망치로 문을 열려고 하는 것과 같습니다).
  4. 포기함: 실수를 하면 이를 어떻게 수정해야 할지 몰라 제자리에서 뱅뱅 돌기만 합니다.

해결책: PEARL의 2단계 훈련

PEARL은 훈련 과정을 조종사가 비행기를 타기 전에 훈련받는 과정처럼 두 개의 뚜렷한 단계로 나눔으로써 이 문제를 해결합니다.

1단계: "놀이터" (오프라인 도구 탐색)

AI가 실제 사용자의 문제를 해결하기 전, AI는 안전하고 통제된 "놀이터"로 들어갑니다.

  • 비유: 요리를 해본 적이 없는 요리사를 상상해 보십시오. 고객에게 음식을 내놓기 전에, 그는 주방에서 모든 냄비, 팬, 향신료를 하나하나 만져보며 시간을 보냅니다. 그는 가스레인지를 켜고 끄는 법을 시도하고, 재료를 섞어보며 실수를 했을 때 어떤 일이 일어나는지 확인합니다.
  • PEARL이 하는 일: AI는 시행착오를 거치며 사용 가능한 모든 도구를 능동적으로 사용해 봅니다. 이를 통해 AI는 "렌치"(도구)를 정확히 어떻게 잡아야 하는지, 그리고 반대로 돌렸을 때 어떤 일이 발생하는지를 배웁니다. 이는 실제로 작업을 수행해야 할 때 도구를 더듬거리거나 가짜 도구를 만들어내지 않도록 하는 "정신적 사용자 매뉴얼"을 구축해 줍니다.

2단계: "장군" (강화 학습을 통한 전략적 계획)

AI가 도구를 사용하는 법을 익혔다면, 이제 움직임의 순서를 어떻게 계획할지 배워야 합니다.

  • 비유: 체스 선수를 상상해 보십시오. 기물이 어떻게 움직이는지 아는 것(1단계)만으로는 충분하지 않습니다. 승리하기 위해서는 전략이 필요합니다.
  • 혁신 요소: PEARL은 강화 학습(구체적으로 GRGRO)이라는 특별한 훈련 방법을 사용합니다.
    • 단순히 작업이 끝난 후 "잘했어" 또는 "못했어"라고 말하는 대신, 시스템은 AI의 계획 중 매 단계마다 "성적표"를 부여합니다.
    • 만약 AI가 적절한 이유로 적절한 도구를 사용하도록 계획한다면 점수를 얻습니다. 만약 단계를 건너뛰거나 잘못된 도구를 선택하면 점수를 잃습니다.
    • 이는 AI가 무언가를 실행하기 전에 앞을 내다보고 완벽한 "청사진"을 만들 수 있도록 가르칩니다.

결과: 초신뢰형 에이전트

이 논문은 AI가 질문에 답하기 위해 여러 도구를 연쇄적으로 사용해야 하는 두 가지 어려운 벤치마크(ToolHop 및 T-Eval)에서 이 방법을 테스트했습니다.

  • 점수: PEARL은 56.5%의 성공률을 달성하며 새로운 기록(SOTA, State-of-the-Art)을 세웠습니다.
  • 비교: 훨씬 더 크고 비싼 모델(GPT-4o 등) 및 표준 훈련을 통해 "암기"된 모델들을 능가했습니다.
  • 신뢰성: 실제로 도구를 호출할 때 매우 적은 실수(3.8%의 오류율)를 범했는데, 이는 "놀이터" 훈련이 효과적이었음을 증로합니다.

이것이 중요한 이유

이 논문은 PEARL이 "계획"과 "실행"을 분리함으로써 이 문제를 해결한다고 주장합니다. 즉, 전략적으로 생각하는 전용 "플래너(Planner)"와 이미 도구 사용에 숙련된 별도의 "실행가(Executor)"를 훈련시키는 것입니다.

가장 흥-미로운 발견은 플래너가 계획을 세우는 능력이 매우 뛰어나서, 그 계획을 다른 강력한 AI 모델들에게 전달하면 그 모델들도 해당 작업을 훨씬 더 잘 수행하게 된다는 점입니다. 이는 마치 천재적인 장군이 작성한 작전 계획이 있다면, 아무리 경험이 없는 병사라도 그 계획을 따라 전쟁에서 승리할 수 있는 것과 같습니다.

요약하자면: PEARL은 AI에게 먼저 샌드박스 안에서 도구를 사용하는 연습을 하여 도구를 망가뜨리지 않게 가르치고, 그다음 게임을 시작하기 전에 완벽한 단계별 게임 플랜을 작성하는 법을 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →