GOAT: A Training Framework for Goal-Oriented Agent with Tools
본 논문은 문서에서 목표 지향적 API 실행 데이터를 자동으로 합성하여 인간 주석이 없이 오픈소스 LLM 에이전트를 복잡한 도구 사용에 맞게 미세 조정할 수 있는 새로운 학습 프레임워크인 GOAT 를 소개하며, 기존 벤치마크와 새로 제안된 GOATBench 에서 최첨단 성능을 달성함을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하고 독서량이 풍부한 사서 (AI) 가 책을 읽고 이야기를 쓰는 법을 안다고 가정해 봅시다. 하지만 이 사서에게 도서관 뒷방으로 가서 특정 낡은 지도 상자를 찾고, 특정 페이지를 꺼내어, 그 페이지를 이용해 요리책에서 특정 레시피를 찾도록 요청하면, 사서는 종종 길을 잃습니다. 잘못된 상자를 고르거나, 잘못된 책을 열거나, 지도 페이지를 부엌으로 가져가는 것을 잊어버릴 수 있습니다.
이것은 현재 AI 에이전트가 '도구'(데이터베이스, 날씨 서비스, 영화 목록 등에 대한 디지털 연결인 API 등) 를 사용하려 할 때 겪는 문제입니다. 그들은 대화하는 데는 뛰어나지만, 이전 단계의 결과에 완전히 의존하는 다단계 미션을 계획하는 데는 매우 서툴러요.
이 논문은 그 당황스러운 사서를 명탐정으로 바꾸도록 설계된 새로운 훈련 방법인 GOAT(Goal-Oriented Agent with Tools, 도구를 활용한 목표 지향적 에이전트) 를 소개합니다. 간단한 비유를 들어 작동 방식을 설명해 보겠습니다:
문제: "맞추기 게임"
보통 AI 가 도구를 사용하도록 가르치기 위해 연구자들은 수천 개의 예시를 인간이 작성해야 합니다. 예를 들어: "먼저 날씨 API 에 비에 대해 문의하세요. 그런 다음 그 '비' 답변을 받아 옷차림 API 에 비옷을 문의하세요."
이 과정은 비용이 많이 들고 느립니다. 이러한 인간이 작성한 예시 없이 AI 모델은 그저 추측할 뿐입니다. 그들은 여러 단계를 연결해야 하는 복잡한 작업에서 자주 실패합니다.
해결책: "역공학" 부엌
GOAT 의 저자들은 인간이 지시를 작성할 필요가 없다는 것을 깨달았습니다. 그들은 이미 '요리책'(API 문서) 을 가지고 있었기 때문입니다. 완성된 요리에서 레시피를 추측하라고 AI 에게 요청하는 대신, 먼저 요리를 만든 다음 레시피를 설명하는 방식을 선택했습니다.
그들은 "호출 우선(Call-First)" 전략을 사용합니다:
- 부엌 지도 그리기: 먼저 시스템이 모든 API 매뉴얼을 읽고 도구들이 어떻게 연결되는지 지도를 그립니다. (예: '날씨' 도구의 출력이 '우산' 도구의 입력과 완벽하게 들어맞음)
- 식사 준비 (호출 우선 단계): 시스템은 이 지도상의 경로를 선택하고 도구를 실제로 실행합니다. 날씨 도구에게 데이터를 요청하고 결과를 받은 후, 즉시 그 결과를 이용해 우산 도구에게 요청합니다. 추측하지 않고 실제 단계를 실행하여 실제 답변을 얻습니다.
- 레시피 작성 (추상화 단계): 도구들이 작업을 마친 후, AI 는 완료된 사건 연쇄를 살펴보고 이에 부합하는 사용자 쿼리를 작성합니다. 본질적으로 "아, 방금 비옷을 찾기 위해 이 모든 단계를 거쳤구나. 그러니까 사용자가 '비가 오면 무엇을 입어야 할까?'라고 묻는 것이 내가 방금 해결한 문제구나"라고 말하는 것입니다.
이렇게 역방향으로 (행동 질문) 수행함으로써 AI 는 인간이 지시를 작성할 필요 없이 도구들이 어떻게 연결되는지 올바른 논리를 학습합니다. 먼저 작업을 수행한 다음 무엇을 했는지 설명함으로써 학습하는 것입니다.
결과: 슈퍼 도우미
이 논문은 여러 도전 과제에서 이 새로운 'GOAT'로 훈련된 에이전트들을 테스트했습니다:
- RestBench 및 API-Bank: 이는 AI 가 도구들의 연쇄를 이용해 영화 리뷰나 음악 추천을 찾아야 하는 시험과 같습니다.
- GOAT-Bench: 저자들은 이러한 유형의 복잡하고 다단계인 작업을 위해 특별히 새로이 더 큰 시험을 만들었습니다.
결과는 명확했습니다:
- 오픈소스 모델: GOAT 이전에는, 무료이며 누구나 이용할 수 있는 작은 오픈소스 AI 모델들이 이러한 복잡한 작업에서 거의 쓸모없었습니다. 거의 100% 실패했습니다.
- GOAT 이후: 이 새로운 방법으로 훈련된 후, 동일한 오픈소스 모델들이 해당 작업에서 놀라울 정도로 뛰어나게 되었습니다. 어떤 경우에는 이러한 테스트를 주로 장악하는 비싸고 폐쇄형 모델 (GPT-4 등) 보다 더 좋은 성과를 내기도 했습니다.
- 인간 불필요: 전체 훈련 데이터셋은 API 매뉴얼을 이용해 시스템이 자동으로 구축되었습니다. 인간이 앉아 단계별 지시를 작성할 필요가 없었습니다.
결론
GOAT 는 AI 에이전트들이 실제 작업을 먼저 연습하게 한 다음 목표에 대해 설명하도록 가르쳐, 도구 사용 및 계획을 가능하게 하는 방법입니다. 이는 값비싼 인간 교사 없이도 오픈소스 AI 모델을 '무식한 추측꾼'에서 '신뢰할 수 있는 계획자'로 바꿉니다. 저자들은 코드와 새로운 테스트 스위트 (GOAT-Bench) 를 다른 사람들이 사용할 수 있도록 공개했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.