← 최신 논문
🤖 AI

MidTool: Mid-training Data Synthesis for Agentic Tool Use

본 논문은 대규모 언어 모델을 위한 전용 중간 학습(mid-training)을 가능하게 하기 위해 다양한 데이터를 합성하는 오픈 코퍼스 구축 파이프라인인 MidTool을 소개하며, 이 접근 방식이 사후 학습(post-training)에만 의존하는 것보다 일반적인 에이전트 도구 사용 능력을 유의미하게 향상시킨다는 점을 입증한다.

원저자: Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang, Canwen Xu, Zhewei Yao, Radha Poovendran, Yuxiong He

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang, Canwen Xu, Zhewei Yao, Radha Poovendran, Yuxiong He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 인간과 유사한 유창함으로 읽고, 쓰고, 추론할 수 있는 차세대 디지털 비서의 엔진입니다. 이러한 시스템이 진정으로 유용해지려면 단순히 질문에 답하는 것을 넘어 행동할 수 있어야 합니다. 이는 계산기, 검색 엔진 또는 소프트웨어 인터페이스와 같은 도구를 언제 가져다 써야 하는지 알고, 문제를 해결하기 위해 이를 올바르게 사용하는 것을 의미합니다. 현재 인공지능 분야에서 연구자들은 대개 이러한 도구 사용 능력을 훈련의 마지막 단계로 취급해 왔습니다. 그들은 강력하게 사전 학습된 모델을 가져온 뒤, 미세 조정(fine-tuning) 과정을 통해 모델이 함수를 호출하거나 소프트웨어와 상호작용하는 방법을 구체적으로 가르칩니다. 그러나 이러한 접근 방식은 모델이 일련의 행동을 계획하거나 누락된 정보로부터 회복하는 것과 같은 복잡한 행동을 한꺼번에 학습하도록 강요하며, 그 과정에서 해당 도구가 실제 세계에서 실제로 어떻게 작동하는지에 대한 깊은 기초 없이 마지막 단계에 과도한 부담을 지웁나다.

워싱턴 대학교와 스노우플레이크(Snowflake)의 연구진은 다른 경로를 제안했습니다. 그들은 도구를 사용하는 능력이 모델 생애의 초기 단계인 광범위한 학습과 최종적인 전문 지시 학습 사이의 중간 단계에서 배양되어야 한다고 주장합니다. 그들은 이 과정을 "미드 트레이닝(mid-training)"이라고 부릅니다. 이 아이디어를 테스트하기 위해, 그들은 모델에게 도구와 상호작용하는 법을 가르치기 위해 설계된 거대하고 맞춤화된 데이터셋을 구축했습니다. 그들은 이 프로젝트를 "MidTool"이라고 명명했습니다. 모델에 이 특화된 데이터를 최종 훈련 단계 이전에 주입함으로써, 연구진은 모델이 도구를 더 효과적으로 사용하고, 행동을 계획하며, 오류를 처리하는 능력이 표준적인 최종 훈련만을 받은 모델보다 더 뛰어나다는 것을 발견했습니다.

연구진은 먼저 도구가 어떻게 작동하는지에 대한 원천 지식을 포함하는 다양한 자료를 수집했습니다. 그들은 단순히 도구가 사용되는 사례만을 찾은 것이 아니라, 도구가 어떻게 작동해야 하는지를 설명하는 매뉴얼, 코드, 문서 및 기술 사양을 수집했습니다. 여기에는 수백만 개의 웹 페이지, 수천 개의 PDF 형식 기술 문서, 방대한 컴퓨터 코드 저장소, 그리고 실제 애플리케이션 프로그래밍 인터페이스(API)의 구조화된 정의가 포함되었습니다. 그들은 이러한 소스들을 AI 학생들을 위한 "교과서"로 취급했습니다. 이 원재료로부터 연구진은 203억 토큰(처리된 텍스트의 양을 측정하는 단위) 규모의 훈련 혼합물을 만들었습니다. 이 혼합물은 웹 문서에서 약 42%, 코드에서 26%, PDF에서 23%, 그리고 에이전트가 도구를 사용하는 직접적인 합성 예시에서 9%를 끌어와 정교하게 균형을 맞추어 구성되었습니다.

이 정적인 문서 모음을 역동적인 학습 경험으로 바꾸기 위해, 연구진은 두 가지 접근 방식을 사용했습니다. 첫 번째 방법은 '그라운딩(grounding, 접지)'에 초점을 맞췄습니다. 그들은 기술 문서와 코드를 가져와 모델에게 해당 텍스트에 기술된 도구를 사용해야 하는 시나리오를 상상하도록 했습니다. 모델은 복잡한 매뉴얼이나 까다로운 코드 스니펫을 읽고, 어떤 도구를 사용할 수 있는지 식별하며, 그 도구를 사용하기 위해 어떤 정보가 필요한지 파악하는 법을 배워야 했습니다. 이는 모델이 맥락에 기반하여 도구의 "어포던스(affordance, 행동 유도성)"—즉, 도구가 무엇을 할 수 있는지—를 인식하도록 가르쳤습니다. 두 번째 방법은 '실행(execution)'에 초점을 맞췄습니다. 여기서 연구진은 실제 도구 정의를 사용하여 에이전트가 문제를 해결하는 단계별 이야기를 생성했습니다. 이 이야기에는 에이전트가 계획을 세우고, 도구를 호출하고, 응답을 받고, 그다음 무엇을 할지 결정하는 과정이 포함되었습니다. 결정적으로, 이러한 예시에는 정보가 누락되거나 도구가 실패하는 시나리오도 포함되어, 모델이 포기하거나 추측하는 대신 어떻게 회복하고 명확한 설명을 요청하는지를 가르쳤습니다.

연구팀은 40억 개의 파라미터를 가진 버전과 80억 개의 파라미터를 가진 버전, 두 가지 버전의 베이스 언어 모델을 사용하여 이 접근 방식을 테스트했습니다. 그들은 이 모델들을 새로운 MidTool 데이터셋으로 훈련시킨 후, 다른 연구자들이 사용하는 표준적인 최종 훈련 단계를 적용했습니다. 그 후, AI가 도구를 얼마나 잘 사용하는지 측정하기 위해 설계된 세 가지 벤치마크로 모델을 테스트했습니다. 이 테스트는 단순한 단일 단계 명령부터 실제 소프트웨어 환경과 상호작용해야 하는 복잡한 다단계 작업까지 다양했습니다. 결과는 명확한 패턴을 보여주었습니다. 미드 트레이닝을 거친 모델들이 그렇지 않은 모델들보다 일관되게 우수한 성능을 보였습니다. 개선은 특히 여러 단계가 필요하거나 익숙하지 않은 도구를 다뤄야 하는 어려운 작업에서 가장 두드러졌습니다. 예를 들어, 다회차 대화에서 도구를 사용하는 능력을 측정하는 테스트에서, 40억 파라미터 모델은 최종 훈련만을 받은 모델에 비해 점수가 10점 이상 상승했습니다.

연구는 또한 이 접근 방식의 한계도 밝혀냈습니다. 미드 트레이닝된 모델들이 일반적인 도구 사용 능력은 크게 향상되었지만, 모든 유형의 작업에서 전문가가 된 것은 아니었습니다. 심층적이고 반복적인 웹 검색을 포함하는 특정 벤치마크에서 테스트했을 때, 모델들은 동일한 수준의 개선을 보이지 않았습니다. 이는 일반적인 기초가 도구 사용법을 이해하고 지시를 따르는 데 도움을 주기는 하지만, 심층 연구나 복잡한 탐색과 같은 고도로 전문화된 행동은 별도의 전용 훈련 데이터가 필요할 수 있음을 시사합니다. 연구진은 미드 트레이닝이 강력하고 안정적인 기반을 제공하여 후속 최종 훈련을 더 효율적으로 만든다는 것을 발견했습니다. 모델들은 더 빠르게 수렴하고 더 높은 수준의 성능에 도달했는데, 이는 미드 트레이닝 단계가 도구들이 서로 어떻게 연결되는지에 대한 더 나은 내부적 이해를 구축하는 데 도움이 되었음을 나타냅니다.

이 연구는 도구 사용이 모델 개발의 맨 마지막에 추가되는 단순한 기술이라는 기존의 가설에 도전합니다. 대신, 도구를 통해 세상과 상호작용하는 능력은 모델의 핵심 지식 속에 엮여 들어갈 때 이득을 얻는 근본적인 역량임을 시사합니다. 도구 문서의 구조와 도구 워크플로우의 논리에 모델을 노출시킴으로써, 연구진은 더 견고하고 적응력 있는 시스템을 만들어냈습니다. 이러한 결과는 차세대 AI 에이전트가 진정으로 효과적이 되기 위해서는, 단순히 어떤 도구가 존재하는지가 아니라, 그 도구들을 어떻게 인식하고, 계획하며, 문제가 발생했을 때 어떻게 회복하는지를 배우는 전용 단계가 훈련에 포함되어야 함을 의미합니다. 이 중간 훈련 단계는 인공지능의 더 자연스럽고 신뢰할 수 있는 에이전시(agency, 주체성)를 실현하는 열쇠인 것으로 보입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →