← 최신 논문
💬 NLP

ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues

이 논문은 기존 데이터셋에 비해 미세 조정된 대규모 언어 모델의 다단계 상호작용 품질을 크게 향상시키고 벤치마크 성능을 우월하게 만드는 도구 의존성 강제 및 세분화된 매개변수 출처 추적을 통해 현실적인 다턴 도구 호출 대화를 생성하는 구조화된 프레임워크인 ToolWeave 를 소개합니다.

원저자: Dinesh Khandelwal, Gnana Prakash Punnavajhala, GPS Bhargav, Gaurav Pandey, Sachin Joshi, Hima Karanam, Dinesh Raghu

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dinesh Khandelwal, Gnana Prakash Punnavajhala, GPS Bhargav, Gaurav Pandey, Sachin Joshi, Hima Karanam, Dinesh Raghu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 로봇을 유용한 개인 비서로 가르치려 한다고 상상해 보세요. 이를 위해서는 로봇이 비행기 예약, 은행 잔고 확인, 컴퓨터 수리 등 문제를 해결하기 위해 도구들을 성공적으로 사용하는 수천 개의 대화 예시를 보여줘야 합니다.

문제는 현재 이러한 로봇을 가르치는 데 사용되는 대부분의 '교과서'(데이터셋) 가 가짜이고 비현실적인 이야기로 가득 차 있다는 점입니다. 마치 조종사에게 비행기를 조종하는 법을 가르칠 때, 활주로 없이 하늘에 갑자기 나타나는 비행기 영상을 보여주거나, 조종사가 게이지를 확인하지 않고도 마법처럼 연료량을 아는 상황을 보여주는 것과 같습니다.

문제: "가짜 교과서"
IBM 연구소와 IIIT 하이데라바드의 저자들은 이러한 훈련용 이야기를 생성하는 기존 방법들이 두 가지 주요 문제를 겪고 있음을 발견했습니다.

  1. "붙여붙임" 문제: 기존 방법들은 이름이 같다는 이유만으로 서로 어울리는 것처럼 보이는 도구들을 선택합니다. 예를 들어, 한 도구가 '티켓 ID'를 출력하고 다른 도구가 '티켓 ID'를 필요로 하면, 기존 방법들은 이를 무작정 연결합니다. 하지만 실제로는 한 도구가 영화 티켓용이고 다른 도구는 병원 예약용일 수 있습니다. 이름은 같지만 서로 전혀 관련이 없는 것입니다. 이는 논리적으로 전혀 말이 되지 않는 대화를 만들어냅니다.
  2. "마법 지팡이" 문제: 이러한 이야기를 생성할 때, 기존 방법들은 종종 AI 에게 정보를 '환각'(지어냄) 하도록 허용합니다. 로봇이 사용자가 말한 적도 없는 신용카드 번호나 특정 날짜를 갑자기 알 수 있게 되는 것입니다. 마치 처음부터 없었던 모자에서 토끼를 꺼내는 마술사와 같습니다.

해결책: ToolWeave
저자들은 ToolWeave라는 새로운 프레임워크를 소개합니다. ToolWeave 를 단순히 무작위 이야기를 뱉어내는 기계가 아니라, 현실적인 훈련 과정을 구축하기 위해 함께 일하는 숙련된 건축가와 엄격한 편집자로 생각하세요.

ToolWeave 가 작동하는 방식을 간단한 비유로 설명하면 다음과 같습니다:

1. "레고 세트" 구축 (도구 그래프)

선반에서 무작위 도구를 집어오는 대신, ToolWeave 는 먼저 맞춤형 '레고 세트'를 구축합니다.

  • 기존 방식: 둘 다 블록이라는 이유만으로 빨간 블록과 파란 블록을 집어옵니다.
  • ToolWeave 방식: 블록들이 반드시 서로 맞물리도록 설계합니다. '고용' 도구에서만 나오는 '기술자 ID'를 필요로 하는 '유지보수 일정' 도구를 만듭니다. 도구 자체에 연결 관계 (의존성) 를 구축하여, 도구 A 를 사용하면 도구 C 를 사용하려면 논리적으로 도구 B 의 출력이 필요하도록 보장합니다.

2. "극본 작가" (구조화된 계획)

도구들이 구축되면 ToolWeave 는 AI 에게 단순히 "이야기를 써라"라고 요청하지 않습니다. 대신 AI 에게 상세한 극본을 먼저 쓰도록 강요합니다.

  • 계획: 대화의 한 줄도 쓰기 전에 시스템이 단계별 계획을 세웁니다. "이 숫자는 어디서 왔는가? 사용자가 말했는가? 아니면 이전 도구가 우리에게 주었는가?"라고 묻습니다.
  • 결과: 이로써 '마법 지팡이' 문제가 차단됩니다. 극본에 명시적으로 "잠깐, 우리는 아직 이 숫자가 없습니다. 사용자에게 물어봐야 합니다"라고 적혀 있기 때문에 로봇이 신용카드 번호를 지을 수 없습니다.

3. "배우들" (대화 합성)

마지막으로 시스템은 AI '배우' 팀을 활용하여 극본을 수행합니다.

  • 한 배우는 사용자를, 한 배우는 어시스턴트를, 나머지는 도구들을 연기합니다.
  • 그들은 극본을 엄격하게 따릅니다. 극본에 사용자가 세부 사항을 명확히 해야 한다고 적혀 있으면, 배우는 그 장면을 연기합니다. 극본에 도구 실패 (예: 서버 오류) 가 있다고 적혀 있으면, 배우들은 그 실수에서 복구하는 방법을 연습합니다.
  • 이로써 인간적이고 논리적이며 현실적인 주고받음이 가득한 대화가 만들어집니다.

결과: 더 나은 조종사
저자들은 이 새로운 '교과서'(ToolWeave 데이터) 를 기존 데이터와 비교하여 테스트했습니다. 그들은 이 새로운 데이터로 다양한 로봇 모델 (Llama-3 등) 을 훈련시킨 후 시험에 붙였습니다.

  • 더 높은 현실성: 새로운 데이터는 한 도구가 다른 도구로 이어지는 **45%**의 다단계 상호작용을 포함하는 반면, 기존 데이터에서는 7% 미만이었습니다.
  • 거짓말 감소: 로봇이 사실을 지어내는 (환각) 비율이 50% 이상에서 약 **20%**로 감소했습니다.
  • 향상된 성능: 표준 시험 (BFCL-V3 와 같은 벤치마크) 에서 ToolWeave 데이터로 훈련된 로봇들은 훨씬 높은 점수를 받았습니다. 예를 들어, 대형 모델 (Llama-3.1-70B) 은 기존 데이터로 23.50% 점수에서 ToolWeave 데이터로 39.75% 점수로 크게 상승했습니다.

요약
ToolWeave 는 AI 어시스턴트를 위한 훈련 데이터를 생성하는 새로운 방법입니다. AI 가 도구들의 연결 방식을 추측하고 사실을 지어내게 하는 대신, 먼저 구조적이고 논리적인 기반을 구축합니다. 이는 오타와 마술로 가득 찬 책으로 학생을 가르치는 것과, 실제 세계가 어떻게 작동하는지 정확히 보여주는 명확한 단계별 매뉴얼로 가르치는 것의 차이와 같습니다. 그 결과, AI 는 길을 잃거나 사실을 지어내지 않고도 복잡하고 다단계인 문제를 해결하는 데 훨씬 더 능숙해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →