← 최신 논문
🤖 AI

Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments

본 논문은 상태 없는 실행 환경에서 사용자 요청 내에 도구 호출을 암시적으로 표현함으로써 복잡한 다회전 도구 호출 대화를 합성하는 새로운 데이터 생성 방법인 DiGiT-TC를 소개하며, 이를 통해 상태 유효성 검사에 의존하지 않고도 소형 언어 모델을 효과적으로 미세 조정할 수 있게 합니다.

원저자: Maxwell Crouse, Ibrahim Abdelaziz, Kshitij Fadnis, Siva Sankalp Patel, Kinjal Basu, Chulaka Gunasekara, Sadhana Kumaravel, Asim Munawar, Pavan Kapanipathi

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Maxwell Crouse, Ibrahim Abdelaziz, Kshitij Fadnis, Siva Sankalp Patel, Kinjal Basu, Chulaka Gunasekara, Sadhana Kumaravel, Asim Munawar, Pavan Kapanipathi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 집사를 복잡한 용건을 처리하도록 가르친다고 상상해 보세요. 예를 들어 "영화를 찾고, 상영 시간을 확인한 뒤, 이용 가능한 첫 번째 영화의 티켓을 구매하라"는 명령을 내리는 것입니다.

실제 세계에서는 이 로봇을 테스트할 때, 실제 영화관 시스템에서 해당 명령을 실제로 실행하게 합니다. 데이터베이스를 확인하는 과정을 지켜보고, 결과를 본 뒤 티켓을 구매하게 하죠. 만약 성공한다면, 로봇이 잘 학습했다는 것을 알 수 있습니다. 지금까지 대부분의 AI 연구자들이 해온 일이 바로 이것입니다. 로봇이 실제로 무언가를 만지고 변경할 수 있는 '장난터' (stateful environment) 를 구축한 것이죠.

문제점:
하지만 로봇이 실제 세계에 손을 대게 할 수 없는 경우가 있습니다. 데이터가 너무 민감할 수 있습니다 (예: 은행의 비밀 고객 명단). 혹은 '장난터'를 구축하는 비용이 너무 비쌀 수도 있습니다. 이런 경우, 로봇을 실행시켜 테스트할 수 없습니다. 대신 실제 결과를 한 번도 보지 못한 채 도구 명세 (tool specifications) 라는 명령 목록만으로 로봇을 가르쳐야 합니다.

대부분의 기존 방법들은 로봇이 실제로 명령을 실행한 것처럼 가장함으로써 이를 모방하려 했습니다. 하지만 그들은 인간 대화의 중요한 부분을 놓쳤습니다. 바로 **암시적 단계 (Implicit Steps)**입니다.

인간 비서에게 "첫 번째 상영 시간에 티켓을 예약하라"고 요청할 때, 당신은 "먼저 '상영 시간 확인' 도구를 실행하고, 그 다음 '티켓 예약' 도구를 실행하라"고 말하지 않습니다. 단지 목표만 제시할 뿐입니다. 비서는 당신이 말하지 않았더라도 먼저 확인해야 한다는 것을 알고 있습니다. 이것이 바로 암시적 도구 호출입니다. 기존 방법들은 로봇이 스스로 이러한 숨겨진 단계를 찾아내도록 가르치는 훈련 데이터를 만드는 데 어려움을 겪었습니다.

해결책: DiGiT-TC (역공학 방법)
IBM 연구자들은 DiGiT-TC라는 새로운 방법을 도입했습니다. 로봇에게 "다음에 무엇을 해야 할까?"라고 묻는 대신, 접근 방식을 뒤집은 것입니다.

이를 마치 영화 감독이 거꾸로 작업하는 것과 같이 생각해 보세요:

  1. 감독이 먼저 대본을 씁니다: 시스템은 먼저 강력한 AI 에게 문제를 해결하기 위해 로봇이 취해야 할 전체 행동 순서를 작성하도록 요청합니다 (예: 상영 시간 확인 -> 티켓 예약).
  2. '편집자'가 단서를 숨깁니다: 시스템은 그 다음 교묘한 편집자 역할을 합니다. 그 완전한 대본을 가져와 '사용자'에게 숨겨야 할 단계를 결정합니다. 최종 목표 (티켓 예약) 는 보이게 하되, 중간 단계 (상영 시간 확인) 는 숨깁니다.
  3. '번역가'가 프롬프트를 작성합니다: 이제 시스템은 AI 에게 오직 보이는 부분에만 부합하는 사용자 요청을 작성하도록 요청합니다. 따라서 사용자는 "첫 번째 상영 시간에 티켓을 예약해 달라"고 말하고, AI 는 숨겨진 "상영 시간 확인" 단계를 스스로 찾아내야 한다는 것을 알게 됩니다.
  4. '이중 확인' (역번역): AI 가 혼동하지 않았는지 확인하기 위해 시스템은 "역방향 테스트"를 실행합니다. 사용자의 요청 ("티켓을 예약해...") 을 가져와 AI 에게 처음부터 이를 해결하도록 요청합니다. 만약 AI 가 원래 대본과 정확히 동일한 숨겨진 단계를 도출해 낸다면, 그 데이터는 양호한 것입니다. 만약 AI 가 잘못하면 그 데이터는 폐기됩니다.

이것이 중요한 이유:
이러한 "역공학" 접근 방식을 통해 연구자들은 로봇이 빈칸을 채우는 법을 배우는 방대한 훈련 데이터 라이브러리를 만들었습니다. 그들은 이를 표준 "시험" 벤치마크 (BFCL 및 τ-bench 등) 에서 테스트한 결과, 다음과 같은 사실을 발견했습니다:

  • 이 데이터로 훈련된 로봇은 다단계 작업 처리 능력이 크게 향상되었습니다.
  • 최상위 폐쇄형 소스 모델로 생성된 훨씬 더 비싼 데이터로 훈련된 로봇만큼, 혹은 그 이상으로 성능을 발휘했습니다.
  • 이 방법은 로봇을 테스트할 실제 "장난터"가 없어도 작동하므로, 은행이나 병원과 같은 민감한 환경에서도 안전하게 사용할 수 있습니다.

결론:
이 논문은 "거꾸로" 데이터를 생성함으로써 (해결책에서 시작해 질문으로 나아가는 방식), 실제 민감한 데이터 시스템에 접근하지 않고도 작고 저렴한 AI 모델이 크고 비싼 모델만큼 복잡한 다단계 작업을 처리하도록 가르칠 수 있다고 주장합니다. 연구자들은 모든 코드와 데이터를 누구나 사용할 수 있도록 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →