← 최신 논문
💬 NLP

HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents

HyperTool은 에이전트가 복잡한 다단계 도구 워크플로우를 단일 코드 블록 호출으로 캡슐화할 수 있게 하는 통합 실행 인터페이스를 도입하여, 실행 입도 불일치 문제를 해결하고 MCP-Universe와 같은 벤치마크에서 다단계 도구 사용 정확도를 크게 향상시킵니다.

원저자: Yaxin Du, Yifan Zhou, Yujie Ge, Jiajun Wang, Xianghe Pang, Shuo Tang, Tuney Zheng, Bryan Dai, Jian Yang, Siheng Chen

게시일 2026-06-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yaxin Du, Yifan Zhou, Yujie Ge, Jiajun Wang, Xianghe Pang, Shuo Tang, Tuney Zheng, Bryan Dai, Jian Yang, Siheng Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 바쁜 회사의 CEO라고 상상해 보세요. 당신에게는 지도를 확인하거나, 웹을 검색하거나, 금융 데이터를 분석하는 등의 일을 할 수 있는 전문 비서들(도구들)이 있습니다.

과거의 방식: 마이크로매니징을 하는 CEO
현재 대부분의 AI 에이전트는 모든 단계를 일일이 간섭하는 CEO처럼 작동합니다. 만약 당신이 "우리 집과 친구 집의 중간 지점에 있는 모임 장소를 찾아줘"라고 요청한다면, AI는 다음과 같이 행동해야 합니다:

  1. 생각: "내 집의 좌표를 찾아야 해."
  2. 지도 비서에게 요청: "우리 집 위치가 어디지?"
  3. 답변을 기다림.
  4. 생각: "좋아, 이제 친구 집의 좌표를 찾아야 해."
  5. 지도 비서에게 다시 요청.
  6. 기다림.
  7. 생각: "이제 거리를 계산해야 해."
  8. 계산기 비서에게 요청.
  9. 기다림.
  10. 생각: "이제 근처에 있는 카페를 찾아야 해."
  11. 검색 비서에게 요청.

문제점: 이는 거대하고 복잡한 "회의 기록(추론 과정)"을 만들어냅니다. CEO(AI 모델)는 모든 작은 세부 사항, 중간 숫자, 그리고 끊임없는 주고받는 대화들에 압도당하게 됩니다. 이는 마치 캐릭터가 문을 열 때마다 작가가 문경첩, 나무 결, 그리고 먼지까지 묘사하느라 서술을 멈추는 소설을 읽는 것과 같습니다. 로그가 너무 길어지면 AI는 주요 목표를 잊어버리고 실수를 저지르게 됩니다.

새로운 방식: 권한을 부여받은 매니저 (HyperTool)
HyperTool은 규칙을 바꾸어 이 문제를 해결합니다. CEO가 모든 작은 단계를 일일이 간섭하는 대신, 이제 다음과 같이 말할 수 있습니다: "여기 코드 블록이 있어. 이 '모임 장소 찾기' 작업 전체를 직접 처리하고 최종 결과만 나에게 알려줘."

이 "코드 블록" 안에서 AI는 숙련된 프로젝트 매니저처럼 행동합니다. AI는 다음과 같은 일을 할 수 있습니다:

  • 지도 비서, 계산기 비서, 검색 비서를 한 번에 호출합니다.
  • 내부적으로 수학 계산과 필터링을 수행합니다 (마치 사적인 회의처럼).
  • 지저분한 중간 메모들(좌표, 가공되지 않은 거리 숫자 등)을 버립니다.
  • CEO에게 가장 좋은 카페의 이름만 적힌 깨끗한 종이 한 장을 건넵니다.

비유: 레스토랑 주방

  • 단계별 방식 (과거): 고객이 버거를 주문합니다. 웨이터는 "빵 가져오기"라고 적고 주방으로 가서 기다리고, 다시 돌아와 "패티 가져오기"라고 적고 기다리고, 다시 "치즈 가져오க்கும்"이라고 적고 기다리는 과정을 반복합니다... 주방은 혼란스럽고, 고객은 모든 움직임을 다 보게 됩니다.
  • HyperTool (새로운 방식): 고객이 "버거 하나 만들어 주세요"라고 말합니다. 그러면 셰프(AI)가 주방(코드 블록)으로 들어가서 빵, 패티, 치즈를 챙기고, 요리를 하고, 접시에 담아 완벽한 버거 하나를 내놓습니다. 고객은 재료를 다듬거나 굽는 과정을 볼 필요 없이, 그저 결과물만 받으면 됩니다.

이 논문이 실제로 발견한 것
연구진은 이 새로운 "매니저" 접근 방식을 MCP-Universe라는 벤치마크를 사용하여 실제 세계의 다양한 작업(도시 탐색 또는 금융 분석 등)에 테스트했습니다.

  • 결과: 이 "매니저" 스타일을 사용하도록 AI 모델(특히 Qwen3-8B 및 Qwen3-32B)을 학습시켰을 때, 모델들은 복잡한 문제를 훨씬 더 잘 해결했습니다.

    • 더 작은 모델(8B)은 성공률이 약 **10%**에서 **33%**로 뛰어올랐습니다.
    • 더 큰 모델(32B)은 **15%**에서 **35%**로 뛰어올랐습니다.
    • 심지어 이 방식을 사용하지 않는 매우 유명하고 값비싼 AI 모델들을 능가하기도 했습니다.
  • 성공 이유: "코드 블록" 안에 지저집고 반복적인 단계들을 숨김으로써, AI는 긴 세부 사항의 기록에 혼란을 느끼지 않았습니다. 덕분에 AI는 큰 그림에 집중할 수 있었고, 많은 단계를 요구하는 복잡한 작업을 길을 잃지 않고 처리할 수 있었습니다.

요약하자면
HyperTool은 AI가 모든 작은 단계의 "방법(how)"에 매몰되는 것을 막고, 최종 목표인 "무엇(what)"에 집중하게 합니다. 이는 혼란스러운 단계별 대화를 깔끔하고 효율적인 명령-결과 시스템으로 전환하여, AI 에이전트가 도구를 사용하는 데 있어 훨씬 더 똑똑하고 효율적으로 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →