← 최신 논문
💬 NLP

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

이 논문은 다양한 애플리케이션과 604 개의 도구를 포함하며 현실적인 환경 상태와 검증 가능한 평가 스크립트를 제공하는 새로운 벤치마크 'Toolathlon'을 소개하고, 이를 통해 현재 최첨단 언어 에이전트들이 복잡하고 장기적인 실제 작업 수행에서 여전히 큰 한계를 겪고 있음을 규명합니다.

원저자: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xin
게시일 2026-02-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xingyao Wang, Xiang Yue, Shuyan Zhou, Graham Neubig, Junxian He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏆 툴 아슬론 (Toolathlon): AI 에이전트의 '올림픽'이 열린다

이 논문은 인공지능 (AI) 이 실제로 우리 삶을 도울 수 있는지, 그리고 얼마나 잘할 수 있는지 테스트하는 새로운 **'시험장 (벤치마크)'**을 소개합니다. 이 시험장의 이름은 **'툴 아슬론 (Toolathlon)'**입니다.

이름에서 알 수 있듯, 이는 단순한 퀴즈가 아니라 다양한 도구를 사용하는 '10 종 경기' 같은 것입니다.


1. 왜 새로운 시험장이 필요할까요? (기존 문제점)

지금까지 AI 를 테스트할 때는 주로 **"가상의 시나리오"**를 사용했습니다.

  • 비유하자면: 운전 면허 시험을 볼 때, 실제 도로가 아닌 완벽하게 정리된 폐쇄된 연습장에서만 시험을 치르는 것과 같습니다.
  • 문제점: AI 는 연습장에서는 잘 운전하지만, 실제 도로에 나가면 갑자기 나타난 보행자나 복잡한 신호등 앞에서 당황하고 사고를 냅니다. 기존 시험들은 AI 가 실제로 겪을 수 있는 복잡함, 혼란, 예측 불가능한 상황을 충분히 반영하지 못했습니다.

2. 툴 아슬론 (Toolathlon) 은 무엇인가요?

이 연구팀은 AI 를 실제 세상으로 데려가 시험을 보게 했습니다.

  • 32 개의 실제 앱, 604 개의 도구: AI 는 구글 캘린더, 노션, 스프레드시트, 심지어 데이터베이스나 서버 관리 도구 같은 실제 존재하는 32 가지 소프트웨어를 다뤄야 합니다.
  • 실제 환경 (Real Environment): AI 가 작업할 때 빈 방이 아니라, 이미 학생이 50 명 등록된 온라인 강의실이나 수백 개의 이메일이 쌓인 우편함 같은 '살아있는' 환경에서 시작합니다.
    • 비유: AI 가 "새로운 학생을 등록해줘"라고 할 때, 빈 명부만 있는 게 아니라 이미 꽉 찬 명부에서 중복을 피하고 실수를 찾아내야 하는 상황입니다.
  • 모호한 지시 (Fuzzy Prompts): AI 에게는 "이거 해줘"라고 정확한 단계별 지시를 주지 않습니다. 대신 "이메일로 온 숙제 파일들을 확인해서 점수를 매겨줘"라고 사람들이 실제로 하는 것처럼 모호하게 말합니다. AI 스스로 "어디에 파일이 있을까?", "어떻게 점수를 매겨야 할까?"를 스스로 추론해야 합니다.

3. 시험은 어떻게 진행되나요?

시험관은 AI 가 말만 잘하는지, 실제로 일을 끝내는지를 확인합니다.

  • 실행 기반 평가: AI 가 "완료했습니다"라고 말하면 끝나는 게 아닙니다. 실제로 이메일이 발송되었는지, 데이터베이스에 기록이 남았는지 코드로 직접 확인합니다.
  • 긴 여정 (Long-Horizon): 한 번의 명령으로 끝나는 게 아니라, 평균 20 번 이상의 도구 사용이 필요한 긴 작업을 수행해야 합니다.
    • 예: "이메일로 온 숙제를 다운로드해서 → 실행 오류를 확인하고 → 오류가 없으면 점수를 주고 → 노션에 기록하고 → 학생에게 결과를 알려줘."

4. 결과는 어땠나요? (현실적인 충격)

최고급 AI 모델들을 시험에 출전시켰지만, 결과는 아직 갈 길이 멀다는 것을 보여줍니다.

  • 성공률: 가장 잘하는 AI (Claude-4.5-Sonnet) 도 **38.6%**만 성공했습니다. 즉, 10 번 중 6 번은 실패한 것입니다.
  • 주요 실패 원인:
    1. 도구 이름 착각: "이메일 보내기" 도구를 "문서 저장하기"로 잘못 부르는 등, 도구를 헷갈려 합니다.
    2. 긴 정보에 압도됨: 너무 긴 이메일이나 데이터가 나오면 중간에 포기하거나 혼란을 겪습니다.
    3. 미리 멈춤: 일을 다 끝내지 않고 "아, 다 했어"라고 일찍 종료해버립니다.

5. 결론: 왜 이것이 중요한가요?

이 논문은 AI 개발자들에게 **"지금 AI 는 아직 실제 세상에서 혼자 일하기엔 너무 어리고 서툴다"**고 경고합니다.

  • 툴 아슬론은 AI 가 실제로 우리 일을 대신할 수 있을지, 아니면 여전히 사람이 옆에서 도와줘야 할지 판단하는 진짜 시험대가 될 것입니다.
  • 이 시험을 통해 AI 가 더 똑똑하고, 실수를 잘 고치며, 복잡한 일을 끝까지 해내는 **'성숙한 AI'**로 성장하기를 기대합니다.

한 줄 요약:

"지금까지 AI 는 가상의 연습장에서만 달렸다면, 툴 아슬론은 AI 를 실제 거친 도로로 데려와 진짜 운전 실력을 시험하는 새로운 올림픽입니다. 결과는 아직 초보 운전자가 많지만, 이 시험을 통해 더 안전하고 똑똑한 AI 가 만들어지길 바랍니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →