← 최신 논문
🤖 AI

A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

기존 에이전트 벤치마크의 포화 상태와 도구 사용 커버리지의 한계를 해결하기 위해 본 논문은 도구 시퀀스를 진화시켜 도전적이고 높은 커버리지를 가진 τc\tau^c-Bench 를 생성하는 작업 구성 과정을 역으로 수행하는 자동화 방법인 TASTE 를 도입하며, 이는 현재 최첨단 모델들이 이러한 더 복잡하고 다양한 작업에 직면할 때 심각한 성능 저하를 겪는다는 사실을 드러냅니다.

원저자: Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichert

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichert

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 로봇 셰프가 요리를 얼마나 잘하는지 테스트한다고 상상해 보세요.

문제: "쉬운 메뉴"가 소진되었다
현재 로봇이 "샌드위치를 만들거나" 또는 "피자를 주문하라"는 지시를 따라야 하는 표준 테스트 메뉴 ( τ\tau-Bench 라고 함) 가 있습니다. 문제는 가장 똑똑한 로봇 셰프들이 이미 이 메뉴를 외워버렸다는 점입니다. 그들이 천재라서 점수가 완벽하게 나오는 것이 아니라, 테스트가 너무 쉽고 반복적이기 때문입니다. 이는 선생님이 한 자리 수 덧셈만 물어볼 때 수학 시험에서 A+ 를 받는 학생과 같습니다.

또한, 새롭고 더 어려운 테스트 문제를 만드는 것은 악몽과 같습니다. 인간이 앉아 복잡한 이야기를 쓰고, 로봇이 취해야 할 정확한 단계를 파악하고, 그 이야기가 논리적인지 확인해야 하기 때문입니다. 이는 느리고 비용이 많이 들며, 인간이 우연히 생각해낸 이야기 유형으로만 제한됩니다.

해결책: TASTE (작업 합성을 위한 도구 시퀀스 진화)
저자들은 TASTE(Task Synthesis from Tool Sequence Evolution) 라는 새로운 시스템을 개발했습니다. TASTE 는 이야기부터 시작해 단계를 파악하는 대신, 이 과정을 거꾸로 뒤집습니다.

이렇게 생각해보세요:

  1. "도구 시퀀스" (단계): 먼저 시스템이 "냉장고 열기, 우유 집기, 잔에 따르기, 냉장고 닫기"와 같이 수천 개의 무작위 행동 목록을 생성합니다.
  2. "타당성 필터" (맛보기 테스트): 초지능 AI 심판이 이 목록들을 검토하며 "아니요, 그건 불가능합니다. 냉장고를 열기 전에 우유를 따를 수 없습니다" 또는 "네, 그것은 유효한 일련의 사건입니다"라고 말합니다. 이는 실수에서 배우며 유효한 단계와 무효한 단계를 구분하는 능력을 향상시킵니다.
  3. "클러스터링" (맛별로 그룹화): 유효한 시퀀스들을 그룹화합니다. 한 그룹이 "아침 식사 만들기"에 관한 것이고 다른 그룹이 "샌드위치 만들기"에 관한 것이라면, 각 그룹에서 가장 대표적인 예를 선택하여 테스트가 다양한 시나리오를 포괄하도록 합니다.
  4. "진화" (향신료 추가): 이것이 비법 소스입니다. 기본 작업 (예: "피자 주문하기") 을 확보한 후, 의도적으로 이를 더 어렵게 만듭니다. 예를 들어:
    • 고객 (시뮬레이션된 사용자) 이 주문 세부 사항을 잊게 만듭니다.
    • 메뉴에 정답처럼 보이지만 실제로는 틀린 "미끼" 옵션을 추가합니다 (예: 품절된 피자).
    • 고객을 비협조적이거나 혼란스럽게 만듭니다.

결과: τc\tau^c-Bench
이 방법을 사용하여 그들은 τc\tau^c-Bench라는 훨씬 더 어려운 새로운 테스트를 구축했습니다.

이 새로운 메뉴로 "챔피언" 로봇 셰프들 (Gemini-3-Flash 등) 을 테스트했을 때, 결과는 충격적이었습니다.

  • 이전의 쉬운 메뉴에서는 이 로봇들이 0.90(거의 완벽) 의 점수를 받았습니다.
  • 새로운 TASTE 생성 메뉴에서는 점수가 0.30 이하로 떨어졌습니다.

왜 이것이 중요한가
이 논문은 이전 테스트에서의 높은 점수가 "오보"였다고 주장합니다. 로봇들은 실제로 복잡한 현실 세계의 문제를 해결하는 데 그토록 뛰어난 것이 아니라, 단순히 이전 테스트 문제를 외웠을 뿐입니다.

이 새로운 방법은 다음을 증명합니다:

  • 포괄성: 새로운 테스트는 로봇들이 몇 가지 트릭이 아닌 훨씬 더 다양한 도구와 조합을 사용하도록 강제합니다.
  • 난이도: 혼란, 누락된 정보, 까다로운 시나리오를 포함하기 때문에 테스트는 진정으로 더 어렵습니다.
  • 자동화: 더 이상 인간이 이러한 어려운 테스트를 작성할 필요가 없습니다. 시스템은 로봇이 더 똑똑해질수록 계속 테스트할 수 있는 무한한 공급의 도전적이고 유효하며 다양한 작업을 생성할 수 있습니다.

요약하자면, TASTE 는 AI 에이전트를 위한 "보스 배틀"을 자동으로 발명하는 기계로, 스크립트를 외운 로봇과 실제로 생각할 수 있는 로봇을 구별할 수 있도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →