AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use
이 논문은 9개의 시뮬레이션된 애플리케이션에 걸친 516개의 태스크를 특징으로 하여 도구 사용 에이전트가 사용자와의 다양하고 필수적인 상호작용을 처리하는 능력을 평가하는 도전적인 벤치마크인 AppWorld-UL을 소개하며, 이를 통해 최첨단 모델들조차 이러한 사용자 참여형(user-in-the-loop) 시나리오에서 상당히 어려움을 겪는다는 것을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑한 로봇 집사에게 심부름을 하는 법을 가르치고 있다고 상상해 보세요. 당신은 "셔츠 하나 사 와"라고 말합니다. 컴퓨터 과학의 세계에서 이것은 '도구 사용(tool use)'이라고 불립니다. 즉, 로봇은 앱을 열고, 버튼을 클릭하고, 구매를 완료하는 방법을 알고 있는 것입니다. 하지만 여기 함정이 있습니다. 현실 세계는 복잡합니다. 만약 장바구니에 셔츠가 다섯 개나 있는데 로봇이 당신이 어떤 것을 의미하는지 모른다면 어떻게 될까요? 만약 당신이 원하는 셔츠가 품절되었다면 어떡할까요? 만약 가격이 갑자기 두 배로 뛰어서, 당신이 그 특정 변화에 대해 "예"라고 말해야만 구매할 의사가 있다면 어떨까요?
이 로봇들을 위한 대부분의 테스트는 아무런 문제 없이 완벽하게 진행되는 단계별 레시피를 따를 수 있는지만을 확인합니다. 하지만 실제 인간은 예측 불가능합니다. 우리는 모호하게 말하기도 하고, 마음을 바꾸기도 하며, 로봇이 우리의 돈을 쓰기 전에 허락을 구하기를 원합니다. 이 논문은 AI 연구의 이 복잡하고도 실제적인 영역으로 들어가 한 가지 단순하지만 어려운 질문을 던집니다. "우리의 가장 뛰어난 AI 에이전트들이 상황이 복잡해질 때 실제로 우리와 대화를 할 수 있는가, 아니면 지시가 완벽하지 않을 때 그냥 실패하고 마는가?"
Junzhi Chen과 Harsh Trivedi가 이끄는 연구진은 로봇을 완벽하고 가상의 날이 아닌, 실제 삶처럼 느껴지는 날들에 테스트하기로 결정했습니다. 그들은 AppWorld-UL(User-in-the-Loop)이라는 새로운 놀이터를 만들었습니다. 이것은 아마존(Amazon)이나 스포티파이(Spotify) 같은 9개의 인기 앱이 있는 거대한 시뮬레이션 디지털 도시라고 생각하면 됩니다. 하지만 차이점이 있습니다. 바로 '사용자'(시뮬레이션된 사람)가 게임의 일부이며, 로봇은 도움을 요청하는 법을 스스로 알아내야 한다는 점입니다.
연구팀은 단순히 무작위 문제를 만든 것이 아니라, 영리한 '섭동(perturbation)' 방식을 사용했습니다. 예를 들어, "지난주에 산 나이키 셔츠를 반품해 줘"라는 일반적인 작업을 가져온 뒤, 세상을 교묘하게 비틀어 까다롭게 만드는 식입니다.
- "어떤 것?" 함정 (미지정/Underspecification): 그들은 로봇이 지난주에 산 나이키 셔츠를 두 개 찾도록 만들었습니다. 이제 로봇은 그냥 추측할 수 없습니다. 반드시 멈춰서 "어떤 것을 반품하고 싶으신가요?"라고 물어야 합니다.
- "없어졌어요!" 함정 (불가능성/Infeasibility): 그들은 상점에서 셔츠의 "L" 사이즈를 사라지게 만들었습니다. 로봇은 그냥 실패해서는 안 됩니다. 사용자에게 "L 사이즈가 품절되었습니다. 다른 사이즈를 원하시나요, 아니면 환불을 원하시나요?"라고 말해야 합니다.
- "잠깐, 너무 비싸요!" 함정 (확인/Confirmation): 그들은 셔츠의 가격이 두 배로 뛰게 만들었습니다. 로봇은 잠시 멈추고 "가격이 올랐습니다! 그래도 구매하시겠습니까?"라고 말해야 합니다.
테스트가 공정하도록 하기 위해, 그들은 엄격한 규칙을 따르지만 실제 사람처럼 행동하는 '시뮬레이션된 사용자'를 만들었습니다. 이 사용자는 까다로운 질문에 대한 답을 알고 있지만, 로봇이 '올바른' 질문을 하지 않으면 답을 알려주지 않습니다. 이것은 마치 "스무 고개" 게임과 같아서, 사용자는 당신이 정확히 생각하고 있는 것에 대해 물어야만 대답해 줄 것입니다.
세계 최고의 AI 로봇들(Claude Opus 4.7이나 GPT-5.5 같은 모델들)을 이 혼란스러운 디지털 도시에 투입했을 때, 결과는 다소 충격적이었습니다. 가장 뛰어난 로봇조차 전체 작업에서 약 **48.6%**의 성공률만을 보였습니다. 작업이 두 가지 또는 세 가지의 까다로운 상황을 동시에 결합하여 더 어려워지자, 성공률은 단 **35.7%**로 떨어졌습니다.
이 연구는 문제가 로봇이 앱을 사용하는 능력이 아니라, 그들이 이미 버튼을 누르는 데는 꽤 능숙하다는 점을 시사합니다. 진짜 문제는 '대화'입니다. 연구진이 누락된 모든 정보를 미리 '치트 시트(cheat sheet)' 형태로 제공했을 때(즉, 사용자에게 물어볼 필요가 없게 했을 때), 성공률은 **78.1%**로 급증했습니다. 이는 어려움의 원인이 앱 자체의 복잡성이 아니라, 상호작용의 필요성에서 온다는 것을 증명합니다.
또한, 이 논문은 로봇이 실패할 때 주로 올바른 질문을 하지 못했음을 발견했습니다. 로봇은 답을 추측하거나(환각 현상), 모호한 질문을 던져 사용자를 혼란스럽게 하거나, 사용자가 방금 말한 내용을 잊어버리곤 했습니다. 이는 마치 "빨간 셔츠를 원해"라는 말을 듣고도 파란색 셔츠를 사는 로봇과 같습니다. 확인 절차를 잊어버린 것이죠.
요약하자면, 이 논문은 우리의 AI 에이전트들이 작업을 수행하는 데는 뛰어나지고 있지만, 여전히 좋은 대화 상대가 되는 법을 배우는 중임을 보여줍니다. 그들은 때때로 앞서 달려가는 것보다 멈춰 서서, 사람을 바라보며 "잠깐만요, 어떤 것을 말씀하신 건가요?"라고 묻는 것이 최선일 수 있다는 것을 배워야 합니다. 그들이 이 주고받는 춤을 마스터하기 전까지, 그들은 간단한 장보기에는 준비가 되었을지 몰라도, 실제 인간의 혼란스러운 일상을 감당하기에는 아직 부족합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.