MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
이 논문은 시각적 도구 호출 에이전트를 평가하기 위해 500개 이상의 도구와 258개의 인간 검증 시나리오를 갖춘 상태 유지 환경을 특징으로 하는 통합 프레임워크이자 벤치마크인 MM-ToolSandBox를 소개하며, 현재 모델들이 시각적 정밀도 측면에서 크게 어려움을 겪고 있고 실패 모드가 작은 모델에서의 계획 결핍에서 큰 모델에서의 지각 오류로 변화한다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 보낸 이미지를 읽고, 시뮬레이션된 앱과 상호작용하며, 업무를 정리할 수 있는 초지능 로봇 비서가 있다고 상상해 보세요. 마치 마법처럼 들리죠? 그런데 애플의 한 팀이 이 로봇들이 실제 삶의 복잡하고 시각적인 현실을 정말로 처리할 수 있는지 확인하기 위해 MM-ToolSandBox라는 거대하고 첨단 기술이 집약된 놀이터를 만들었습니다.
여기 핵심 내용이 있습니다. 그들은 단순히 로봇에게 글자를 읽으라고 시킨 것이 아니라, 거대한 시각적 퍼즐을 던져주었습니다.
놀이터: 상태 유지형 비디오 게임
MM-ToolSandBox를 16개의 서로 다른 시뮬레이션 세계에 펼쳐진 511개의 다양한 도구(쇼핑 카트, 음악 플레이어, 달력, 파일 관리자 등)가 있는 비디오 게임이라고 생각해 보세요. 하지만 여기에는 반전이 있습니다. 이 게임은 "상태 유지(stateful)" 방식입니다. 즉, 만약 당신이 1라운드에서 바나나를 샀다면, 2라운드에서도 그 바나나는 실제로 당신의 카트에 들어있다는 뜻입니다. 로봇은 자신이 무엇을 했는지 기억해야 하고, 변화하는 세상을 추적해야 하며, 당신이 대화 도중 마음을 바꿀 수도 있는 **다회차 대화(multi-turn conversations)**를 처리해야 합니다.
더 멋진 점은 로봇이 당신이 보내는 이미지를 봐야 한다는 것입니다. 당신이 콘서트 포스터 사진을 찍어 보내며 "이 티켓을 구매해 줘!"라고 말하거나, 엉망진창인 스프레드시트 스크린샷을 보내며 "합계를 찾아줘"라고 할 수도 있습니다. 로봇은 사진을 읽고, 어떤 도구를 사용할지 파악한 뒤, 이 시뮬레이션 환경 내에서 실제로 그 일을 수행해야 합니다.
테스트: 258개의 까다로운 시나리오
연구진은 단순히 무작위 작업을 만든 것이 아닙니다. 그들은 258개의 인간 검증 시나리오(인터랙티브 화면을 위한 50개의 특별 시나리오 포함)를 생성하는 기계를 구축했습니다. 이 작업들은 쉽지 않았습니다. 여기에는 다음과 같은 것들이 포함되었습니다:
- 점진적 도착: 대화 중간에 사진을 보내면, 로봇은 나중에 그 사진을 기억해내야 합니다.
- 목표 변경: 당신이 "비행기를 예약해 줘"라고 했다가, 5분 뒤에 "아니, 사실 됐어, 대신 해변으로 가자"라고 말을 바꿉니다.
- 오류 수정: 당신이 사진 속의 날짜를 잘못 말했을 때, 로봇이 그 실수를 잡아내야 합니다.
그들은 아주 작은 오픈 소스 모델부터 가장 크고 비싼 "프런티어(frontier)" 시스템에 이르기까지, 세계에서 가장 똑똑한 12개의 AI 모델을 테스트했습니다.
대반전: 로봇들은 여전히 서투르다
결론은 이렇습니다: 세계 최고의 로봇조차 절반 이상의 경우에 실패했습니다.
최고 성능을 보인 모델인 Claude 4.5 Opus조차 성공률은 **48.8%**에 불 불과했습니다. 이는 모델이 절반 이상의 시나리오에서 실패했음을 의미합니다. 논문은 이 모델들이 시각적 도구 호출(visual tool calling)을 "해결했다"는 아이디어를 명시적으로 부정합니다. 그들은 여전히 고전하고 있습니다.
"왜?": 두 가지 실패의 이야기
연구진은 로봇이 왜 실패하는지 깊이 파고들었고, 로봇의 뇌 크기에 따라 달라지는 흥미로운 패턴을 발견했습니다.
작은 로봇들 ( "무엇을 해야 할지 모르겠어요" 문제):
작은 모델들(40억 개의 파라미터를 가진 모델들 등)은 주로 **계획(planning)**을 세우지 못해서 실패했습니다. 사진을 보고 사용자가 무엇을 원하는지는 알았지만, 어떤 버튼을 눌러야 할지 혹은 어떤 도구를 사용해야 할지 결정하는 과정에서 길을 잃었습니다. 그들은 마치 케이크를 구워야 한다는 것은 알지만, 어떻게 오븐을 켜야 하는지는 모르는 아이와 같았습니다.큰 로봇들 ( "무엇이 보이는지 모르겠어요" 문제):
거대 모델들(3,970억 개의 파라미터를 가진 모델들 등)은 계획 세우기에는 뛰어났습니다. 어떤 도구를 어떤 순서로 사용할지 정확히 알고 있었습니다. 하지만 그들은 사진을 올바르게 읽지 못해서 실패했습니다.
- 통계: 최고 성능 모델들의 실패 중 **53%**는 "사실 관계 오류(factual errors)"였습니다.
- 비유: 아주 유능한 요리사가 케이크 레시피를 정확히 알고 있다고 상상해 보세요. 재료를 집어 들고, 완벽하게 섞고, 맛있게 굽습니다. 하지만 당신이 보낸 초콜릿 바 사진을 보고, 라벨을 잘못 읽어서 초콜릿 대신 버터를 집어 든 것입니다. 그들은 모든 것을 제대로 했지만, 단 하나, 시각적 단서를 읽는 데 실패했습니다.
이는 "교차(crossover)" 효과를 시사합니다: 모델이 커질수록, 모델은 '계획'에서 실패하는 대신 '지각(perception)'에서 실패하기 시작합니다.
"UI"의 악몽
연구진은 또한 로봇이 당신과 상호작용할 수 있는 클릭 가능한 화면(미니 앱 같은)을 직접 그려내야 하는 모드도 테스트했습니다. 이것은 훨씬 더 어려웠습니다. 최고 모델의 성공률은 이 모드에서 **26%**로 떨어졌습니다. 로봇이 화면을 읽을 수 있을 뿐만 아니라, 즉석에서 작동하는 새로운 화면을 직접 그려내는 것은 아직 해결하지 못한 거대한 과제임이 드러났습니다.
결론
이 논문은 우리가 로봇에게 생각하고 계획하는 법을 가르치는 데는 점점 더 능숙해지고 있지만, **시각적 정밀도(visual precision)**라는 벽에 부딪히고 있음을 시사합니다. 로봇은 무엇을 해야 할지는 알 만큼 똑똑하지만, 당신이 보내는 사진의 작은 글씨를 읽기에는 여전히 너무 서투릅니다.
저자들은 시각적 도구 호출은 아직 갈 길이 멀다고 결론지었습니다. 오늘날 가장 강력한 모델들조차 목표에 미치지 못하고 있으며, 이를 해결하기 위해서는 단순히 더 많이 생각하는 것이 아니라, 로봇이 더 명확하게 볼 수 있도록 만드는 새로운 종류의 연구가 필요합니다. 이 프레임워크와 테스트 결과는 공개되었으므로, 다른 과학자들이 로봇이 세상을 조금 더 잘 읽을 수 있도록 돕기 위해 도전할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.