WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation
이 논문은 로봇 조작 시스템이 비디오를 통해 관찰된 인간의 행동을 추론하는 능력을 평가하는 3,000개의 장기적(long-horizon) 인스턴스로 구성된 포괄적인 벤치마크인 WatchAct를 소개하며, 현재의 최첨단 모델들이 이벤트 그라운딩(event grounding), 절차적 추론(procedural reasoning), 의도 추론(intent inference), 그리고 에피소드 추적(episodic tracking)을 요구하는 작업에서 크게 어려움을 겪고 있음을 밝힙니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 주방에 들어갔는데 엉망진창인 모습을 목격했다고 상상해 보세요. 어떤 사람이 서랍을 열어 요리를 하기 위해 향신료 병 세 개를 꺼냈고, 그것들을 조리대 위에 어지럽게 늘어놓았습니다. 당신은 로봇에게 "원래 있던 곳으로 다 돌려놔"라고 말합니다.
사람에게는 이 일이 쉽습니다. 당신은 무엇이 일어났는지(향신료 병들이 서랍에서 나왔다는 것), 어떤 순서로 일어났는지(하나씩 차례대로 꺼내졌다는 것), 그리고 왜 그랬는지(요리를 하기 위해서라는 것)를 기억합니다. 당신은 머릿속에 그려지는 사람의 행동 영상을 통해 해결책을 찾아냅니다.
하지만 오늘날의 로봇에게 이것은 악몽입니다. 대부분의 로봇 벤치마크는 로봇에게 엉망이 된 조리대의 정적인 사진 한 장만을 보여주고 이를 치우라고 요구합니다. 그들은 로봇에게 그 난장판이 어떻게 만들어졌는지에 대한 '영화(과정)'를 제공하지 않습니다. 이러한 맥락이 없다면 로봇은 추측할 뿐입니다.
WatchAct는 로봇이 실제로 인간의 영상을 보고, 무엇을 했는지 이해하며, 그 기억을 바탕으로 정리하거나 작업을 계속할 수 있는지 확인하기 위해 설계된 새로운 테스트(벤치마크)입니다.
다음은 쉬운 비유를 사용한 이 기술의 작동 방식에 대한 설명입니다.
1. 테스트: "탐정과 배우"
로봇을 탐정으로, 영상을 범죄 현장 테이프로 생각해 보세요.
- 입력: 로봇은 인간이 무언가(예: 그릇을 움직이는 것)를 하는 영상과 텍스트 지시문(예: "그릇을 제자리에 놓아라")을 받습니다.
- 목표: 로브은 숨겨진 이야기를 파악해야 합니다. 인간은 배가 고파서 그릇을 옮겼을까요? 그릇을 왼쪽으로 옮겼을까요, 오른쪽으로 옮겼을까요? 원래 어디에서 왔을까요?
- 규모: 이 테스트에는 14가지 유형의 서로 다른 도전 과제를 아우르는 3,000개의 다양한 시나리오(마치 짧은 영화들의 거대한 도서관처럼)가 포함됩니다.
2. 네 가지 "두뇌 기술" 테스트
연구진은 이 작업들을 네 가지 카테고리로 분류했는데, 이는 마치 서로 다른 단계의 탐정 업무와 같습니다.
- 이벤트 그라운딩 (단서 포착하기): 로봇이 영상을 보고 "아, 3초 지점에서 인간이 빨간 컵을 집었다"라고 말할 수 있습니까? 이는 영화에서 중요한 특정 순간을 찾아내는 것과 같습니다.
- 절차적 추론 (레시피 이해하기): 로봇이 사건의 순서를 이해할 수 있습니까? 만약 인간이 선반에 책을 놓은 다음 테이블에 컵을 놓았다면, 로봇은 이를 역순으로 수행하거나 계속 진행하기 위해 그 순서를 알아야 합니다.
- 암묵적 의도 추론 (마음 읽기): 때때로 인간은 말로 표현하지 않고 몸짓으로 나타냅니다. 만약 인간이 병을 향해 막연하게 가리킨다면, 로봇은 "아, 저걸 열고 싶어 하는구나"라고 추측할 수 있습니까?
- 에피소드 추론 (기억력 테스트): 로봇이 장면이 어떻게 변했는지 기억할 수 있습니까? 만약 인간이 의자를 구석에서 가운데로 옮겼다면, 로봇은 그것을 다시 제자리에 두기 위해 의자의 "원래 집"이 어디였는지 알아야 합니다.
3. 로봇을 테스트하는 방법
연구진은 단순히 로봇에게 "해봐"라고 시키는 것이 아니라, 로봇의 뇌를 두 부분으로 나누어 어디에서 실패하는지 확인했습니다.
- 플래너 (두뇌): 로봇이 영상을 보고 단계별 계획을 세울 수 있습니까? (예: "1. 병을 집는다. 2. 선반으로 이동한다.")
- 수행자 (손): 만약 당신이 로봇에게 완벽한 계획을 준다면, 로봇이 실제로 팔을 움직여 이를 수행할 수 있습니까?
이들은 컴퓨터 시뮬레이션과 실제 로봇 팔(Franka Research 3)을 사용하여 이를 테스트했습니다.
4. 결과: "로봇은 여전히 배우는 중입니다"
결과는 겸허했습니다. 현재 사용 가능한 가장 똑똑한 AI 모델들도 매우 힘겨워했습니다.
- "두뇌"의 실패: 영상을 보고 계획을 세우라는 요청에 대해, 가장 뛰어난 AI(Gemini-3.1-Pro)는 단 **36.8%**의 성공률을 보였습니다. 인간은 **97.1%**를 기록했습니다. AI는 기본적으로 절반 이상의 작업에서 추측을 하고 있는 셈입니다.
- "손"의 실패: 연구진이 로봇에게 완벽한 계획을 주었을 때(즉, "두뇌" 부분이 문제가 아니었을 때), 로봇의 "손"(정책)은 단 **21.5%**의 성공률만을 보였습니다. 이는 완벽한 레시피를 가지고 있음에도 오븐 사용법을 몰라 케이크를 태워 먹는 것과 같습니다.
- 현실 세계는 더 어렵다: 실제 로봇 팔에 이 테스트를 적용했을 때, 성공률은 **14.0%**로 더욱 떨어졌습니다.
5. 왜 실패하는가?
연구진은 로봇이 실패하는 세 가지 주요 원인을 발견했습니다.
- 긴 이야기: 영상이 길거나 단계가 많으면(예: 6단계 요리 과정), 로봇은 혼란을 느끼고 끝에 도달할 때쯤 시작 부분을 잊어버립니다.
- 관점 문제: 영상이 이상한 각도(예: 인간의 뒤쪽)에서 촬영되었거나, 지시문에 "인간의 왼쪽"이라는 표현이 있으면 로봇은 길을 잃습니다. 로봇은 "인간의 왼쪽"을 "로봇의 왼쪽"으로 번역하지 못합니다.
- 새로운 물체: 로로봇이 본 적 없는 물체(예: 새로운 형태의 상자)를 보면 얼어붙습니다. 자신의 지식을 일반화하지 못하는 것입니다.
결론
WatchAct는 현실을 직시하게 해주는 지표입니다. 이는 로봇이 정적인 방 안에서 물건을 옮기는 데는 능숙할지 몰라도, 사람을 관찰하고, 난장판 뒤에 숨겨진 이야기를 이해하며, 다음에 무엇을 해야 할지 파악하는 데는 형편없다는 것을 보여줍니다.
논문은 우리가 집에서 로봇과 함께 진정으로 협력하며 살기에는 아직 멀었다고 결론짓습니다. 왜냐로 로봇은 아직 인간처럼 "보고 배우는" 능력이 부족하기 때문입니다. 로봇이 우리를 도와주기 위해 주방에서 신뢰를 얻으려면, 영상 속의 점들을 연결하는 능력을 훨씬 더 발전시켜야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.