← 최신 논문
🤖 AI

EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents

EgoBench 은 1,045 개의 자기 중심 비디오 작업과 시뮬레이션된 사용자 환경을 갖춘 도구 활용 에이전트를 위한 최초의 대화형 멀티모달 벤치마크를 도입하여 지각, 추론, 동적 상호작용의 시너지를 엄격하게 평가하며, 현재 최첨단 모델들이 이러한 복잡한 능력에 대해 현저히 어려움을 겪고 있음을 드러냅니다.

원저자: Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

머리에 카메라를 착용한 채 저녁 요리를 하거나 장을 보도록 로봇 집사를 가르치려 한다고 상상해 보세요. 로봇이 당신이 무엇을 하고 있는지 단순히 보는 것을 넘어, 다음에 무엇을 해야 할지 생각하고, 레시피 책이나 가격표 같은 데이터베이스를 확인하기 위해 도구를 사용하며, 혼란스러울 경우 당신에게 대답하기를 원합니다.

이 논문은 이러한 로봇 집사들을 위한 거대하고 매우 어려운 '최종 시험'이라 할 수 있는 EgoBench를 소개합니다. 간단한 비유를 사용하여 이 논문이 무엇을 하는지 요약해 보겠습니다.

1. 문제: '너무 쉬운' 테스트

강아지를 훈련한다고 상상해 보세요. 조용하고 텅 빈 들판에서 '앉아'라는 명령만 내리면 강아지는 천재처럼 보일 수 있습니다. 하지만 현실 세계에서는 자동차 경적 소리가 나고 다람쥐가 지나가는 동안, 그리고 "앉은 뒤 공을 가져오되, 빨간색일 때만 가져와"라는 복잡한 명령을 내리는 상황에서도 앉아야 합니다.

저자들은 현재 AI 에이전트들에 대한 테스트들이 바로 그 조용한 들판과 같다고 말합니다. 너무 단순합니다. 이러한 테스트들은 AI 가 다음을 할 수 있는지 확인하지 못합니다:

  • 요리하는 당신의 손에 대한 1 인칭 시점과 같이, 복잡하고 움직이는 영상에서 일어나는 일을 보는 것.
  • "토마토가 빨갛다면 냉장고를 확인하고, 유통기한이 지났다면 새 것을 사오라"와 같은 다단계 논리 퍼즐을 생각해 내는 것.
  • 인내심이 없거나, 잊어버리거나, 혼란스러운 힌트를 줄 수 있는 인간과 대화하는 것.

2. 해결책: EgoBench (장애물 코스)

EgoBench 는 AI 에이전트들이 현실 세계의 혼란을 처리할 수 있는지 확인하기 위해 특별히 구축된 새로운 테스트장입니다. 이는 세 가지 주요 부분으로 구성됩니다:

  • 영상 (눈): 정적인 이미지 대신 AI 는 짧은 1 인칭 영상 (예: 당신의 머리에서 촬영한 GoPro 영상) 을 봅니다. 마치 AI 가 당신의 안경을 쓰고 있는 것과 같습니다. AI 는 "아, 왼쪽에 토마토가 있고, 방금 그것을 집어 올렸구나"라고 파악해야 합니다.
  • 도구 (손): AI 는 단순히 추측할 수 없습니다. 숨겨진 정보를 찾기 위해 (디지털 전화번호부나 데이터베이스와 같은) '도구'를 사용해야 합니다. 예를 들어, 영상에 와인 병이 보이지만, 영상이 유통기한이 지났는지 말해주지는 않습니다. AI 는 데이터베이스를 확인하기 위해 도구를 사용해야 합니다.
  • 시뮬레이션된 사용자 (입): 이것이 가장 교묘한 부분입니다. 논문은 AI 와 대화하기 위해 '가짜 인간' (사람처럼 행동하는 컴퓨터 프로그램) 을 구축했습니다. 이 가짜 인간은 다음과 같을 수 있습니다:
    • 쉬움: 단순히 정중하게 질문합니다.
    • 어려움: 인내심이 부족하거나, 관련 없는 정보 ("그런데 날씨가 좋네요!") 를 제공하거나, AI 가 너무 느리면 화를 냅니다.
    • 정적: 모든 지시를 한 번에 큰 단락으로 제공합니다.

3. 채점 시스템: 부정 금지

많은 AI 테스트에서는 다른 AI 와 같은 똑똑한 컴퓨터가 답변을 읽고 "그것은 괜찮아 들리네!"라고 말합니다. 이는 주관적입니다.

EgoBench 는 결정론적 채점 시스템을 사용합니다. 비디오 게임 점수와 같다고 생각하세요:

  • 과정 확인: AI 가 올바른 도구를 호출했습니까? (가격을 확인했습니까? 유통기한을 확인했습니까?)
  • 결과 확인: 최종 데이터베이스 상태가 목표와 일치합니까? (상품이 실제로 장바구니에 들어 있습니까? 레시피가 업데이트되었습니까?)
    AI 가 "내가 해냈어"라고 말하지만 데이터베이스에 변경 사항이 표시되지 않으면, 점수는 0 점입니다. 선생님에게 항의할 수 없습니다.

4. 결과: '현실 확인'

저자들은 오늘 이용 가능한 가장 똑똑하고 첨단인 8 개의 AI 모델을 이 시험으로 테스트했습니다.

판결은? 그들은 처참하게 실패했습니다.

  • 가장 좋은 모델조차도 '가짜 인간'이 얼마나 까다롭게 행동하느냐에 따라 작업의 약 **19% 에서 30%**만 올바르게 수행했습니다.
  • 가장 쉬운 시나리오 (소매/쇼핑) 에서조차 가장 좋은 모델은 약 **30%**만 올바르게 수행했습니다.

왜 실패했을까요? 논문은 AI 에이전트들이 다음에서 어려움을 겪었다고 발견했습니다:

  • 영상 오해: "그게 토마토인 줄 알았는데 실제로는 빨간 고추였어."
  • 환각: 영상이나 데이터베이스에 없는 사실을 만들어 냄.
  • 나쁜 논리: '만약/그러면' 규칙을 잘못 이해함.
  • 위험한 행동: 사용자가 요청하지 않은 일을 수행함 (예: 목록에서 항목 삭제).

요약

이 논문은 AI 가 대화하고 이미지를 보는 데는 능숙해지고 있지만, 인간과 대화하고 도구를 사용하며 복잡한 규칙을 따르는 혼란스러운 현실 세계 환경에서 실제로 무언가를 수행하기 위해 이러한 기술을 결합하는 데는 여전히 매우 부족하다고 주장합니다. EgoBench 는 우리가 아직 얼마나 먼 길을 가야 하는지를 정확히 측정하기 위해 사용하는 새로운 자입니다.

중요한 참고 사항: 이 논문은 이 벤치마크와 테스트 결과만을 제시합니다. 이러한 AI 에이전트들이 아직 병원, 자율주행차, 또는 다른 구체적인 현실 세계 응용 분야에서 사용될 준비가 되었다고 주장하지는 않습니다. 단순히 "여기 시험이 있고, 현재 최상위 모델들이 이를 얼마나 poorly 수행하는지에 대한 결과가 있다"고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →