← 최신 논문
💻 computer science

EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

본 논문은 23 가지 신체화 작업에 걸친 6,600 개의 주석 튜플로 구성된 세분화된 벤치마크인 EPIC-Bench 를 소개하며, 이는 고급 추론 능력을 갖추고 있음에도 불구하고 현재 시각-언어 모델이 물리적 상호작용을 위한 복잡한 시각-텍스트 정렬에 어려움을 겪고 있음을 보여줍니다.

원저자: Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 로봇 비서를 상상해 보세요. 당신에게 "탁자 위의 빨간 머그잔을 가져오세요"라고 말합니다. 이를 위해 로봇은 머그잔을 수 있어야 하고, "빨간 머그잔"이 그 특정 물체를 가리킨다는 것을 이해하며, 넘어지지 않고 그 물체까지 가는 경로를 고, 정확히 어디를 잡아야 하는지 아야 합니다.

오랫동안 우리는 이러한 로봇들의 "눈과 뇌"를 간단한 퀴즈로 테스트해 왔습니다. 우리는 그들에게 사진을 보여주고 "빨간 머그잔이 있나요?"라고 물거나, "A) 예, B) 아니요"와 같은 객관식 답안을 주었습니다.

문제는 무엇일까요? 로봇들이 속이고 있었습니다. 그들은 실제로 머그잔을 "본" 것이 아니라, 질문의 표현 방식이나 상식을 바탕으로 추측했을 뿐입니다. 이는 과목을 배우는 대신 정답지를 외우는 학생과 같습니다.

이 논문은 속임을 막고 로봇이 실제로 현실 세계를 수 있으며 상호작용할 수 있는지 확인하기 위해 고안된 새로운 훨씬 더 어려운 테스트인 EPIC-Bench를 소개합니다.

다음은 일상적인 비유를 사용하여 그들이 무엇을 했는지의 요약입니다:

1. 새로운 테스트: "마스크 게임"

"예 또는 아니오"를 묻는 대신, EPIC-Bench 는 로봇이 찾아야 하는 정확한 물체 위에 마스크(디지털 스티커와 같은) 를 그리도록 요구합니다.

  • 옛날 방식: "고양이가 있나요?" (로봇은 거실이 보이기 때문에 "예"라고 추측합니다).
  • EPIC-Bench 방식: "지저분한 거실 사진이 있습니다. 의자 아래에서 잠자는 고양이만 강조해 주세요."
  • 중요한 이유: 로봇이 의자 전체나 바닥을 강조하면 실패합니다. 이는 로봇이 단순히 단어만 본 것이 아니라 실제로 픽셀을 보았음을 증명합니다.

2. 테스트의 세 가지 수준

이 벤치마크는 집안에서 로봇이 수행해야 할 모든 작업을 다루는 세 가지 난이도 단계가 있는 비디오 게임과 같습니다:

  • 1 단계: 대상 위치 확인 ("차이점 찾기" 게임)
    로봇은 까다로운 설명에 기반하여 특정 물체를 찾아야 합니다.

    • 기본: "빨간 컵을 찾아보세요."
    • 더 어렵게: "더 큰 컵을 찾아보세요."
    • 미묘하게: "화면의 왼쪽 절반을 찾아보세요" 또는 "귀 아래에 있는 사람의 부분을 찾아보세요."
    • 주의할 점: 때로는 컵이 하나도 없고, 때로는 다섯 개일 수 있습니다. 로봇은 하나만 찾는 것이 아니라 정확하게 세어야 합니다.
  • 2 단계: 항해 ("GPS" 게임)
    로봇은 어떻게 이동할지 파악해야 합니다.

    • 지면 감지: "제가 걸을 수 있는 바닥을 보여주세요." (너무 미끄러운 러그나 바닥의 구멍은 무시해야 합니다).
    • 실현 가능한 경로: "여기서 문까지 선을 그려주세요." 선은 바닥 위에 있어야 하고 벽을 통과해서는 안 됩니다.
    • 시각적 매칭: "한 방에서 찍은 장난감 사진이 있습니다. 다른 각도에서 찍은 다른 사진에서 같은 장난감을 찾아보세요."
  • 3 단계: 조작 ("손재주" 게임)
    로봇은 물건을 어떻게 사용해야 하는지 파악해야 합니다.

    • ** affordance(사용 가능성):** "이 주전자를 어디에 잡아야 하나요?" (뜨거운 바닥이 아닌 손잡이를 찾아야 합니다).
    • 접촉: "어떤 물체들이 빵에 닿아 있나요?"
    • 배치: "이 무거운 상자를 그 약한 의자에 올려놓을 수 있을까요?" (로봇은 깨질 경우 "아니요"라고 말해야 합니다).

3. 결과: 로봇들은 여전히 배우고 있습니다

연구진은 이 새로운 테스트에서 89 개의 서로 다른 AI 모델(유명한 상용 모델과 오픈 소스 모델 모두) 을 테스트했습니다.

  • 좋은 소식: "사고" 모드(인간이 잠시 추론하는 것과 같은) 를 갖춘 가장 똑똑한 모델들이 더 잘 수행했습니다. 그들은 세상을 이해하는 데 점점 더 가까워지고 있습니다.
  • 나쁜 소식: 최고의 모델조차도 어려움을 겪었습니다.
    • 세기는 어렵습니다: "세 개의 사과"를 찾아달라고 하면, 종종 하나만 찾거나 네 번째를 환각으로 만들어냅니다.
    • 부분은 혼란스럽습니다: 전체 "의자"를 찾는 것은 뛰어나지만, "의자 다리"만 찾는 것은 매우 못합니다.
    • 방향은 까다롭습니다: 왼쪽과 오른쪽, 또는 "창을 향해 있다"는 것이 무엇을 의미하는지 혼란스러워합니다.
    • "속임수"는 사라졌습니다: 테스트가 정확한 마스크를 그리도록 요구하기 때문에 모델들은 단순히 추측할 수 없습니다. 그들은 실제로 보아야 합니다.

4. 이것이 중요한 이유

EPIC-Bench 를 AI 를 위한 운전 면허 시험이라고 생각하세요. 과거에는 자동차에게 "정지 표지를 아세요?"라고 물었을 뿐입니다. 이제는 자동차를 장애물이 있는 실제 도로에 태워 특정 지점까지 운전하게 하고, 차선에 머물렀는지 확인합니다.

이 논문은 AI 의 "눈"이 더 예리해지고 있지만, 우리의 지저분하고 현실적인 가정에서 물리적 물체와 안전하고 신뢰할 수 있게 상호작용하는 데 필요한 깊은 이해는 여전히 부족하다고 결론지었습니다. 이 새로운 벤치마크는 로봇이 정확히 어디서 실패하는지에 대한 명확한 지도를 연구자들에게 제공하여 이러한 특정 문제들을 해결할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →