← 최신 논문
💻 computer science

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

본 논문은 시각적 질문 응답의 정확성과 픽셀 수준의 증거 기반의 정밀성을 공동으로 평가하도록 설계된 포괄적인 벤치마크인 VISTAQA와 GROVE 평가 지표를 소개하며, 시각적 증거와 답변을 정렬하지 못하는 현재 멀티모달 모델들에서 상당한 성능 격차가 드러남을 보여줍니다.

원저자: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단 한 장의 사진을 바탕으로 미스터리를 해결하는 탐정을 고용한다고 상상해 보세요.

과거에 탐정이 범인의 올바른 이름을 알려주면, 당신은 그들을 고용했습니다. 그들이 어떻게 그 사실을 알았는지는 중요하지 않았습니다. 그들은 직감, 고정관념, 혹은 운 좋은 추측을 바탕으로 추측했을 수도 있습니다. 그들이 "그것은 집사였습니다"라고 말했고 그것이 맞다면, 그들은 금별을 받았습니다. 심지어 사진 속 잘못된 사람을 가리키며 "보세요? 그게 집사입니다!"라고 말했더라도, 이름이 정확했기 때문에 여전히 그들에게 금별을 주었습니다.

이 논문은 AI 를 테스트하는 이러한 구식 방식이 결여되어 있다고 주장합니다. 이는 올바른 답을 내놓았지만 그 근거를 보여줄 수 없는 탐정을 고용하는 것과 같습니다.

문제: "운 좋은 추측" AI

저자들은 현재 AI 모델 (멀티모달 대규모 언어 모델이라고 함) 은 올바른 단어를 추측하는 데는 뛰어나다고 말합니다. 하지만 그들이 왜 옳은지 증명하는 데는 매우 서툴러요.

  • "텍스트만" 함정: AI 가 "저 개에는 다리가 세 개 있습니다"라고 말하지만 사진 속 개가 명확히 네 개의 다리를 가지고 있다면, AI 는 여전히 "세 개"라고 말할 수 있습니다. 왜냐하면 텍스트 학습을 통해 개는 보통 네 개의 다리를 가진다는 것을 알았거나, 단순히 추측했을 수 있기 때문입니다. 만약 우연히 숫자를 맞췄다면 우리는 그것을 보상합니다.
  • "그라운딩만" 함정: 반대로, 일부 AI 모델은 사진 속 사물을 가리키는 것 (예: 개 주위에 원을 그리는 것) 에는 능하지만 질문에 답하는 데는 서툴러요. 그들은 개를 완벽하게 가리킬 수 있지만 "이것은 고양이입니다"라고 말할 수 있습니다.

이 논문은 이를 "모달리티 간극"이라고 부릅니다. AI 의 뇌 (텍스트) 와 눈 (시각) 이 제대로 소통하지 못하고 있는 것입니다.

해결책: VISTAQA ("작업 과정을 보여줘" 테스트)

이를 해결하기 위해 저자들은 VISTAQA라는 새로운 테스트를 개발했습니다.

VISTAQA 를 최종 답안뿐만 아니라 작업 과정까지 채점하는 엄격한 선생님이라고 생각하세요.

  • 규칙: 합격점을 받기 위해 AI 는 다음 두 가지 일을 정확히 동시에 수행해야 합니다:
    1. 질문에 올바르게 답하기 (예: "그 차는 빨간색입니다").
    2. 이미지 속 빨간 차의 정확한 픽셀에 마스크 (하이라이터와 같은) 를 그리기로 그것을 보았음을 증명하기.

AI 가 답은 맞췄지만 잘못된 차를 하이라이트했다면 낙제입니다. 올바른 차를 하이라이트했지만 "파란색"이라고 말했다면 낙제입니다. 높은 점수를 받으려면 둘 다 완벽하게 수행해야 합니다.

데이터셋: 다양한 도전 과제들의 혼합

이 테스트는 한 가지 유형의 질문만 다루지 않습니다. 저자들은 다음을 다루는 1,157 개의 전문가가 선별한 퍼즐 라이브러리를 구축했습니다:

  • 여섯 가지 사고 유형: "이것의 색깔은 무엇인가?" (지각) 같은 단순한 질문부터 "로봇 팔에 더 가까운 물체는哪一个인가?" (추론) 같은 복잡한 질문까지.
  • 여섯 가지 다른 세계: 실내 방, 야외 거리, 수학 도표, 과학 차트, 로봇 실험실, 그리고 자율주행차 장면.
  • "함정" 질문: 질문의 약 27% 는 함정입니다. 사진에 없는 것에 대해 묻습니다 (예: "이 부엌에는 빨간 코끼리가 몇 마리입니까?"). 똑똑한 AI 는 "없습니다"라고 말하고 사진을 비워두어야 합니다. "환각"을 일으키는 AI 는 존재하지 않는 빨간 코끼리를 그리려고 할 것입니다.

점수판: GROVE

두 가지 다른 방식으로 정확해야 하는 테스트를 어떻게 채점합니까? 단순히 점수를 더할 수는 없습니다. 텍스트에서 100% 를 맞췄지만 이미지에서 0% 를 맞췄다면, 높은 평균 점수를 받아서는 안 됩니다.

저자들은 GROVE라는 새로운 채점 시스템을 고안했습니다.

  • 유추: 두 개의 다리가 있는 의자를 상상해 보세요. 한 다리가 부러지면 의자는 넘어집니다. "글쎄, 다른 다리는 완벽하니까 의자는 괜찮다"라고 말할 수는 없습니다.
  • 작동 방식: GROVE 는 "텍스트 점수"와 "이미지 점수"를 곱합니다. 둘 중 하나라도 0 이거나 매우 낮다면 최종 점수는 급락합니다. 이는 AI 가 둘 다 잘하지 못하면 나쁜 점수를 받도록 강제합니다.

결과: AI 는 여전히 배우고 있습니다

저자들은 이 새롭고 더 엄격한 테스트에서 오늘날 이용 가능한 가장 똑똑한 AI 모델들 (구글, 오픈AI 등 포함) 을 테스트했습니다.

판결은? 최고의 모델조차도 어려움을 겪었습니다.

  • 그들은 올바른 단어를 추측하는 데는 뛰어났습니다.
  • 사물을 가리키는 데는 그럭저럭 괜찮았습니다.
  • 하지만 둘 다 동시에 하라고 요청받았을 때, 그들의 점수는 크게 떨어졌습니다.

이 논문은 AI 가 말하는 데는 더 똑똑해지고 있지만, 여전히 동시에 답을 "보고" "증명"하는 법을 완전히 배우지 못했다고 결론 내립니다. AI 가 말하는 것과 실제로 보는 것 사이에는 엄청난 간극이 존재합니다.

요약

  • 구식 방식: 올바른 답을 얻었나요? 네? 수고하셨습니다. (사기나 추측 여부를 무시함).
  • 신식 방식 (VISTAQA): 올바른 답을 얻었나요 그리고 사진 속 증거를 가리킬 수 있나요?
  • 점수 (GROVE): 어느 부분이라도 놓치면 낙제입니다.
  • 발견: 현재 AI 는 여전히 답안지를 외울 수는 있지만 수업을 이해하지 못하는 학생과 같습니다. 그들은 작업 과정을 보여줄 수 있도록 배워야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →