← 최신 논문
🤖 AI

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

본 논문은 새로운 프롬프트 체이닝 프레임워크를 사용하여 GPT-4o 와 같은 주요 멀티모달 기초 모델들을 표준 컴퓨터 비전 작업에서 벤치마크함으로써, 이러한 모델들이 강력한 의미적 이해력을 갖춘 존경할 만한 일반 모델로 기능하지만 기하학적 작업에서는 전문 모델에 비해 뒤처지며 특정 실패 양상을 보임을 규명한다.

원저자: Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

게시일 2026-05-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분은 멀티모달 기초 모델(MFMs, GPT-4o, Gemini, Claude 등)이라 불리는, 지극히 똑똑하고 독서량이 풍부한 사서들의 그룹을 가지고 있습니다. 이 사서들은 인터넷에 있는 거의 모든 책을 읽었으며, 그림을 아름답고 시적인 세부 묘사로 설명할 수 있습니다. 그들은 "이 사진에서 무슨 일이 일어나고 있나요?" 또는 "이 개에 대한 이야기를 써 주세요"와 같은 질문에 답하는 것으로 유명합니다.

하지만 EPFL 의 연구자들은 다른 질문을 던졌습니다. "이 사서들이 실제로 전문 사진작가나 3D 건축가의 일을 수행할 수 있을까요?"

이를 확인하기 위해 연구자들은 사서들에게 단순히 대화를 나누게 하는 것이 아니라, 일반적으로 특수 컴퓨터 비전 로봇에게만 허용되는 엄격한 기술 시험을 통과시켰습니다. 그들이 어떻게 수행했고 무엇을 발견했는지, 간단하게 설명해 드리겠습니다.

도전 과제: "텍스트 전용" 문제

주요 문제는 이러한 AI 모델이 말하도록 훈련되었지, 그리거나 측정하도록 훈련되지 않았다는 점입니다. 표준 비전 로봇에게 "고양이를 찾아라"고 요청하면, 로봇은 고양이 주위에 상자를 그립니다. 하지만 텍스트 기반 AI 에게 요청하면, "고양이가 보입니다"라고 말할 뿐입니다.

공정하게 테스트하기 위해 연구자들은 **"프롬프트 체이닝 (Prompt Chaining)"**이라는 번역 게임을 고안했습니다.

  • 비유: 여러분이 눈가리개를 하고 거대한 도서관에서 특정 책을 찾아야 한다고 상상해 보세요. 볼 수는 없지만, 가이드에게 질문할 수는 있습니다.
  • 방법: AI 에게 "고양이 주위에 상자를 그려라"(이는 AI 가 기본적으로 할 수 없음) 고 요청하는 대신, 연구자들은 작업을 텍스트 기반의 작은 단계로 분해했습니다. 그들은 AI 에게 "왼쪽 상단에 고양이가 있나요?"라고 물었고, "아니오"라는 답변을 받았습니다. "중앙에 고양이가 있나요?"라고 물었고, "네"라는 답변을 받았습니다. 그리고 "중앙의 윗부분에 있나요?"라고 물었고, "네"라는 답변을 받았습니다.
  • 이러한 작은 '예/아니오' 질문들을 체인링 (연결) 함으로써, AI 는 결국 물체가 어디에 있는지 지도를 구축하게 되며, 텍스트만으로 상자를 그리거나 마스크를 만드는 효과를 냅니다. 이를 통해 연구자들은 동일한 작업에서 '말하는 이들'(일반 모델) 과 '행동하는 이들'(전문가 모델) 을 직접 비교할 수 있었습니다.

시험: 무엇을 테스트했나요?

연구자들은 모델들에게 쉬운 것부터 매우 어려운 것까지 여섯 가지 유형의 테스트를 제공했습니다.

  1. 분류 (Classification): "이것은 무엇인가요?" (예: 얼룩말을 식별하는 것).
  2. 객체 탐지 (Object Detection): "얼룩말은 어디에 있나요?" (주위에 상자를 그리는 것).
  3. 분할 (Segmentation): "얼룩말에 속하는 픽셀은 무엇인가요?" (얼룩말을 완벽하게 색칠하는 것).
  4. 그룹화 (Grouping): "내가 얼룩말의 귀를 터치하면, 같은 얼룩말에 속하는 다른 픽셀은 무엇인가요?"
  5. 깊이 예측 (Depth Prediction): "이미지의 어느 부분이 카메라에 더 가까운가요?" (3D 거리 지도 생성).
  6. 표면 법선 (Surface Normals): "표면은 어느 방향을 향하고 있나요?" (이 벽이 왼쪽, 오른쪽, 위, 아래 중 어느 방향을 향하고 있나요?).

결과: "일반주의자" 대 "전문가"

1. 그들은 훌륭한 "일반주의자"이지만, "전문가"는 아닙니다.
AI 모델들은 일반주의자로서 놀라울 정도로 잘 수행했습니다. 그들은 무작위 추측보다 물체를 식별하고 일반적인 장면을 이해하는 데 능했습니다. 그러나 그들은 여전히 이러한 작업을 위해 특별히 제작된 전문 로봇들에 비해 상당히 뒤처져 있습니다.

  • 비유: AI 는 모든 것에 대해 조금씩 아는 천재적인 일반의사와 같습니다. 전문가 모델들은 신경외과 의사처럼 특화된 존재들입니다. 일반의사는 두통을 진단할 수 있지만, 외과 의사만큼 뇌 수술을 잘 수행할 수는 없습니다.

2. "의미론적" 대 "기하학적" 격차
모델들은 의미론적(무엇이 무엇인지 이해) 작업보다 기하학적(3D 공간에서 무언가가 어디에 있는지 이해) 작업에서 훨씬 더 뛰어났습니다.

  • 그들은 "저것은 얼룩말입니다"라고 쉽게 말할 수 있었습니다.
  • 하지만 "저 얼룩말은 5 미터 떨어져 있고, 등쪽이 약간 왼쪽을 향하고 있습니다"라고 말하기는 어려워했습니다.
  • 비유: 그들은 영화의 줄거리를 설명하는 데는 뛰어나지만, 세트 디자인을 그리거나 폭발의 물리학을 계산하는 데는 형편없습니다.

3. "흐릿한 시야" 문제
연구자들이 AI 에게 정밀한 윤곽선을 그리게 하려고 시도했을 때, 모델들은 종종 미세한 세부 사항에서 어려움을 겪었습니다. 마치 "흐릿한 시야"를 가진 것처럼 보였습니다.

  • 이를 해결하기 위해 연구자들은 AI 에게 이미지에서 "확대된" 컷 (현미경으로 보는 것과 같은) 을 제공하여 가장자리를 명확하게 볼 수 있도록 도와주어야 했습니다. 이 도움이 없으면 AI 의 윤곽선은 엉망이 되었습니다.

4. "추론" 모델이 게임의 규칙을 바꾸고 있습니다
이 논문은 o1, o3, o4-mini 와 같은 새로운 유형의 AI 인 "추론 모델 (Reasoning Models)"을 테스트했습니다. 이러한 모델들은 답변하기 전에 추가 시간을 들여 "생각"합니다.

  • 결과: 이러한 사고하는 모델들은 표준 모델들보다 어려운 3D 기하학 작업 (깊이 및 표면 법선) 에서 훨씬 더 뛰어났습니다. 그들은 공간적 관계를 파악하기 위해 논리를 사용하는 반면, 표준 모델들은 패턴에 기반하여 단순히 추측하는 것처럼 보였습니다.

5. "환각" 문제
연구자들이 실제로 그림을 그릴 수 있는 (대화를 나누는 것이 아니라 그림을 생성하는) 최신 GPT-4o 를 테스트했을 때, 그것이 **환각 (Hallucinations)**에 취약하다는 사실을 발견했습니다.

  • 비유: 만약 "얼룩말을 그려라"고 요청하면, 얼룩말을 그릴 수도 있지만, 실수로 유니콘의 뿔을 추가하거나 얼룩말의 다리를 잘못된 위치에 배치할 수도 있습니다. 이미지 생성은 유망하지만, 현재로서는 정밀한 작업에는 신뢰할 수 없습니다.

결론

이 논문은 이러한 거대한 AI 모델들이 이미지의 의미를 이해할 수 있는 인상적인 "일반주의자"이지만, 엔지니어와 과학자들이 정밀 측정 및 3D 재구성을 위해 사용하는 전문 도구를 대체할 준비는 아직 되지 않았다고 결론 내립니다.

그러나 "추론" 모델들은 이러한 격차를 좁히는 첫 번째 징후를 보이고 있으며, AI 가 더 깊이 "생각"하는 법을 배워감에 따라 물리적 3D 세계를 이해하는 능력이 언어를 이해하는 능력에 점점 따라잡아 오고 있음을 시사합니다.

중요한 참고 사항: 연구자들은 그들의 "프롬프트 체이닝" 방법이 실제 생활에서 이러한 모델을 사용하는 실용적인 방법이 아니라 테스트 도구임을 강조합니다. 이는 모델의 키를 재기 위해 자를 사용하는 것과 같습니다. 숫자를 얻는 방법이지만, 자로 집을 지을 수는 없습니다. 목표는 단순히 이러한 모델들이 실제로 얼마나 좋은지 확인하는 것이었으며, 그 답은 다음과 같습니다. "그림에 대해 이야기하는 데는 매우 뛰어나지만, 그것을 측정하는 법은 아직 배우고 있습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →