VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
VRIQ 벤치마크는 현재의 시각-언어 모델들이 추론 능력의 결함보다는 주로 지각 능력의 한계로 인해 시각적 추론 작업에서 저조한 성능을 보이며, 정확도가 추상적 퍼즐에서는 28%, 자연 이미지에서는 45% 수준에 머문다는 것을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 책을 읽고 사진을 볼 수 있는 아주 똑똑한 로봇 팀이 있다고 상상해 보세요. 당신은 이 로봇들이 정말로 "똑똑한" 것인지, 아니면 그저 추측을 아주 잘하는 것뿐인지 알고 싶습니다. 이를 알아내기 위해, 이 논문의 저자들은 VRIQ(Visual Reasoning IQ)라고 불리는 특별한 테스트를 만들었습니다.
VRIQ를 로봇들을 속이기 위해 설계된 거대한 디지털 "퍼즐 상자"라고 생각하면 됩니다. 이 상자에는 두 가지 유형의 퍼즐이 들어 있습니다:
- 추상적 퍼즐(Abstract Puzzles): 이것은 이상한 모양, 선, 패턴이 있는 고전적인 IQ 테스트 카드와 같습니다. 여기에는 실제 세상의 물체는 없고, 오직 기호들만 존재합니다.
- 자연적 퍼즐(Natural Puzzles): 이것은 사과, 자동차, 사람과 같은 일상의 사물들이 담긴 실제 사진을 사용하지만, 동일하게 까다로운 논리 질문을 던집니다.
커다란 반전: 로봇들은 "눈이 멀어" 있었다
연구진이 현재 이용 가능한 가장 똑똑한 AI 모델들(OpenAI와 Google의 유명한 모델들 포함)을 테스트했을 때, 충격적인 사실을 발견했습니다.
- 추상적 퍼즐에서: 로봇들은 거의 무작위로 찍는 수준만큼이나 형편없는 성적을 보였습니다. 평균 점수는 약 **28%**였습니다 (25%가 순전히 운에 의한 점수입니다). 이는 마치 사전은 통째로 외웠지만, 단 한 문장도 읽지 못하는 학생과 같습니다.
- 자연적 퍼즐에서: 조금 더 나은 성적(약 45%)을 보였지만, 여전히 완벽과는 거리가 멀었습니다.
이 논문은 문제가 로봇들의 "사고력"(추론)에 있는 것이 아니라, "보는 능력"(지각)에 있다는 것을 밝혀냈습니다.
탐정 작업: 왜 실패했는가?
연구진은 로봇들이 정확히 어디에서 실패하고 있는지 알아내기 위해 탐정처럼 행동했습니다. 그들은 단순히 "정답이 무엇인가?"라고 묻지 않았습니다. 대신 "탐사 질문(probe questions)"을 사용하여 모든 퍼즐을 아주 작은 단계로 쪼개어 분석했습니다.
로봇이 홀로 남은 도형을 찾는 퍼즐에서 실패하는 상황을 상상해 보세요. 연구진은 다음과 같이 물었습니다:
- 지각 탐사(Perception Probe): "빨간색 원이 몇 개 보입니까?"
- 추론 탐사(Reasoning Probe): "만약 빨간색 원이 3개 있고 규칙이 '하나를 제거하라'라면, 남은 것은 무엇입니까?"
조사 결과:
- 56%의 경우: 로봇은 기초적인 것을 보지 못해서 실패했습니다 (예: 원의 개수를 세지 못하거나, 도형이 어느 방향을 향하고 있는지 알지 못함).
- 43%의 경우: 로봇은 기초적인 것을 보지 못했을 뿐만 아니라 논리도 파악하지 못했습니다.
- 단 1%의 경우: 로봇은 모든 것을 완벽하게 보았지만, 단지 논리가 틀렸을 뿐이었습니다.
비유하자면: 이것은 요리사에게 케이크 레시피를 주는 것과 같습니다. 요리사(AI)는 베이킹의 논리는 완벽하게 알고 있습니다. 하지만 만약 요리사가 눈이 가려져서 달걀이 4개가 아니라 2개뿐이라는 사실을 보지 못한다면, 케이크는 실패할 것입니다. 실패의 원인은 요리 논리가 아니라, 재료를 보는 능력에 있었습니다.
"도구"라는 반전
연구진은 한 가지를 더 시도했습니다. 그들은 특정 AI 모델(OpenAI의 o3)에게 돋보기, 가위(이미지를 자르는 용도), 계산기와 같은 디지털 도구들을 주었습니다. 이 모델은 답변하기 전에 이미지를 능동적으로 조작하며 "이미지로 생각할 수" 있게 되었습니다.
결과: 도구를 사용하는 이 로봇은 비약적으로 발전했습니다. 추상적 퍼즐에서 28%였던 점수가 50% 이상으로 치솟았고, 자연적 퍼즐에서는 심지어 **80~100%**까지 올라갔습니다. 이는 로봇에게 더 나은 "눈"(도구로 명확하게 보는 법)을 제공하면, 그들의 "뇌"(추론)가 훨씬 더 잘 작동한다는 것을 증명합니다.
결론
이 논문은 현재의 AI 모델들이 지능이나 논리가 부족해서 실패하는 것이 아니라고 결론짓습니다. 그들은 시각적 세계를 정확하게 **지각(perceive)**하는 데 어려움을 겪고 있기 때문에 실패하는 것입니다. 그들은 물체의 개수를 안정적으로 세거나, 3D 깊이를 이해하거나, 물체가 어느 방향으로 회전되어 있는지 파악하는 데 서툽니다.
AI가 진정으로 시각적 추론에 똑똑해지기 위해서는, 단순히 더 큰 뇌를 만드는 것뿐만 아니라, 그들에게 더 나은 눈을 주어야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.