← 최신 논문
🤖 AI

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

이 논문은 현재의 시각-언어 모델들이 객체 계수, 기하학적, 공간적 및 시간적 추론과 관련하여 보이는 체계적인 약점을 평가하고 드러내기 위해 TallyBench, OmniCaps, 그리고 1,200개의 질문으로 구성된 시각적 비교 데이터셋을 특징으로 하는 종합적인 벤치마크 스위트인 CompareBench를 소개한다.

원저자: Jie Cai

게시일 2026-08-31✓ Author reviewed
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jie Cai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간의 시각은 단순히 보는 것만이 아니라, 비교하는 것에 관한 것입니다. 우리는 방을 볼 때 단순히 의자와 탁자가 존재한다는 사실만을 등록하는 것이 아니라, 어떤 의자가 더 높은지, 어떤 탁자가 더 가까이 있는지, 카운터 위에 컵이 몇 개 있는지, 혹은 사진이 과거의 장면인지 현재의 장면인지를 즉각적으로 판단합니다. 이러한 것을 다른 것과 대조하여 무게를 다는 능력은 우리가 세상을 이해하는 방식의 근본적인 부분입니다. 최근 몇 년 동안 컴퓨터는 이미지를 설명하거나 그 안에 담긴 내용에 대한 질문에 답할 수 있는 놀라운 기술을 갖추며 보는 법을 학습해 왔습니다. 시각-언어 모델(vision-language models)이라고 불리는 이 시스템들은 차트를 읽거나, 사진을 묘사하거나, 시각적 퍼즐을 해결할 수 있는 많은 현대적 도구들의 엔진 역할을 하고 있습니다. 그러나 이러한 기계들이 인식과 묘사에는 능숙해졌을지라도, 인간이 매초 사용하는 직관적인 비교 능력을 갖추고 있는지 여부는 여전히 불분명한 상태로 남아 있습니다.

한 연구자가 이 질문에 답하기 위해 특화된 테스트를 구축하였으며, 시각적 정보의 비교라는 특정 행위를 분리하여 평가하도록 설계된 새로운 평가 세트를 만들었습니다. 그는 가장 진보된 컴퓨터 시스템들이 일반적인 작업에서는 우수한 성능을 보이지만, 수량, 크기, 거리 또는 시간에 대한 직접적인 비교를 요청받았을 때는 상당히 어려움을 겪는다는 사실을 발견했습니다. 이 연구는 가장 똑똑한 모델조차도 명확하게 보이는 물체를 세는 데 실패하거나, 두 물체 중 어느 것이 더 긴지 잘못 판단하거나, 두 사람 중 누가 카메라에 더 가까이 서 있는지 혼동할 수 있음을 보여줍니다. 연구자는 이러한 시스템들이 인간에게는 사소한 작업에서 종종 비틀거린다는 것을 발견했으며, 이는 시각적 세부 사항을 비교하는 능력이 현재 인공지능의 체계적인 약점으로 남아 있음을 시사합니다.

이 간극을 조사하기 위해, 연구자는 TallyBench와 OmniCaps라는 두 가지 다른 리소스로 지원되는 CompareBench라는 종합적인 테스트 세트를 구성했습니다. TallyBench는 개별 항목을 세는 능력을 테스트하기 위한 기초가 되며, 개별 항목을 세는 능력을 테스트하는 기반이 되는 동시에 수량 비교 작업을 위한 소스 이미지를 제공하는, 개, 책, 또는 숟가락과 같은 특정 유형의 물체를 세도록 묻는 간단한 질문과 쌍을 이룬 2,000개의 이미지 모음입니다. OmniCaps는 역사적 사건, 유명한 랜드마크, 그리고 유명 인사를 특징으로 하는 716개의 더 작은 이미지 세트로, 각 이미지는 특정 날짜와 함께 태그되어 있습니다. 이 컬렉션을 통해 연구자는 모델이 이미지를 연대순으로 정렬함으로써 시간의 흐름을 이해할 수 있는지 테스트할 수 있습니다. 주요 테스트인 CompareBench는 이러한 요소들을 결합하여 컴퓨터가 직접적인 비교를 수행하도록 요청하는 1,200개의 질문으로 구성됩니다. 이 질문들은 수량 비교, 길이와 두께 같은 기하학적 속성 비교, 깊이와 높이 같은 공간적 관계 판단, 그리고 사건의 시간적 순서 정하기의 네 가지 범주로 나뉩니다. 수량 비교 하위 집합은 특히 TallyBench에서 추출하여 600개의 질문을 형성합니다.

연구자는 세 곳의 주요 기술 기업에서 나온 9가지 버전의 선도적인 컴퓨터 비전 시스템을 테스트했습니다. 그는 이 모델들에게 1,200개의 비교 질문과 2,000개의 계수 작업을 해결하도록 요청했습니다. 결과는 인간의 성과와 기계의 성과 사이에 명확한 격차를 보여주었습니다. 인간은 거의 모든 작업에서 완벽에 가까운 점수를 얻었으며, 물체를 정확히 세고 크기를 쉽게 판단했습니다. 그러나 컴퓨터 모델들은 지속적인 오류를 보였습니다. 계수 작업에서 가장 우수한 모델들은 약 87%의 정답률을 기록했는데, 이는 10개 이미지 중 1개 이상의 이미지에서 물체를 놓치거나 잘못 센 것을 의미합니다. 비교 작업의 경우, 성능은 범주에 따라 달랐습니다. 모델들은 수량을 비교하는 데는 어느 정도 능숙했지만, 공간적 추론에서는 크게 어려움을 겪었으며, 어떤 물체가 카메라에 더 가까운지 또는 어떤 지점이 지면에서 더 높은지를 판단하는 데 자주 실패했습니다. 또한 두 권의 책 중 어느 것이 더 두꺼운지 결정하는 것과 같은 기하학적 비교에서도 어려움을 겪었습니다.

가장 놀라운 발견 중 하나는 시간적, 즉 시간 기반 비교 범주에서 나타났습니다. 이 섹션에서 모델들은 역사적 장면, 랜드마크, 또는 유명 인물의 이미지를 보고 무엇이 역사적으로 더 앞선 시기인지 결정하도록 요청받았습니다. 여기서 컴퓨터 모델들은 실제로 인간 피실험자들보다 더 나은 성과를 보였습니다. 시각적 증거만을 보도록 제한된 인간들은 이미지들이 매우 유사해 보이기 때문에 정확한 순서를 결정하지 못하는 경우가 많았습니다. 그러나 컴퓨터 모델들은 역사, 건축, 유명 인사에 대한 방대한 사전 지식에 접근할 수 있었습니다. 그들은 시각적 단서만으로는 불충분할 때조차 외부 지식을 활용하여 이미지를 올바르게 정렬할 수 있었습니다. 이는 모델들이 공간과 크기에 대한 진정한 시각적 이해는 부족할지라도, 외부 지식이 필요한 문제를 해결하기 위해 방대한 사실 데이터베이스를 사용하여 이를 보완할 수 있음을 시사합니다.

이러한 간헐적인 성공에도 불구하고, 이 연구는 시각적 요소를 비교하는 핵심 능력이 여전히 인공지능에 의해 완전히 숙달되지 않았음을 강조합니다. 연구자는 모델들이 물체의 길이를 높이와 자주 혼동하거나, 전경의 물체와 배경의 물체를 구분하지 못한다는 것을 관찰했습니다. 또한 모델들이 숫자를 셀 때 부분적으로 가려진 물체를 놓치는 경우가 많다는 것을 발견했는데, 이는 인간이 본능적으로 처리하는 작업입니다. 연구자는 현재의 시스템들이 미세한 시각적 비교를 요구하는 작업에 아직 신뢰할 만한 수준이 아니며, 이러한 실패가 단순한 무작위 실수가 아니라 모델이 시각 정보를 처리하는 방식의 체계적인 한계라고 결론지었습니다. 이러한 특정 기술을 분리하여 집중적으로 테스트하는 벤치마크를 제공함으로써, 이 연구는 이 분야의 발전을 측정할 수 있는 명확한 방법을 제시합니다. 연구자는 자신의 데이터와 방법론을 공개함으로써, 다른 과학자들이 이 도구들을 사용하여 결국 인간의 시각, 비교, 그리고 세상을 이해하는 능력을 따라잡을 수 있는 더 나은 모델을 구축할 수 있기를 희망하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →