← 최신 논문
🤖 AI

NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models

이 논문은 10,800개의 통제된 합성 이미지로 구성된 인지적 영감을 받은 벤치마크인 NumerosityVLM을 소개하며, 시각-언어 모델(Vision-Language Models)의 수량 지각은 시각적 조건보다는 주로 모델의 구조와 언어 구성 요소에 의해 결정되며, 선형적으로 분리 가능한 수량 신호가 비전 인코더 초기 단계에서 나타난다는 점을 밝혀낸다.

원저자: Yiming Fu, Fangjun Li, Xiujin Liu, Ruidong Ma, Hang Yu, Zhichen Lu, Kanwei He, Alessandro Di Nuovo, Angelo Cangelosi, Zhegong Shangguan

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiming Fu, Fangjun Li, Xiujin Liu, Ruidong Ma, Hang Yu, Zhichen Lu, Kanwei He, Alessandro Di Nuovo, Angelo Cangelosi, Zhegong Shangguan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간은 하나씩 세지 않고도 집단 안에 몇 개의 항목이 있는지 인식하는 놀랍고도 타고난 능력을 갖추고 있습니다. 아기는 말을 배우기도 전에 세 개의 크래커 더미와 네 개의 크래커 더미를 구분할 수 있는데, 이는 발달하는 뇌에서 자연스럽게 나타나는 수에 대한 감각에 의존하는 것입니다. '수량 지각(numerosity perception)'이라고 알려진 이 기술은 우리가 세상을 이해하는 방식의 근본적인 부분입니다. 최근 몇 년 동안 과학자들은 인공지능, 특히 시각-언어 모델(vision-language model)이라 불리는 컴퓨터 시스템에 주목해 왔습니다. 이 시스템들은 이미지를 보고 그에 대한 질문에 답하도록 설계되었으며, 복잡한 작업에서 종종 인간과 같은 유창함을 발휘합니다. 그러나 하나의 의문이 남아 있습니다. 이 기계들이 정말로 "몇 개인지"에 대한 개념을 이해하고 있는 것일까요, 아니면 단순히 암기한 시각적 패턴을 바탕으로 추측하고 있는 것일까요?

이에 답하기 위해 연구진은 'NumerosityVLM'이라는 새로운 테스트 환경을 구축했습니다. 그들은 기계를 속일 수 있는 트릭들을 제거하기 위해 설계된 10,800개의 컴퓨터 생성 이미지를 만들었습니다. 현실 세계에서 숫자를 세는 일은 종-종 다른 시각적 단서들에 의해 혼동되곤 합니다. 예를 들어, 큰 물체들의 집단은 작은 물체들의 집단보다 더 많은 공간을 차지할 수 있으며, 이로 인해 시스템은 단순히 더 넓은 면적을 차지한다는 이유만으로 큰 물체가 더 많다고 생각할 수 있습니다. 이를 방지하기 위해 연구진은 이미지의 모든 세부 사항을 통제했습니다. 그들은 항목의 수는 변하지만 전체 점유 공간은 동일하게 유지되는 시나리오와, 그 반대의 시나리오를 만들었습니다. 또한, 모델이 물체의 외형에 의존하는지 아니면 실제 개수에 의존하는지 확인하기 위해 질감, 모양, 색상을 단계적으로 제거하여 단순한 점들만을 남겼습니다. 그들은 다양한 크기와 발전 정도를 가진 7개의 서로 다른 오픈 소스 모델을 대상으로 각 이미지의 항목 수를 세도록 테스트했습니다.

결과는 모델들 사이에 명확한 격차를 보여주었습니다. 내부 구조가 더 큰 더 발전된 시스템들은 시각적 단서가 오해를 불러일으킬 수 있는 상황에서도 높은 정확도를 달 Achieve하며 현저히 더 나은 성능을 보였습니다. 반면, 더 작고 오래된 모델들은 종종 서로 다른 수량을 구별하는 데 실패했으며, 사진에 무엇이 있든 상관없이 동일하고 제한된 답변만을 내놓았습니다. 연구진은 성공을 결정짓는 가장 큰 요인이 이미지의 시각적 조건이 아니라 모델 자체의 아키텍처라는 것을 발견했습니다. 기계가 어떻게 만들어졌는지가 테스트에 사용된 특정 시각적 트릭보다 훨씬 더 중요했습니다. 이는 숫자를 세는 능력이 단순히 명확하게 보는 것의 문제가 아니라, 그 정보를 처리할 수 있는 적절한 내부 구조를 갖추는 문제임을 시사합니다.

모델이 어떻게 작동하는지 더 깊이 파고들기 위해, 팀은 기계의 처리 파이프라인의 서로 다른 단계들을 살펴보았습니다. 그들은 숫자를 구별하는 능력이 기계가 이미지를 처음 바라보는 아주 초기 단계에서 이미 나타난다는 것을 발견했습니다. 성과가 낮은 모델들조차 초기 시각 계층에서는 항목의 수를 감지할 수 있었습니다. 문제는 그 이후에 발생했습니다. 숫자를 잘 셀 수 있는 모델과 그렇지 못한 모델의 차이는 그 시각적 신호를 어떻게 단어로 변환하느냐에 있었습니다. 더 성공적인 모델들은 이미 본 수치 정보를 올바른 텍스트 답변으로 변환하는 능력이 더 뛰어났습니다. 덜 성공적인 모델들은 보는 것에서 말하는 것으로 넘어가는 과정에서 그 정보를 놓치는 것처럼 보였습니다.

연구는 또한 이 기계들이 숫자의 규모를 어떻게 다루는지 조사했습니다. 가장 우수한 성능을 보인 모델들은 인간이 즉각적으로 인식할 수 있는 범위인 최대 4개까지의 작은 집단을 셀 때 거의 완벽했습니다. 숫자가 커짐에 따라 정확도는 떨어졌고, 그들은 지속적으로 실제 수보다 낮게 추측하기 시작했습니다. 이러한 과소평가 패턴은 숫자가 증가함에 따라 더 강해졌는데, 이는 큰 양을 추정할 때 정밀도가 떨어진다는 인간의 지각적 한계와도 유사합니다. 그러나 가장 발전된 모델들은 더 약한 모델들보다 훨씬 더 늦게 이 편향을 보였으며, 이는 그들이 더 큰 숫자에 대해 더 견고한 이해력을 가지고 있음을 시사합니다.

궁극적으로, 이 연구는 현재의 시각-언어 모델들이 일종의 수치적 이해력을 보유하고 있지만, 그것은 취약하며 설계에 크게 의존한다는 것을 나타냅니다. "몇 개인지"를 보는 능력은 이 시스템들의 초기 시각 처리 과정에 존재하지만, 그 지각을 신뢰할 수 있는 답변으로 바꾸는 마지막 단계에서 기계들은 종종 실패합니다. 연구는 성능의 격차가 시각적 데이터의 부족 때문이 아니라, 모델이 그 데이터를 해석하고 표현하는 방식 때문이라고 결론짓습니다. 이러한 요인들을 분리함으로써, 연구진은 인공지능이 진정한 수치적 인지 단계로 나아가는 여정에서 현재 어디에 위치해 있는지에 대한 더 명확한 지도를 제공하였으며, 기계의 눈은 숫자를 볼 수 있지만 기계의 마음은 여전히 숫자를 세는 법을 배워야 한다는 것을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →