The Illusion-Illusion: Vision Language Models See Illusions Where There Are None
이 논문은 현재의 시각-언어 모델들이 착시가 아닌 이미지(예: 실제로 굽은 선이나 크기가 다른 원들)를 착시로 잘못 인식하는 '환상-환상(illusion-illusions)' 현상을 겪고 있음을 밝히며, 이를 통해 이들의 시각적 추론에 존재하는 근본적인 처리 오류를 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
기술 요약: 일루전-일루전(Illusion-Illusion): 시각 언어 모델은 존재하지 않는 착시를 본다
문제 제기
지각적 착시는 현실과 외견 사이의 간극을 드러냄으로써 기저의 정신적 처리 메커니즘을 밝혀내는 인지 과학의 진단 도구 역할을 한다. 기존 연구들이 인공 시스템이 인간과 동일한 고전적 착시의 희생양이 되는지를 조사해 왔으나, 본 논문은 고전적 착시를 테스트하는 것만으로는 현재의 시각 언어 모델(VLM)을 진단하기에 불충분하다고 주장한다. 저자는 더 유효한 진단 도구로 "일루전-일전(illusion-illusion)" 또는 "일루전-일루전"을 제시한다. 이는 시각적 특성은 착시를 띠고 있으나 실제적인 지각적 속임수는 결여된 이미지를 의미한다. 이 경우, 시각적 실체는 외견과 일치한다(예: 선의 길이가 실제로 다른 경우, 오리가 실제로 오리인 경우). 즉, 이들은 유명한 착시들의 이웃 격인 이미지들이다. 핵심적인 문제는 현재의 VLM이 이러한 "일루전-일루전"을 착시로 잘못 인식하는지 여부이며, 이는 모델이 진정한 지각적 이상 현상과 단순한 시각적 사실을 구분하는 데 실패하고 있음을 드러낸다.
연구 방법론
본 연구는 다양한 지각 현상(예: 뮬러-리어 화살표, 에빙하우스 원, 카니자 삼각형, 체커 그림자 등)을 다루는 10가지 대표적 시각 착시를 포함하는 비교 평가 프레임워크를 채택하였다. 각 고전적 착시에 대해 저자는 세 가지 유형의 자극을 구성하였다:
- 착시(The Illusion): 지각적 오류를 유도하도록 설계된 원래의 이미지.
- 일루전-일루전(The Illusion-Illusion): "속임수"가 제거되어 시각적 속성이 문자 그대로인 변형 버전(예: 화살표의 축 길이가 실제로 다른 경우, 명확한 오리 이미지).
- 대조군(The Control): 기초적인 역량을 검증하기 위해 설계된 단순화된 버전(예: 단일 삼각형 식별).
평가는 8개의 최신 VLM(GPT-4o, Claude 3, Gemini Pro Vision, miniGPT, Qwen-VL, InstructBLIP, BLIP2, LLa-1.5)을 대상으로 수행되었다. 모델들에게 이미지를 제시하고 착시의 대상에 초점을 맞춘 특정 프롬프트(예: "파란 선과 빨간 선 중 어느 것이 더 긴가?")를 제공하였다. 부차적인 조건으로, 프롬프트 앞에 "다음 시각적 착시에서(In the following visual illusion)"라는 문구를 추가하여 맥락의 영향을 테스트하였다.
성능은 인간과 유사한 응답과의 일치 여부에 따라 이진 점수(0 또는 1)로 측정되었다. 고전적 착시의 경우, 점수 1은 착시된 지각을 보고하거나 착시를 인정하는 것을 의미했다. 일루전-일루전 및 대조군의 경우, 점수 1은 인간이 하는 것처럼 문자 그대로의 진실을 보고하는 것을 의미했다. 저자는 이 점수 산정 방식이 모델의 성능을 과장하는 방향으로 관대한 편이라고 언급하였다.
주요 결과
결과는 인간의 지각과 현재 VLM 능력 사이의 상당한 괴리를 보여준다:
- 일루전-일루전에 대한 실패: 고전적 착시를 성공적으로 인식하거나 보고하는 선도 모델들(GPT-4o, Claude 3, Gemini Pro)조차도 일루전-일루전을 착시로 오분류하는 경우가 빈번했다. 예를 들어, 선의 길이가 실제로 다른 경우에도, 이 모델들은 종종 선이 같다고 주장하거나(착시를 모사함) 이를 착시라고 설명한다.
- 맥락적 취약성: 프롬프트가 이미지를 "시각적 착시"라고 명시적으로 라벨링했을 때, 상위 3개 모델의 성능은 일루전-일루전과 대조군에서 크게 저하되었다. 이들은 비착시 이미지를 압도적으로 착시라고 보고하였는데, 이는 모델의 응답이 시각적 증거보다는 텍textual 프롬프트에 의해 크게 편향되어 있음을 시사한다.
- 대조군 실패: 대조군이 역량의 기준점이 될 것이라는 가설과 달리, GPT-4o, Gemini Pro, Claude 3와 같은 모델들은 단순한 대조군 이미지(예: 단일 삼각형)를 착시라고 자주 보고하였다. 이는 이 모델들에게 있어 "착시"라는 개념이 특정 지각적 판단이라기보다, 단순히 착시의 '범주'를 닮은 이미지에 광범위하게 적용되고 있음을 시사한다.
- 모델 행동 양식: 상위 모델들의 행동은 가상의 "모델 B"(착시는 인식하지만 일루전-일루전은 인식하지 못하는 모델)와 일치하지 않는다. 대신, 이들은 "평면적(flat)" 성능을 보이거나, 특히 "착시"라는 단어에 의해 유도될 때 존재하지 않는 착시를 환각(hallucinate)하는 경향에 가까운 패턴을 보인다.
주요 기여
본 논문은 인공 시스템을 위한 새로운 진단 도구로서 "일루전-일루전"이라는 개념을 도입한다. 저자는 착시를 역전시켜 사용함으로써, 현재의 VLM이 특정 실패 모드를 겪고 있음을 입증한다. 즉, 모델들은 착시를 인식하는 '패턴'을 정당하지 않은 이미지에 적용한다. 이 연구는 착시와 일루전-일루전을 구분하지 못하는 실패가 단순한 착시를 탐지하는 능력보다 훨씬 더 심오한 처리 오류의 지표임을 강조한다. 본 연구는 모델들이 맥락이 착시를 암시할 때 어떻게 문자 그대로의 시각적 실체에 기반하여 응답하는 데 실패하는지를 보여주는 데이터셋과 평가 프로토콜을 제공한다.
의의 및 주장
저자는 이러한 실패가 단순한 특이 현상이 아니라 현재 VLM의 광범위한 처리 오류를 나타내는 징후라고 주장한다. 일루전-일루전에서 실패한다는 것은 시스템이 "평범한" 입력을 사려 깊게 인식하는 것이 아니라, 시각적 데이터 자체보다는 이미지의 특징을 학습 코퍼스 내의 착시 '개념'과 연관 짓는 저수준의 유사성 매칭에 의존하고 있음을 의미한다.
이 연구의 의의는 모델이 착시를 식별할 수 있다는 능력이 인간과 유사한 지각적 이해를 갖추었음을 증명한다는 가정에 도전한다는 점에 있다. 저자는 착시에 속는 것은 인간적인 특성이지만, (속임수가 없는) 일루전-일루전에 속는 것은 시각적 데이터 자체가 아니라 착시라는 '아이디어'에 속는 시스템의 징후라고 주장한다. 본 논문은 이러한 실패가 현재의 시스템이 외견상의 문제와 입력의 실체를 구분하는 데 아직 견고하지 못함을 시사하며, 이러한 한계가 시각을 넘어 다른 양상(modality)과 영역으로 확장될 수 있다고 결론짓는다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.