Investigating Relational Reasoning in VLMs
이 논문은 합성 기하학 데이터셋과 Qwen3-VL-4B 모델을 사용하여 시각적 관계를 이해하는 것이 시각적 관계에 대한 진정한 이해인지 아니면 언어적 지름길에 의존하는 것인지를 조사하며, 현재의 VLM이 진정한 시각적 추론과 주로 언어적 단서에 뿌리를 둔 전략을 결합하고 있음을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능의 지형 속에서, 시각과 언어를 동시에 학습한 새로운 세대의 컴퓨터가 등장했다. 시각-언어 모델(vision-language models)로 알려진 이 시스템들은 사진을 보고 그 내용을 설명하거나, 보이는 것에 대해 질문에 답하거나, 심지어 이미지를 기반으로 퍼즐을 풀 수도 있다. 인간 관찰자에게 이들은 마치 장면을 한 번 훑어보는 것만으로도 사물들이 서로 어떻게 연결되어 있는지 즉각적으로 파악하는 사람처럼, 시각적 세계를 진정으로 이해하고 있는 것처럼 보인다. 그러나 근본적인 의문은 여전히 해결되지 않은 채 남아 있다. 이 기계들이 사물 사이의 공간적 관계와 연결성을 진정으로 이해하고 있는 것인가, 아니면 단순히 언어적 기교와 통계적 추측에 의존하는 영리한 패턴 매칭 도구에 불과한 것인가? 이러한 불확실성이 중요한 이유는, 만약 이 시스템들이 지름길을 통해 이해하는 척 흉내만 내는 것이라면, 훈련 데이터와 일치하지 않는 상황에 직면했을 때 예측 불가능하게 실패하여 중요한 응용 분야에서 오류를 초래할 수 있기 때문이다.
연구팀은 복잡한 현실 세계를 제거하고 이를 통제된 합성 환경으로 대체함으로써 이 모델들의 내부 작동 방식을 밝혀내고자 했다. 그들은 원, 사각형, 삼각형과 같은 단순한 기하학적 도형들이 특정 패턴으로 배치된 수천 개의 단순한 이미지로 구성된 맞춤형 데이터셋을 제작했다. 이 도형들은 고유한 색상과 크기를 부여받았으며, 어떤 경우에는 화살표가 그려져 객체들을 명시적으로 연결하기도 했고, 다른 경우에는 상대적인 위치에 의해서만 연결이 암시되기도 했다. 연구진은 현대적인 시각-언어 모델에 일련의 정밀한 질문을 던졌다. 도형의 개수를 식별하거나, 특정 색상을 인식하거나, 두 객체 사이의 화살표 방향을 결정하도록 요청했다. 모델의 답변을 합성 이미지의 알려진 사실과 비교함으로써, 그들은 기계가 정확히 얼마나 잘 수행하고 있는지를 측정할 수 있었다.
결과는 모델이 쉽게 할 수 있는 일과 이해하기 어려워하는 일 사이에 극명한 차이가 있음을 보여주었다. 도형의 총 개수를 세거나 녹색 사각형이 존재하는지 확인하는 것과 같은 단순한 인식 질문에 대해서는, 모델은 종종 96%를 상회하는 완벽에 가까운 정확도를 보이며 매우 우수한 성능을 나타냈다. 이는 모델이 이미지의 구체적인 요소들을 확고하게 파악하고 있는 것처럼 보이게 했다. 그러나 질문이 명시적인 시각적 단서 없이 관계를 이해해야 하는 요건을 갖추게 되자, 모델의 성능은 현저히 떨어졌다. 예를 들어, 화살표가 그려져 있지 않을 때 어떤 객체들이 연결되어 있는지 묻거나, 오직 배치를 바탕으로 한 도형 간의 상대적 위치를 설명하라고 했을 때, 모델의 정확도는 약 60% 또는 그 이하로 떨어졌다. 흥iano하게도, 그려진 화살표의 방향을 묻는 것과 같이 명시적인 시각적 표식이 제공된 질의의 경우, 모델은 92% 이상의 높은 정확도를 유지했다. 이는 기계가 장면의 일관된 정신적 지도를 구축하는 것이 아니라, 질문에 사용된 특정 단어와 명시적인 시각적 표식에 크게 의존하고 있음을 시사했다.
모델이 관계를 실제로 '보고' 있는 것인지 아니면 언어를 바탕으로 추측하고 있는 것인지를 판단하기 위해, 연구진은 이미지 자체를 수정하는 엄격한 테스트를 실시했다. 그들은 특정 요소 하나, 예를 들어 단 하나의 도형이나 화살표를 디지털 방식으로 제거한 수정된 버전의 원본 사진들을 만들고, 다시 동일한 질문을 던졌다. 만약 모델이 진정으로 시각적 증거를 바탕으로 추론하고 있다면, 이미지의 핵심 부분을 제거했을 때 모델의 정확도가 급락해야 했다. 어떤 경우에는 실제로 그러한 일이 일어났다. 도형의 개수를 세거나 화살표 방향을 따르는 질문에서, 관련 시각적 요소를 제거하자 모델의 성능이 거의 25% 가까이 하락했다. 이는 해당 작업들에 대해 모델이 실제로 이미지를 보고 있기는 하지만, 장면이 변할 때 취약해지는 내부적 편향과 시각적 데이터를 혼합하고 있음을 나타냈다.
더 놀랍게도, 연구진은 다른 유형의 질문들에 대해서는 시각적 요소를 제거하는 것이 모델의 성능을 향상시키거나 변화 없이 유지한다는 것을 발견했다. 도형의 상대적 위치나 화살표 없는 연결의 존재 여부를 물었을 때, 시각적 증거가 가려졌을 때 모델은 오히려 더 나은 답변을 내놓았다. 논문에서 "놀랍고 시각적 추론과 직접적으로 모순된다"고 언급한 이 역설적인 결과는, 모델이 이러한 문제를 해결하는 데 시각적 데이터를 전혀 사용하지 않고 있었음을 강력하게 시사한다. 대신 모델은 질문이 어떻게 구성되었는지에 따른 언어적 단서에 기반하여 답을 추측하고 있었다. 기계는 공간에 대해 추론하는 것이 아니라, 언어적 단서에 따라 확률 높은 응답을 읊고 있었던 것이다.
연구진은 모델의 처리 계층 내부를 들여다봄으로써, 초기 이미지 입력에서 최종 답변에 이르기까지 정보가 어떻게 흐르는지 추적했다. 그들은 모델의 초기 계층들이 특정 색상이나 모양의 존재와 같은 단순한 세부 사항을 포착하는 데 매우 뛰어나다는 것을 발견했다. 정보가 시스템의 더 깊은 곳으로 이동함에 따라, 모델은 개수를 세거나 거친 관계를 식별하는 데 더 능숙해졌다. 그러나 더 깊은 계층들은 화살표의 정확한 방향이나 명시적 표식 없는 아이템들의 공간적 배치와 같은 복잡하고 추상적인 관계를 일관되게 인코딩하는 데 실패했다. 이 연구는 이러한 강력한 시스템들이 많은 시각적 작업에서 높은 점수를 얻을 수 있지만, 그 이해는 명시적으로 관찰 가능한 것에 엄격히 제한되어 있다고 결론짓는다. 이들은 진정한 시각적 이해를 보여주는 것이 아니라, 실제적인 시각적 지각과 언어적 지름길을 결합한 하이브리드 전략에 의존하고 있다. 이러한 발견은 현재의 인공지능이 가진 결정적인 한계를 강조하며, 진정한 시각적 이해를 위해서는 단순히 픽셀과 단어를 처리하는 것 이상의 것, 즉 이 모델들이 아직 달성하지 못한 더 깊고 견고한 형태의 추론이 필요함을 시사한다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.