← 최신 논문
🤖 AI

The Geometry of Representational Failures in Vision Language Models

본 논문은 시각-언어 모델(Vision-Language Models)의 표현 기하학(representational geometry)을 조사하여, 잠재적 '개념 벡터(concept vectors)' 사이의 기하학적 중첩이 환각(hallucinations) 및 객체 혼동(object confusion)과 같은 특정 시각적 실패 패턴을 정량적으로 설명하며, 이러한 현상이 스티어링 개입(steering interventions)을 통해 신뢰성 있게 조작될 수 있음을 밝힌다.

원저자: Daniele Savietto, Declan Campbell, André Panisson, Marco Nurisso, Giovanni Petri, Jonathan D. Cohen, Alan Perotti

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniele Savietto, Declan Campbell, André Panisson, Marco Nurisso, Giovanni Petri, Jonathan D. Cohen, Alan Perotti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 특수한 안경을 쓰고 북적이는 파티 현장을 바라보고 있다고 상상해 보세요. 당신의 눈에는 빨간 원, 파란 사각형, 초록색 삼각형이 보입니다. 인간의 뇌는 이 세 가지 서로 다른 항목을 머릿속에 별개로 아주 쉽게 유지할 수 있습니다. 하지만 이 논문에서 연구된 시각-언어 모델(VLM)들에게 그 파티를 보는 것은, 누군가 옆에서 소리를 지르는 와중에 머릿속으로 세 가지 서로 다른 대화를 동시에 진행하려는 것과 같습니다. 때때로 뇌가 혼란에 빠져, 실제로는 존재하지 않는 "빨간 사각형"을 보고 있다고 말하기도 합니다. 원에서 가져온 '빨간색'과 사각형의 '모양'을 뒤섞어 버린 것입니다.

이 논문은 왜 이러한 AI 모델들이 이러한 특정 "혼동" 실수, 즉 연구자들이 환각(hallucination) 또는 **착각적 결합(illusory conjunctions)**이라고 부르는 오류를 범하는지를 조사합니다.

다음은 이 발견들을 쉬운 비유를 사용하여 정리한 내용입니다.

1. 문제점: 아이디어의 "붐비는 방"

AI의 뇌를 모든 개념(예: "빨강", "파랑", "사각형", "원")이 각자의 특정 위치를 가진 거대하고 고차원적인 방이라고 생각해 보세요.

  • 인간의 방식: 인간은 "직렬 주의(serial attention)"를 사용합니다. 우리는 빨간 원을 보고, 그것을 기억에 고정시킨 다음, 파란 사각형을 봅니다. 우리는 하나씩 차례대로 처리합니다.
  • AI의 방식: 이 모델들은 전체 장면을 하나의 거대하고 즉각적인 스냅샷으로 처리하려고 시도합니다. 이들은 그 단 하나의 공간 안에 모든 개념을 동시에 집어넣어야 합니다.

논문은 너무 많은 개념이 한 방에 있을 때, 그들의 "자리"가 서로 겹치기 시작한다고 주장합니다. 만약 "빨강"의 자리와 "사각형"의 자리가 너무 가깝다면, AI는 혼란을 느껴 이 둘을 하나로 섞어버립니다. 이것을 **기하학적 간섭(Geometric Interference)**이라고 부릅니다.

2. 발견: "개념 지도" 매핑하기

연구자들은 AI의 뇌 내부에서 이러한 개념들의 실제 "좌표"를 찾을 수 있는지 알고 싶었습니다. 그들은 두 가지 주요 도구를 사용했습니다.

  • 프로브(탐정): 그들은 "빨강"이나 "파랑"을 찾아내는 간단한 탐지기를 훈련시키려 했습니다. 하지만 이는 단순히 추측만으로 건초더미 속에서 바늘을 찾는 것과 같았습니다. 탐지기는 실제 개념을 나타내기보다는 일종의 지름길(shortcut)을 찾아내는 경우가 많았습니다.
  • 센트로이드(중심점/평균): 추측하는 대신, 그들은 수백 개의 빨간색 물체 이미지를 가져와서 그 모든 것들의 수학적 "질량 중심"을 찾았고, 그것을 "빨강"의 진정한 정의로 사용했습니다.

결과: "센트로이드" 방식이 훨씬 더 효과적이었습니다. 이 방식은 AI의 뇌 내부에서 "빨강"이라는 개념이 가진 진정하고 안정적인 위치를 찾아냈습니다.

3. 증거: "리모컨" 실험

그들은 자신들이 찾은 것이 진짜 "빨강" 버튼인지 아니면 가짜 버튼인지를 증명하기 위해, 스티어링(steering, 조종) 실험을 수행했습니다.

  • 비유: 당신에게 사진 속 꽃의 색깔을 바꿀 수 있는 리모컨이 있다고 상상해 보세요.
  • 실행: 그들은 빨간 장미 사진을 가져왔습니다. 그들은 "빨강"을 제어하는 수학적 벡터(즉, "버튼")를 찾아 이를 뺐습니다. 그런 다음, "파랑" 버튼을 눌렀습니다.
  • 결과: 원래 빨간 장미를 설명하던 AI는 갑자기 파란 장미를 설명하기 시작했습니다.
  • 이것이 중요한 이유: 이는 연구자들이 AI의 뇌 안에서 색상이라는 개념을 제어하는 실제 "스위치"를 찾아냈음을 증명합니다. 이는 단순한 우연이 아니었습니다. 그들은 잠시 동안 AI의 지각 능력을 물리적으로 재배선한 것입니다.

4. "일반화의 저주"

이 논문은 이러한 혼란이 단순한 버그가 아니라, AI가 너무 똑똑하게 일반화하는 과정에서 발생하는 부작용이라고 설명합니다.

  • 비유: 당신이 아이에게 "빨강"이 사과, 소방차, 딸기에 적용된다고 가르친다고 가정해 봅시다. 이를 위해서 아이는 매우 넓고 유연한 "빨강" 카테고리를 만들어야 합니다.
  • 트레이드오프(절충): AI가 다양한 색조와 사물을 포괄할 수 있도록 "빨강"을 충분히 유연하게 만들어야 하기 때문에, "빨강"이라는 개념은 다소 "모호"하거나 "붐비게" 됩니다. AI가 빨간 원과 초록색 사각형을 볼 때, 원의 "빨간 부분"과 사각형의 "사각형 부분"이 AI의 마음속에서 너무 가까워져서 의도치 않게 합쳐지게 됩니다.
  • 논문의 결론: AI의 이해가 더 유연하고 일반화될수록, 여러 사물이 동시에 존재할 때 혼란을 겪을 가능성이 높아집니다. 이것이 바로 **"일반화의 저주(Curse of Generalization)"**입니다.

5. 실수 예측하기

연구자들은 개념 지도 내에서 개념 간의 거리를 측정함으로써 AI가 언제 실패할지를 정확히 예측할 수 있다는 것을 발견했습니다.

  • 만약 "빨강" 개념과 "사각형" 개념이 기하학적으로 가깝다면, AI는 이 둘을 섞을 가능성이 매우 높습니다.
  • 만약 멀리 떨어져 있다면, AI는 제대로 인식합니다.
  • 그들은 이 모델을 "시각 탐색(Visual Search)" 게임(군중 속에서 특정 아이템 찾기)에 테스트했습니다. AI는 방해 요소(distractor)가 목표물(target)과 기하학적으로 유사할 때 더 자주 실패했으며, 이는 그들의 지도가 예측한 바와 정확히 일치했습니다.

요약

이 논문은 AI 시각 모델이 단순히 사물을 "보는" 것이 아니라, 그것들을 기하학적 공간 안에 조직화한다는 것을 보여줍니다. 너무 많은 것을 한꺼번에 보려고 할 때, 이 아이디어들의 "형태"가 서로 충돌하여 AI가 환각을 일으키게 됩니다. 이러한 아이디어들을 매핑하고 심지어 리모컨처럼 "조종"함으로써, 연구자들은 이러한 오류가 단순한 무작위 글리치(glitch)가 아니라, AI가 정보를 저장하는 방식의 근본적인 기하학적 구조로 인해 발생한다는 것을 증명했습니다.

이 논문이 주장하지 않는 것:

  • 이 연구가 모든 AI의 문제를 해결한다고 주장하지 않습니다.
  • 이 연구가 의료 진단이나 자율주행 자동차를 위한 해결책을 제시하는 것도 아닙니다.
  • AI가 인간처럼 "의식을 갖거나" "느낀다"고 말하는 것이 아닙니다. 단지 오류의 수학적 구조가 인간의 인지적 한계와 유사해 보인다고 말할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →