← 최신 논문
💻 computer science

Where To Look? : Causal Tracing of Vision Encoders in VLM

이 논문은 인과적 추적(causal tracing)을 활용하여 시각-언어 모델들이 종종 대상 영역 외부의 시각적 토큰에 의존하고 구조를 이해하기 위해 외관 단서를 이용한다는 점을 밝혀냄으로써, 모델의 높은 성능의 묘사와 실제 시각 정보의 공간적 국소화 또는 구조적 추론 사이의 근본적인 간극을 드러낸다.

원저자: Naren Kumar S, Tirth Bhatt, Mayank Singh

게시일 2026-08-12
📖 5 분 읽기🧠 심층 분석

원저자: Naren Kumar S, Tirth Bhatt, Mayank Singh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

탐정의 딜레마: AI의 눈은 실제로 어떻게 보는가?

당신이 로봇에게 세상을 이해하는 법을 가르치고 있다고 상상해 보세요. 로봇에게 카메라와 두뇌를 주고, 강아지 사진을 묘사해 보라고 요청합니다. 수년 동안 과학자들은 이러한 "시각-언어 모델(Vision-Language Models, VLMs)"이 놀라운 정확도로 이를 수행할 수 있다는 사실에 경탄해 왔습니다. 하지만 한 가지 의문이 계속 남았습니다. 도대체 어떻게 하는 것일까요? 그들은 정말 우리처럼 강아지를 "보는" 것일까요, 아니면 그저 아주 작고 숨겨진 단서들을 바탕으로 추측하고 있는 것일까요?

이 질문에 답하기 위해 연구자들은 **인과적 추적(causal tracing)**이라는 기법을 사용합니다. 이것을 탐정의 "만약 ~라면(what-if)" 시나리오라고 생각해보세요. 만약 로봇의 두뇌에서 특정 정보 조각을 빼내고 다른 정보 조각으로 교체한다면, 결과가 바뀔까요? 만약 답이 급격하게 변한다면, 그 정보 조각은 "인과적으로 중요한" 것이었습니다. 보통 우리는 로봇이 강아지에 대해 이야기하고 있다면, 그 로봇의 두뇌에서 가장 중요한 부분이 바로 강아지를 바라보고 있을 것이라고 가정합니다. 하지만 만약 로봇이 실제로는 풀밭이나 하늘, 혹은 그림자에 주의를 기울이고 있으면서 단지 강아지가 거기 있다고 추측하고 있는 것이라면 어떨까요? 이 논문은 그 미스터리를 파고들며, AI의 가장 중요한 부분이 실제로 올바른 지점을 보고 있는지 묻습니다.


어디를 봐야 하는가? AI의 거대한 미끼

이 연구에서 LINGO 연구 그룹의 연구원들은 세계에서 가장 똑똑한 AI 모델들을 대상으로 "틀린 그림 찾기" 게임을 하기로 했습니다. 그들은 알고 싶었습니다. AI가 이미지에 대한 질문에 답할 때, 실질적인 역할을 수행하는 그 부분의 두뇌가 실제로 질문의 대상인 물체를 보고 있는가?

이를 알아내기 위해 그들은 **활성화 패칭(activation patching)**이라는 영리한 기술을 사용했습니다. AI의 두뇌를 수천 명의 노동자(이하 "토큰")가 컨베이어 벨트를 따라 쪽지를 전달하는 거대한 공장이라고 상상해 보세요.

  1. 클린 런(The Clean Run): AI에게 선명한 사진과 질문(예: "파란 셔츠를 입은 여성은 어디에 있나요?")을 보여줍니다. AI는 이미지를 얼마나 잘 이해하고 있는지에 대한 점수를 냅니다.
  2. 오염된 런(The Corrupted Run): 동일한 사진에 정적 노이즈(TV 채널이 안 나올 때 나오는 눈 같은 노이즈)를 잔뜩 추가하여 AI를 혼란스럽게 만들고 점수를 떨어뜨립니다.
  3. 패치 런(The Patched Run): 이것이 마법 같은 단계입니다. 혼란스러운 노이즈 사진을 사용하되, 원래 사진에서 가져온 깨끗한 쪽지 하나를 공장 라인에 몰래 끼워 넣습니다. 만약 AI가 갑자기 정답을 기억해내고 점수가 다시 올라간다면, 그 특정 쪽지가 바로 "영웅" 토큰이었던 것입니다.

연구진은 그다음 간단한 질문을 던졌습니다. 그 영웅 토큰이 파란 셔츠를 입은 여성을 보여주는 부분에서 온 것인가? 이를 측정하기 위해 그들은 **IoU(Intersection over Union)**라는 수학 도구를 사용했는데, 이는 단순히 "이 쪽지가 실제 여성과 얼마나 겹치는가?"를 묻는 세련된 방식입니다.

충격적인 발견: AI는 엉뚱한 곳을 보고 있다

결과는 마치 당신의 가장 친한 친구가 숫자를 보는 대신 천장을 쳐다보며 수학 문제를 풀고 있다는 사실을 알게 된 것과 같았습니다.

연구팀은 클래식한 CLIP 모델부터 DeepSeek-VL, Qwen-2.5, LLaVA와 같은 거대하고 현대적인 모델들에 이르기까지 모든 것을 테스트했습니다. 그들은 가장 "인과적인" 토큰(영웅들)이 타겟 물체 바로 위에 모여 있을 것이라고 예상했습니다. 하지만 결과는 거의 존재하지 않는 수준의 약한 연결성을 보여주었습니다.

  • 숫자는 거짓말을 하지 않는다: CLIP 모델에서 "중요함"과 "올바른 위치에 있음" 사이의 상관관계는 0.062에 불과했습니다. 이는 사실상 제로에 가깝습니다.
  • 패턴의 지속: 더 크고 똑똑한 모델에서도 수치는 낮게 유지되었습니다. DeepSeek-VL의 경우, 한 종류의 노이즈에서는 0.0531 ± 0.0334, 다른 종류에서는 0.0520 ± 0.0041의 상관관계를 보였습니다. Qwen-2.5의 경우 0.0912 ± 0.0422였습니다.
  • "제로 중첩"의 놀라움: 한 특정 사례에서는, 엄청난 영향력을 가진 토큰(인과 점수 0.718)이 타겟 물체와 거의 겹치지 않는 것(IoU 단 0.049)으로 나타났습니다. 마치 AI가 피사체가 아닌 배경을 보고 퍼즐을 푼 것과 같았습니다.

저자들은 이러한 모델들이 시각적 정보를 사용하는 데는 매우 뛰어나지만, 그 정보의 구체적인 위치에 반드시 *기반(grounded)*하고 있는 것은 아니라고 제안합니다. 그들은 특정 물체에 줌인하기보다는 하늘의 색상, 바닥의 질감, 혹은 장면의 전반적인 분위기와 같은 "분산된" 단서들의 네트워크에 의존하고 있을지도 모릅니다.

규모가 크면 더 나은가?

당신은 "글쎄요, 아마 예전의 작은 모델들이 서툴렀던 것이고, 새로운 슈퍼 AI들은 이를 해결했을 수도 있지 않을까요?"라고 생각할지도 모릅니다. 연구진은 이 부분도 확인했습니다. 그들은 2023년부터 최신 2025년 출시 모델까지 살펴보았습니다.

결론은? 아니었습니다. 패턴은 변하지 않았습니다. 복잡한 질문에 답하고 지시를 완벽하게 따르는 가장 진보된 모델들조차 여전히 이러한 단절을 보여줍니다. 저자들은 모델이 테스트에서 높은 점수를 받는다고 해서 더 나은 "공간 지도"를 개발했다는 의미는 아니라고 언급합니다. 강력한 성능이 반드시 AI가 올바른 곳을 보고 있다는 것을 의미하지는 않습니다. 그것은 단지 AI가 찾을 수 있는 어떤 단서라도 사용하여 정답을 맞히는 데 매우 능숙하다는 것을 의미할 뿐입니다.

"끈(String)" 테스트: 형태를 이해하는가?

더 깊이 파고들기 위해, 팀은 다른 질문을 던졌습니다. 만약 물체의 "외형"을 제거하되 그 "형태"는 유지한다면, AI는 여전히 이해할 수 있을까요? 그들은 기하학적 구조(모양과 연결)는 유지하되 외형을 바꾸는 끈(선) 관련 과제를 사용했습니다.

그 결과, 모델들은 시각적 구조를 이해하기 위해 시각적 단서(visual cues)를 이용한다는 것을 발견했습니다. 외형 기반의 단서들이 제거되었을 때, 모델들은 구조에 대한 이해를 유지하는 데 어려움을 겪었습니다. 이는 AI가 외형과 독립적인 심층적이고 구조적인 방식으로 형태를 "보는" 것이 아니라, 연결을 이해하기 위해 표면적인 외형적 트릭에 크게 의존하고 있음을 시사합니다. 그러한 트릭이 사라지면 AI는 길을 잃습니다.

이것이 미래에 의미하는 바

이 논문은 명확하면서도 다소 불안한 메시지로 결론을 맺습니다. "보는 것"과 "추론하는 것" 사이에는 간극이 존재합니다.

모델들이 고장 난 것은 아닙니다. 단지 우리가 예상하지 못한 방식으로 작동하고 있을 뿐입니다. 그들은 마치 용의자의 얼굴을 직접 보는 대신, 용의자가 항상 빨간 모자를 쓴다는 점을 포착하여 범죄를 해결하는 탐정과 같습니다. 그들의 "인과적" 두뇌는 작업을 수행하고 있지만, 반드시 타겟을 바라보고 있는 것은 아닙니다.

저자들은 이제 이것이 현대의 모든 AI에 적용되는 보편적인 규칙인지, 아니면 자신들이 테스트한 모델들의 특이한 점인지 확인하기 위해 더 많은 모델과 다양한 유형의 카메라 아키텍처를 조사할 계획입니다. 현재로서는, AI가 이미지를 완벽하게 설명할 수 있다고 해서 우리가 생각하는 방식대로 물체를 실제로 "보고" 있다고 가정해서는 안 된다는 점을 유념해야 합니다. AI는 전체 그림을 보고 있을지 모르지만, 우리가 관심을 갖는 구체적인 지점은 놓치고 있을 수도 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →