← 최신 논문
💬 NLP

The Abstraction Gap in Vision-Language Causal Reasoning

본 논문은 대부분의 비전-언어 모델이 언어적으로 그럴듯하지만 인과적으로 부정한 설명을 생성하는 중요한 "추상화 격차"를 드러내기 위해 CAGE 벤치마크와 이중 프로브 방법론을 소개하며, 특정 아키텍처에는 충실한 추론 능력이 존재하지만 표준 파인튜닝을 통해는 이를 신뢰할 수 있게 달성하지 못함을 보여줍니다.

원저자: Chinh Hoang, Mohammad Rashedul Hasan

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chinh Hoang, Mohammad Rashedul Hasan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"시각-언어 인과 추론에서의 추상화 격차"라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 정리합니다.

핵심 아이디어: 말로만 하는 것과 실제로 하는 것

취업 면접을 보러 온 학생을 상상해 보세요. "비가 오기 시작하면 피크닉에 무슨 일이 생기나요?"라고 물었습니다.

학생은 매끄럽게 대답합니다. "글쎄요, 비가 오면 피크닉은 젖고, 음식은 상하며, 모두 대피할 겁니다. 완전한 재앙이죠!"

당신은 감탄합니다. 똑똑하고 논리적이며 유창하게 들립니다. 하지만 그다음에 화이트보드에 그 이유를 보여주는 간단한 흐름도를 그려달라고 요청하자, 학생은 얼어붙습니다. '비'에서 '젖은 땅'으로, 그리고 '상한 음식'으로 이어지는 화살표를 그릴 수 없습니다. 그들은 단어는 알지만, 상황의 실제 메커니즘은 이해하지 못합니다.

이 논문은 현재의 AI 모델 (시각 - 언어 모델 또는 VLM) 이 정확히 저 학생과 같다고 주장합니다. 그들은 이미지 속 인과관계에 대해 아름답고 설득력 있는 이야기를 생성할 수는 있지만, 그들의 추론이 가진 실제 '골격'을 보여달라고 하면 종종 실패합니다.

문제: '추상화 격차'

연구자들은 이 단절을 **추상화 격차 (Abstraction Gap)**라고 부릅니다. 이는 다음 두 가지 사이의 거리를 의미합니다:

  1. 신빙성: 답변이 얼마나 잘 들리는가 (언어적 유창성).
  2. 충실성: 답변이 모델의 실제 내부 추론을 얼마나 정확하게 반영하는가 (구조적 이해).

이 논문은 대부분의 AI 모델에 대해 "잘 들리는" 점수는 높지만, "구조를 이해하는" 점수는 거의 제로에 가깝다고 주장합니다.

실험: CAGE (인과 운동장)

이를 테스트하기 위해 저자들은 **CAGE (인과 추상화 격차 평가)**라는 새로운 운동장을 구축했습니다. 그들은 해변, 공원, 거리와 같은 5,500 장의 실제 사진을 가져와 유명한 '인과의 사다리'에 기반한 세 가지 유형의 질문을 AI 에게 물었습니다.

  1. 1 단계 (관찰): "우산의 색깔은 무엇인가요?" (쉬움, 단순 관찰).
  2. 2 단계 (변화): "산에서 강한 바람이 불면 우산에 무슨 일이 생기나요?" (가정적 행동).
  3. 3 단계 (상상): "이 사진이 조용한 날이 아닌 바쁜 휴일에 찍혔다면, 장면은 어떻게 다르게 보일까요?" (반사실적).

반전:
어려운 질문 (2 단계와 3 단계) 에 대해 연구자들은 AI 에게 다음 두 가지를 순서대로 수행하도록 강요했습니다.

  1. 첫째: 간단한 화살표를 사용하여 '인과 사슬'을 작성합니다 (예: 강한 바람 → 우산에 가해지는 힘 → 우산 떨어짐).
  2. 둘째: 전체 문장 설명을 작성합니다.

결과: '마술'이 실패하다

결과는 충격적이었습니다.

  • 텍스트만 있는 테스트: AI 에게 문장만 쓰게 했을 때, 점수는 매우 높았습니다 (10 점 만점에 약 7~8 점). 천재처럼 들렸습니다.
  • 사슬 - 텍스트 테스트: AI 에게 먼저 화살표 다이어그램을 그리게 했을 때, 점수는 폭락했습니다. 대부분의 모델이 10 점 만점에 2.5 점 미만을 받았습니다. 많은 모델이 빈 답변이나 망상적인 내용을 내놓았습니다.

비유:
AI 를 앵무새라고 생각하세요. 앵무새는 훈련 데이터에서 수백만 번 들었던 "바람이 우산을 날려보낸다"라는 문구를 외웠습니다. 그 문구를 완벽하게 말할 수 있습니다. 하지만 바람이 어떻게 우산을 밀어내는지 그 물리학을 설명해 달라고 하면, 앵무새는 전혀 모릅니다. 그것은 추론의 소리를 흉내 낼 뿐, 실제로 추론을 하는 것이 아닙니다.

'마법' 같은 모델

흥미롭게도 한 모델 (LLaVA-NeXT) 은 이 격차를 메우는 데 성공했습니다. 이 모델은 높은 점수로 화살표 사슬과 문장을 모두 작성할 수 있었습니다. 이는 기술적으로 가능하다는 것을 증명합니다. 단지 대부분의 다른 모델들이 아직 그 방법을 배우지 못했을 뿐입니다.

왜 단순히 '가르칠' 수 없을까요?

연구자들은 45,000 개의 올바른 화살표 사슬이 포함된 예시들로 나쁜 모델들을 '파인튜닝 (재훈련)'하여 문제를 해결하려 했습니다. 이것이 모델들에게 구조적으로 생각하는 법을 가르쳐 줄 것이라고 기대했습니다.

결과: 작동하지 않았습니다.

  • 모델들은 문장 작성에는 약간 나아졌습니다.
  • 하지만 화살표 사슬을 그리는 능력은 나아지지 않았습니다. 오히려 일부 모델의 경우, 사슬을 배우게 강요하는 것이 모든 면에서 더 나빠지게 만들었습니다.

비유:
강아지에게 체스판 사진을 보여주며 "폰을 움직여라"라고 말하며 체스를 가르치려 한다고 상상해 보세요. 강아지는 보드에 짖는 법 (언어 모방) 은 배울 수 있지만, 게임의 규칙 (구조) 은 실제로 배우지 못합니다. 모델의 뇌가 그 유형의 논리를 처리하도록 설계되지 않았다면, 더 많은 예시를 보여주는 것만으로 새로운 유형의 사고를 강요할 수는 없습니다.

'두 개의 뇌' 발견

이 논문은 또한 '환각' (AI 가 이미지 속에 없는 것을 만들어내는 현상) 에 대해 이상한 점을 발견했습니다.

  • 일부 모델은 사물에 대해 거짓말을 하지 않는 데는 뛰어납니다 (예: 고양이가 없는데 고양이가 있다고 말하지 않음).
  • 하지만 이러한 동일한 모델들은 관계를 이해하는 데는 끔찍합니다 (예: 바람이 우산을 쓰러뜨린다는 사실을 파악하지 못함).

이는 마치 두 개의 분리된 뇌를 가진 사람과 같습니다:

  1. 뇌 A는 사물을 찾는 데 뛰어납니다 (공이 있나요? 예/아니오).
  2. 뇌 B는 사물들이 어떻게 상호작용하는지 이해하는 데 끔찍합니다 (내가 공을 차면 굴러갑니다).
    뇌 A 를 훈련시키는 것이 뇌 B 를 도와주지 않으며, 그 반대도 마찬가지입니다.

결론

이 논문은 유창한 언어가 이해의 증거가 아님을 결론지었습니다. AI 가 인과관계에 대해 설득력 있는 이야기를 쓸 수 있다고 해서, 그것이 실제로 세상을 이해한다는 뜻은 아닙니다.

  • 격차: 똑똑하게 들리는 것과 실제로 똑똑한 것 사이에는 거대한 격차가 있습니다.
  • 원인: 현재의 AI 훈련은 AI 가 인간처럼 들리게 하는 것 (유창성) 에 너무 집중하고, 논리적 구조를 구축하게 하는 것 (추론) 에는 너무 소홀합니다.
  • 미래: 중요한 작업에 대해 정말로 신뢰할 수 있는 AI 를 얻으려면, 단순히 '답변'을 요구하는 것을 멈추고 AI 가 답변을 주기 전에 '작업 과정' (인과 사슬) 을 보여달라고 요구해야 합니다. 만약 작업 과정을 보여줄 수 없다면, 아마도 그 답을 모를 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →