← 최신 논문
🤖 AI

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

이 논문은 비전 언어 모델 (VLM) 이 장면 이해에는 탁월하지만 공간 추론과 시각적 관점 취하기 능력에서는 현저히 저조한 성능을 보임을 새로운 시각적 과제를 통해 규명하고, 향후 모델 개발에 명시적 기하학적 표현과 맞춤형 학습 프로토콜의 통합 필요성을 제기합니다.

원저자: Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

게시일 2026-03-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"눈을 감고 상상하기": AI 가 다른 사람의 시선을 이해할 수 있을까?

이 논문은 최신 인공지능 (AI) 모델들이 **"내가 보는 것과 너가 보는 것이 다를 수 있다"**는 사실을 얼마나 잘 이해하는지 테스트한 흥미로운 연구입니다. 마치 어린아이가 장난감을 가지고 놀 때, "엄마는 이 장난감을 볼 수 있을까?"라고 묻는 것과 같은 심리학적 실험을 AI 에게 시킨 셈이죠.

연구팀은 이 실험을 위해 레고 미니 피규어사물을 이용해 아주 깔끔하고 통제된 상황을 만들었습니다.

1. 실험의 설정: 레고 놀이터

연구팀은 레고 인형 하나와 사물 하나 (예: 개 인형, 의자, 컴퓨터 등) 를 테이블 위에 배치했습니다. 그리고 다음과 같은 변수를 바꿔가며 144 가지의 다른 상황을 만들었습니다.

  • 인형의 방향: 인형이 사물을 보고 있을까, 등을 돌리고 있을까?
  • 카메라 각도: 위에서 내려다보는 시점 (새의 눈) vs 테이블 옆에서 보는 시점 (사람의 눈).

이후 AI 에게 7 가지 질문을 던졌습니다.

  1. 눈으로 보는 것 (Scene Understanding): "여기에 인형이 몇 마리야?", "사물이랑 인형이 같은 테이블 위에 있어?"
  2. 공간 추리 (Spatial Reasoning): "사물이 인형의 왼쪽에 있어?", "인형이 어느 방향을 보고 있어?"
  3. 시점 전환 (Visual Perspective Taking): "인형이 사물을 볼 수 있을까?", "인형의 입장에서 사물은 어디에 있어?"

2. 주요 발견: "보는 것"과 "이해하는 것"의 차이

결과를 요약하면, AI 는 눈으로 보는 능력은 천재였지만, 상상하는 능력은 초보였습니다.

  • 눈으로 보는 것 (천재): "여기에 개가 하나 있네", "인형이 하나 있네" 같은 질문에는 거의 100% 정답을 맞췄습니다. 마치 카메라가 아주 선명하게 찍어주는 것처럼요.
  • 공간 추리 (초보): "인형이 북쪽을 보고 있니?" 같은 질문에서는 많이 틀렸습니다. 특히 AI 는 특정 방향 (예: 동쪽) 을 무조건 좋아해서, 인형이 서쪽을 보고 있어도 "동쪽을 보고 있어"라고 고집을 부리기도 했습니다.
  • 시점 전환 (아주 초보): "인형이 사물을 볼 수 있니?"라는 질문에서는 더 큰 실패를 보였습니다. AI 는 인형이 등을 돌리고 있어도 "아니, 인형이 사물을 볼 수 있어"라고 대답하거나, "레고 인형은 눈이 없으니까 못 봐"라고 현실적인 변명을 하기도 했습니다.

비유하자면:
AI 는 사진을 아주 잘 분석하는 카메라입니다. 사진 속의 모든 물체를 정확히 찾아냅니다. 하지만 그 사진 속 인물의 마음이나 시선을 상상하는 능력은 아직 부족합니다. 마치 "이 사람이 이 물건을 보고 있을까?"라고 물었을 때, AI 는 "물건이 있으니까 보겠지"라고 단순히 논리만 따지거나, "레고 인형은 눈이 없으니까 못 봐"라고 텍스트 데이터에 의존한 답변을 하는 식입니다.

3. 왜 이런 일이 일어날까? (방향 편향 현상)

가장 재미있는 발견 중 하나는 AI 의 **고집 (편향)**입니다.
연구팀은 인형이 어떤 방향을 보든, AI 가 "동쪽 (East)"을 보고 있다고 대답하는 경향이 있다는 것을 발견했습니다.

  • 인형의 얼굴을 확대해서 보여줘도,
  • 지도에 '동서남북' 표시를 해줘도,
  • 레고 인형 대신 실제 사람의 사진을 보여줘도,
    AI 는 여전히 "동쪽을 보고 있어"라고 고집을 부렸습니다.

이는 AI 가 시각적인 정보를 제대로 분석하기보다, 학습된 언어 패턴 (예: '동쪽'이라는 단어가 자주 나오는 패턴) 에 의존하고 있다는 뜻입니다. 마치 길을 찾을 때 나침반을 보는 대신, "아마도 동쪽이겠지"라고 무작정 추측하는 것과 같습니다.

4. 결론: AI 는 아직 '공감'이 부족합니다

이 연구는 현재 AI 가 **사물을 인식하는 능력 (Recognition)**은 뛰어나지만, **다른 존재의 시선을 이해하는 능력 (Perspective Taking)**은 여전히 부족하다는 것을 보여줍니다.

  • 현재 상태: AI 는 "무엇이 있는가?"를 잘 알지만, "누가 무엇을 볼 수 있는가?"를 잘 모릅니다.
  • 미래 과제: 자율주행차가 보행자가 무엇을 보고 있는지 이해하거나, 로봇이 인간과 협력할 때 상대방의 시야를 고려하려면, AI 는 단순히 이미지를 보는 것을 넘어 기하학적 공간 감각과 시점 전환 능력을 진정으로 학습해야 합니다.

한 줄 요약:

"AI 는 레고 인형이 무슨 옷을 입고 있는지, 몇 마리나 있는지 아주 잘 알지만, 그 인형이 어디를 보고 있는지 상상하는 능력은 아직 인간처럼 발달하지 않았습니다."

이 연구는 앞으로 더 똑똑한 AI 를 만들기 위해서는 단순히 더 많은 데이터를 주는 것뿐만 아니라, 공간을 이해하고 다른 사람의 시선을 상상할 수 있는 새로운 학습 방법이 필요함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →