Visuospatial Perspective Taking in Multimodal Language Models
이 논문은 다중 모달 언어 모델이 인간과 달리 자신의 관점을 억제하고 타인의 시공간적 관점을 취하는 능력 (수준 2 VPT) 에서 심각한 결함을 보임을 밝혀내어, 협업 환경에서의 활용에 한계가 있음을 지적합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🕵️♂️ 핵심 내용: AI 는 '시각적 관점 이동'에 서툴다
우리는 사람들과 대화할 때 무의식적으로 상대방이 무엇을 보고, 무엇을 모르고, 어떤 각도에서 사물을 바라보는지 상상합니다. 이를 **'시각적 관점 이동 (Visuospatial Perspective Taking)'**이라고 합니다.
하지만 이 연구는 최신 멀티모달 AI(이미지와 텍스트를 모두 이해하는 AI) 들이 이 능력에서 심각한 결함을 보인다는 것을 발견했습니다.
1. 실험 1: 회전하는 사람과 숫자 (Rotating Figure Task)
비유: imagine(상상해 보세요) AI 가 책상 위에 서 있는 인형과 바닥에 놓인 숫자 '6'을 보고 있습니다.
- 상황: AI 는 인형이 '6'을 보고 있다고 생각합니다. 하지만 인형이 180 도 뒤로 돌아서면, AI 에게는 '6'이 '9'로 보이지만, 인형에게는 여전히 '6'으로 보입니다.
- 결과:
- 쉬운 문제 (Level 1): "인형이 숫자를 볼 수 있니?" (보이지 않는 뒤에 있니?) → AI 는 꽤 잘 풀었습니다.
- 어려운 문제 (Level 2): "인형에게 그 숫자는 어떻게 보이니?" (인형이 뒤돌아섰을 때 '6'이 '9'로 보이는지, 혹은 좌우가 어떻게 바뀌는지) → AI 는 완전히 망가졌습니다.
- 특이한 현상: AI 는 인형이 정면 (0 도) 이나 정반대 (180 도) 를 향할 때는 잘 맞췄지만, 45 도나 90 도처럼 중간 각도로 돌아섰을 때는 완전히 혼란스러워했습니다. 마치 "정면일 때는 알고, 완전히 뒤돌았을 때는 거울처럼 뒤집어주지만, 중간에 서 있으면 아무것도 못 보는" 기계처럼 행동했습니다.
2. 실험 2: 지시자 게임 (Director Task)
비유: AI 는 선반 앞에 서 있고, 반대편에 있는 '지시자 (사람)'가 "내 시점에서 가장 오른쪽에 있는 파란 책을 가져와"라고 말합니다.
- 문제: 지시자에게는 가려진 책이 있습니다. AI 는 자신이 보는 모든 책을 다 볼 수 있지만, 지시자는 볼 수 없습니다. AI 는 자신의 시선을 억제하고, 지시자가 볼 수 있는 것만 기준으로 답을 해야 합니다.
- 결과:
- AI 는 "내 시점에서"라고 하면 잘 찾지만, **"지시자의 시점에서"**라고 하면 완전히 엉뚱한 답을 냅니다.
- 특히 "왼쪽/오른쪽" 같은 방향을 말할 때, AI 는 자신의 왼쪽/오른쪽을 그대로 적용해버려서 실패했습니다. 마치 거울을 보고 거울 속의 손가락을 가리키는 사람처럼, 자신의 시점을 잊지 못했습니다.
💡 왜 이런 일이 일어날까요? (AI 의 뇌는 어떻게 작동할까?)
연구진은 AI 가 진짜로 "상대방의 마음을 읽는 (Theory of Mind)" 능력을 가지고 있는 것이 아니라, **단순한 패턴 맞추기 (Heuristics)**를 하고 있다고 결론 내렸습니다.
- 거울 전략 (Mirroring): AI 는 "아, 인형이 나를 바라보고 있네? 그럼 좌우를 바꿔주면 되겠다!"라고 생각할 뿐, 실제 공간에서 머릿속으로 인형의 시점을 회전시키는 복잡한 과정은 하지 못합니다.
- 중간 단계의 붕괴: 0 도나 180 도처럼 극단적인 상황에서는 규칙을 적용할 수 있지만, 45 도처럼 "어떻게 회전해야 할지" 계산이 필요한 중간 단계에서는 그 규칙이 무너집니다.
🚨 이 연구가 중요한 이유
이 AI 들은 이제 선생님, 동료, 심지어 친구 역할을 하려고 합니다. 하지만 상대방이 무엇을 보고, 무엇을 모르는지 이해하지 못한다면 다음과 같은 문제가 생길 수 있습니다.
- 혼란스러운 지시: "저기 왼쪽에 있는 물건을 줘"라고 했을 때, AI 는 자신의 왼쪽을 보고 잘못된 물건을 가져올 수 있습니다.
- 안전 문제: 자율주행차나 로봇이 사람의 시야를 고려하지 못하면 사고가 날 수 있습니다.
- 가짜 공감: AI 가 "네가 무엇을 느끼는지 안다"라고 말해도, 실제로는 상대방의 입장이 아닌 AI 자신의 시선으로만 세상을 보고 있을 뿐입니다.
📝 한 줄 요약
"최신 AI 는 텍스트는 잘 읽지만, '상대방의 눈'으로 세상을 바라보는 능력은 여전히 초보 수준입니다. 특히 중간 각도나 복잡한 상황에서는 자신의 시선을 잊지 못해 엉뚱한 답을 내놓습니다."
이 연구는 AI 를 더 안전하게 활용하기 위해, 단순히 지능을 높이는 것뿐만 아니라 **'타인의 관점을 이해하는 능력'**을 기르는 것이 얼마나 중요한지 일깨워줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.