← 최신 논문
💬 NLP

Using Perspectival Words Is Harder Than Vocabulary Words for Humans and Even More So for Multimodal Language Models

이 논문은 인간과 멀티모달 언어 모델이 어휘보다 시점 관련 단어를 사용하는 데 더 어려움을 겪으며, 특히 소유격과 지시어에서 모델의 수행도가 인간보다 현저히 낮고 이는 시점 수용 및 공간 추론 능력의 한계와 관련이 있음을 보여줍니다.

원저자: Dota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Ozyurek, Paula Rubio-Fernandez

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Ozyurek, Paula Rubio-Fernandez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 연구 논문은 **"인공지능 (AI) 이 사람처럼 대화할 때, 왜 '내 것', '저것' 같은 말을 쓰면 그렇게 헷갈려하는가?"**에 대한 답을 찾습니다.

간단히 말해, AI 는 사물의 이름 (예: '배', '컵') 을 부르는 것은 사람만큼 잘하지만, **누구의 것인지 (소유격)**나 **어디에 있는지 (지시대명사)**를 판단하는 데는 여전히 인간과 큰 차이가 있다는 것을 발견했습니다.

이 내용을 일상적인 언어와 비유로 설명해 드릴게요.


🎭 1. 실험의 핵심: "무대 위의 배우" 역할극

연구진은 사람과 AI 에게 같은 상황을 보여주며 세 가지 미션을 주었습니다.

  • 미션 1 (단어 맞추기): 테이블 위에 있는 물건을 보고 "이건 뭐야?"라고 물으면 정답을 고르는 것. (예: "배", "컵")
    • 비유: 그림책의 사물을 보고 이름을 부르는 것.
  • 미션 2 (소유권 확인): "누가 이 컵을 좋아해?"라고 물으면 "내 것 (mine)"인지 "너의 것 (yours)"인지 고르는 것.
    • 비유: 친구와 나란히 앉아 있을 때, "이 과자는 내 것이야, 너의 것이야?"를 구분하는 것.
  • 미션 3 (지시 확인): "어떤 컵을 가리키는 거야?"라고 물으면 "이것 (this)"인지 "저것 (that)"인지 고르는 것.
    • 비유: 손가락으로 가리킬 때, 내 손에 가까운 건 '이것', 멀리 있는 건 '저것'이라고 말하는 것.

📉 2. 결과: AI 는 '이름'은 잘 외우지만, '상황'은 못 읽습니다

연구 결과는 놀라웠습니다.

  • 사람들: 세 가지 미션 모두 잘했지만, 특히 '이것/저것'을 구분하는 게 조금 더 어려웠습니다. (사람도 완벽하지는 않아요!)
  • AI 모델들:
    • 이름 (미션 1): 사람과 거의 똑같이 완벽하게 맞췄습니다. "배"라고 말하면 바로 알아챕니다.
    • 소유권 (미션 2): 사람보다 떨어졌습니다. "내 것"과 "너의 것"을 헷갈려했습니다.
    • 지시 (미션 3): 가장 끔찍했습니다. "이것"과 "저것"을 구분하는 데서 큰 실수를 했습니다.

💡 핵심 발견:
AI 는 사물의 이름을 외우는 건 천재지만, **화자의 시점 (누가 말하는지)**과 **공간적 거리 (얼마나 가까운지)**를 동시에 고려해야 하는 말은 아직 인간처럼 할 수 없습니다.

🧩 3. 왜 그럴까요? (원인 분석)

연구진은 AI 가 왜 실패하는지 '해부'해 보았습니다.

  • 시각 vs 언어: AI 는 그림을 볼 때, 사람처럼 "내 눈앞에 있는 게 가까워"라고 직관적으로 느끼기보다, 글자 (프롬프트) 에 적힌 설명에 더 의존합니다.
  • 시점 바꾸기 (Perspective Taking): "내가 말하는 사람이라면 이 컵은 '내 것'이지만, 상대방이 말한다면 '너의 것'이 된다"는 식으로 상대방의 입장에서 생각하기가 AI 에게는 매우 어렵습니다.
  • 공간 추론: "이것"과 "저것"은 단순히 '가깝다/멀다'가 아니라, 누가 보고 있느냐에 따라 달라집니다. AI 는 이 '시점'과 '거리'를 동시에 계산하는 데서 고개를 갸웃거립니다.

🛠️ 4. 해결책은 있을까? (지시와 학습)

연구진은 AI 를 도와주기 위해 두 가지 방법을 시도했습니다.

  1. 예시 보여주기 (In-context Learning): "이런 상황에서는 이렇게 말해"라고 예시를 몇 개 보여줬습니다.
    • 결과: 효과가 별로 없었습니다. 오히려 헷갈려하는 모델도 있었습니다.
  2. 명령어 강화 (Instruction-based Prompting): "누가 말하는지, 누가 소유자인지, 누가 가까운지 단계별로 생각해보고 답해"라고 구체적인 지시를 내렸습니다.
    • 결과: '내 것/너의 것' (소유권) 문제는 크게 개선되어 사람 수준에 가까워졌습니다.
    • 하지만: '이것/저것' (지시) 문제는 여전히 해결되지 않았습니다. AI 가 "누가 말하는지"는 알 수 있어도, "얼마나 가까운지"를 공간적으로 이해하는 능력은 여전히 부족했습니다.

🌍 5. 결론: AI 는 아직 '몸으로 부딪히며' 배운 적이 없습니다

이 연구는 우리에게 중요한 메시지를 줍니다.

"AI 는 책 (데이터) 을 많이 읽어서 사물 이름은 잘 알지만, 사람들과 실제로 마주앉아 대화하며 '내 것', '이것'을 구분하는 경험을 해본 적이 없어서, 그런 말은 아직 서툴다."

인간은 어릴 때부터 부모님이 "이건 거야", "엄마 거야"라고 말하며, 물건을 손으로 가리키고 직접 경험하면서 이 개념을 배웁니다. 하지만 AI 는 그런 **실제 경험 (Embodiment)**이 없습니다.

한 줄 요약:
AI 는 **'사물 이름'**을 외우는 건 천재지만, **'누구의 시선에서'**와 **'얼마나 가까운지'**를 고려해야 하는 **'상황에 따른 말'**은 아직 인간처럼 자연스럽게 하지 못합니다. 앞으로 AI 가 더 똑똑해지려면, 단순히 글을 더 읽는 것을 넘어 실제 공간과 상호작용하는 경험이 필요할지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →