← 최신 논문
💻 computer science

Why MLLMs Struggle to Determine Object Orientations

이 논문은 MLLM 의 2D 물체 방향 인식 실패가 시각 인코더의 한계 때문이라는 기존 가설을 반박하며, 방향 정보가 인코더 임베딩에 존재하지만 수만 개의 특징에 분산되어 있어 모델이 이를 효과적으로 활용하지 못하기 때문임을 시사합니다.

원저자: Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

게시일 2026-04-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🕵️‍♂️ 1. 문제: AI 는 왜 '방향'에 약할까?

우리가 AI 에게 "이 사진 속 개는 몇 도 회전했어?"라고 물어보면, AI 는 종종 엉뚱한 답을 합니다. (예: 90 도라고 확신하며 틀린 답을 내놓음).

기존 연구자들은 **"아마도 AI 가 사진을 보는 '눈' (시각 인코더) 이 방향 감각을 못 느끼게 훈련되었기 때문일 거야"**라고 추측했습니다. 마치 카메라 렌즈가 회전한 사진을 똑바로 찍어주지 못하면, 그 뒤에 있는 뇌가 아무리 똑똑해도 방향을 알 수 없다는 논리였죠.

🔍 2. 실험: AI 의 '눈'을 직접 검사하다

저자들은 이 가설을 검증하기 위해 실험을 했습니다. AI 가 사진을 보고 만들어낸 '디지털 눈물' (내부 데이터 표현) 을 꺼내서, 직접 방향을 계산해 볼 수 있는지 확인한 거죠.

  • 비유: AI 의 '눈'이 찍은 사진을 AI 의 '뇌'가 아닌, 우리가 만든 아주 단순한 계산기 (선형 회귀 모델) 에 넣어 방향을 맞춰보게 했습니다.
  • 결과: 놀랍게도, 단순한 계산기로도 AI 의 '눈'에서 나온 데이터를 분석하면, 사물의 방향을 3 도 오차 범위 내에서 정확히 맞췄습니다!

💡 3. 결론 1: '눈'은 멀쩡하다!

이 결과는 기존 가설을 완전히 뒤집었습니다.

"AI 가 방향을 못 맞추는 이유는 '눈'이 나빠서가 아니다. 눈은 방향을 아주 정확하게 보고 있다!"

AI 의 시각 시스템 (CLIP, SigLIP, ViT 등) 은 회전한 물체를 매우 정밀하게 인식하고 있습니다. 문제는 그 정보가 '뇌'로 전달되는 방식에 있습니다.

🌫️ 4. 결론 2: 정보는 '안개'처럼 퍼져있다

그렇다면 왜 AI 는 방향을 못 맞추는 걸까요? 저자들은 두 가지 중요한 이유를 발견했습니다.

① 정보가 너무 흩어져 있다 (Diffuse Information)

방향 정보는 AI 의 뇌 속에 하나의 명확한 신호로 저장된 게 아니라, 수만 개의 작은 조각으로 나뉘어 흩어져 있었습니다.

  • 비유: AI 의 뇌를 거대한 도서관이라고 상상해 보세요. 방향에 대한 정보가 책 한 권에 명확히 적혀 있는 게 아니라, 도서관에 있는 수만 권의 책에서 한 줄씩 찢겨져서 숨겨져 있는 상태입니다.
  • AI 가 "이 책에서 방향을 찾아라"라고 하면, 그 수많은 조각을 하나하나 모아서 방향을 재구성해야 하는데, AI 는 이 '안개'처럼 퍼진 정보를 효과적으로 모으는 법을 아직 배우지 못한 것입니다.

② 배경의 방향에 너무 의존한다

방향 감지가 배경이 '바른 상태'일 때만 잘 작동한다는 것도 발견했습니다.

  • 비유: AI 는 "개는 오른쪽을 보고 있어"라고 판단할 때, 바닥이 평평하고 벽이 수직인 상태를 기준으로 삼습니다. 만약 바닥이 비스듬히 기울어져 있거나 배경 자체가 회전해 있다면, AI 는 "아, 배경이 이상하네? 개도 이상한가?"라며 혼란에 빠집니다.
  • 즉, AI 는 절대적인 방향 감각보다는 배경과의 상대적인 관계에 너무 의존하고 있어서, 배경이 조금만 달라져도 방향 판단이 무너집니다.

📝 요약: 이 논문이 우리에게 알려주는 것

  1. 오해: "AI 가 방향을 못 맞추는 건 눈이 나빠서야."
  2. 진실: "아니야, 눈은 아주 잘 보고 있어. 데이터 속에 방향 정보가 정확히 담겨 있어."
  3. 실제 원인: "그런데 그 정보가 수만 개의 조각으로 흩어져 있고, 배경이 조금만 달라져도 혼란스러워서, AI 의 '뇌'가 그 정보를 제대로 해석하지 못해."

이 연구는 AI 가 방향을 못 맞추는 것이 단순한 기술적 결함이 아니라, 정보가 저장되고 처리되는 방식의 근본적인 특성 때문일 수 있음을 보여줍니다. 앞으로 AI 를 더 똑똑하게 만들려면, 단순히 데이터를 더 많이 주입하는 게 아니라, 이렇게 흩어진 정보를 어떻게 하나로 모을지에 대한 새로운 방법이 필요하다는 시사점을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →