← 최신 논문
💻 computer science

Do vision models perceive illusory motion in static images like humans?

이 논문은 Rotating Snakes 착시 이미지를 통해 대부분의 광학 흐름 모델이 인간의 착시 운동 지각을 재현하지 못하지만, 인간 시각 시스템을 모방한 듀얼 채널 모델과 재귀적 주의 메커니즘이 이를 성공적으로 구현함을 규명하여 인간 중심의 컴퓨터 비전 시스템 개발에 중요한 통찰을 제공합니다.

원저자: Isabella Elaine Rosario (Columbia University), Fan L. Cheng (Columbia University), Zitang Sun (Kyoto University), Nikolaus Kriegeskorte (Columbia University)

게시일 2026-04-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Isabella Elaine Rosario (Columbia University), Fan L. Cheng (Columbia University), Zitang Sun (Kyoto University), Nikolaus Kriegeskorte (Columbia University)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 이 인간처럼 착시 현상을 볼 수 있을까?"**라는 아주 흥미로운 질문에서 출발합니다.

마치 마술사가 손에 든 지팡이를 흔들 때 실제로는 움직이지 않는데, 우리 눈에는 지팡이가 춤추는 것처럼 보이는 착시 현상이 있죠. 이 논문은 컴퓨터가 그런 '움직이지 않는 그림'을 볼 때, 우리 인간처럼 '움직인다'고 착각하는지, 아니면 그냥 '정지해 있다'고만 보는지 실험해 보았습니다.

이 내용을 쉽게 풀어서 설명해 드릴게요.


1. 실험의 주인공: '회전하는 뱀' (Rotating Snakes)

연구진은 **'회전하는 뱀'**이라는 유명한 착시 그림을 사용했습니다. 이 그림은 실제로는 정지해 있지만, 우리가 눈을 깜빡이거나 살짝 움직일 때 뱀들이 미친 듯이 빙글빙글 도는 것처럼 보입니다.

  • 인간의 눈: "와, 저게 진짜로 돌아가는 거야!"라고 착각합니다.
  • 기존 AI (컴퓨터): "아니, 픽셀 하나도 안 움직였는데? 그냥 정지해 있어."라고 차갑게 반응합니다.

2. 실험 방법: AI 에게 '눈'을 만들어 주다

AI 는 보통 고정된 사진을 보고 분석합니다. 하지만 인간의 눈은 절대 멈추지 않고 미세하게 떨립니다 (이를 미세 안구 운동이라고 합니다).

연구진은 AI 모델들에게 다음과 같은 상황을 시뮬레이션했습니다.

  • 상황 A: 사진만 딱 보여주기 (정지 상태).
  • 상황 B: 사진이 갑자기 나타나는 순간 (시작).
  • 상황 C: 사진이 살짝 흔들리는 것 (인간의 눈이 움직일 때).

그리고 10 가지 다른 AI 모델에게 "이게 움직이는지, 어떻게 움직이는지 말해봐!"라고 물었습니다.

3. 실험 결과: 대부분의 AI 는 "모르겠어요"

대부분의 최신 AI 모델들은 인간의 눈처럼 움직이는 것을 감지하지 못했습니다.

  • 일반적인 AI: 그림이 흔들려도 "아, 사진이 흔들렸네"라고만 생각하지, 그림 속 뱀이 도는 것은 전혀 느끼지 못했습니다. 마치 안경을 쓴 사람이 안경이 흔들리는 건 알지만, 안경 뒤에 있는 그림이 움직인 건 못 보는 것과 같습니다.
  • 예외: 오직 **'듀얼 (Dual)'**이라는 이름의 한 가지 모델만이, 특히 눈이 살짝 흔들릴 때 "아, 저게 도는구나!"라고 인간과 비슷한 반응을 보였습니다. 하지만 완벽한 것은 아니었습니다.

4. 왜 그럴까? (비유로 설명)

왜 대부분의 AI 는 실패하고 '듀얼' 모델만 성공했을까요?

  • 일반 AI (단순한 카메라):
    이 모델들은 마치 고정된 카메라처럼 작동합니다. "이 픽셀이 저 픽셀로 이동했으니 움직이는 거야"라고 계산합니다. 하지만 착시 그림은 픽셀이 이동하지 않고도 '움직이는 느낌'을 줍니다. 그래서 이 모델들은 속아 넘어가지 못합니다.

  • 듀얼 모델 (생각하는 생물학적 눈):
    이 모델은 인간의 뇌를 모방해서 만들었습니다.

    1. 첫 번째 눈 (1 차): 밝기 변화만 봅니다. (일반 카메라)
    2. 두 번째 눈 (2 차): 색상이나 질감의 복잡한 패턴도 봅니다. (생각하는 눈)
    3. 뇌의 연결: 이 두 눈을 동시에 보고, 눈이 미세하게 흔들릴 때 그 정보를 종합합니다.

    비유하자면:
    일반 AI 는 정지된 사진을 보는 사진관이고, 듀얼 모델은 살아있는 생물을 관찰하는 탐정과 같습니다. 탐정은 "아, 사진이 흔들릴 때 저 그림의 밝기 차이가 이렇게 변하네? 그럼 저건 움직이는 거야!"라고 추론할 수 있는 능력을 가지고 있습니다.

5. 결론과 의미: 우리는 어디까지 왔나?

이 연구는 두 가지 중요한 사실을 알려줍니다.

  1. AI 는 아직 인간처럼 '느끼지' 못합니다: 현재 가장 뛰어난 AI 도 착시 현상을 완벽하게 이해하지 못합니다. 우리는 그림이 움직인다고 '느끼는'데, AI 는 여전히 계산만 할 뿐입니다.
  2. 인간을 닮은 AI 를 만들려면? AI 가 더 똑똑해지려면 단순히 더 많은 데이터를 학습하는 게 아니라, 인간의 눈이 어떻게 움직이고, 뇌가 어떻게 정보를 통합하는지를 모방해야 합니다. 특히 '눈의 미세한 떨림'을 고려한 학습이 필요합니다.

요약

이 논문은 **"컴퓨터가 인간의 착시 현상을 볼 수 있을까?"**를 확인한 연구입니다.
대부분의 컴퓨터는 **"아니, 움직이지 않아"**라고 답했지만, 인간 뇌를 모방한 한 가지 모델은 **"아, 움직이는 것 같아"**라고 답했습니다. 이는 앞으로 더 똑똑하고 인간과 같은 시각을 가진 AI 를 만들기 위해서는, 단순히 '계산'을 잘하는 게 아니라 '눈의 움직임'과 '뇌의 통합 능력'을 배워야 함을 시사합니다.

마치 인간은 그림을 볼 때 '느낌'으로 이해하지만, AI 는 아직 '숫자'로만 이해하는 단계라는 뜻입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →