← 최신 논문
🤖 AI

Probing Perceptual Constancy in Large Vision-Language Models

본 연구는 색상, 크기 및 형태 불변성에 관한 236개의 실험을 통해 155개의 시각-언어 모델을 평가하며, 이를 통해 상당한 성능 변동성과 형태 불변 능력과 색상 및 크기 불변 능력 사이의 뚜렷한 분리 현상을 밝혀낸다.

원저자: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Ho
게시일 2026-02-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 빨간 사과를 보고 있다고 상상해 보세요. 당신이 사과로부터 멀어지면, 사과는 더 작게 보입니다. 만약 파란색 손전등을 비춘다면, 사과는 보라색으로 보일 것입니다. 만약 옆면에서 본다면, 사과는 원이 아니라 타원형으로 보일 것입니다.

인간의 뇌는 정말 놀랍습니다. 왜냐하면 이러한 변화에도 불구하고 사과가 여전히 크고, 빨갛고, 둥근 사과라는 것을 알고 있기 때문입니다. 뇌는 거리, 이상한 조명, 혹은 각도에 속지 않습니다. 이 초능력을 **지각 항상성(Perceptual Constancy)**이라고 부릅니다.

이 논문은 155개의 서로 다른 "AI 뇌"(시각-언어 모델, Vision-Language Models)가 이와 같은 초능력을 가지고 있는지 확인하기 위한 거대한 성적표와 같습니다. 연구진은 세 가지 특정 기술을 점검하기 위해 ConstancyBench라는 특별한 테스트를 구축했습니다.

1. 테스트된 세 가지 기술

이 기술들을 비디오 게임의 세 가지 레벨이라고 생각해보세요:

  • 색상 항상성 ("조명" 레벨): AI가 방이 노란 전구로 밝혀져 있거나 파란 네온사인 아래에 있더라도, 흰 벽이 흰색이라는 것을 알 수 있을까요?
    • 테스트 방식: AI는 이상한 조명 아래에 있는 루빅스 큐브를 보고 가운데 정사각형의 실제 색상을 맞춰야 합니다.
  • 크기 항상성 ("거리" 레벨): AI가 멀리 있는 자동차가 화면상으로는 아주 작게 보이더라도, 바로 옆에 있는 자동차와 실제로는 같은 크기라는 것을 이해할 수 있을까요?
    • 테스트 방식: AI는 미사일 두 개 중 하나는 멀리 있고 하나는 가까이 있는 것을 보고, 그것들이 실제로 크기가 다른 것인지 아니면 단지 원근법 때문에 다르게 보이는 것인지 결정해야 합니다.
  • 모양 항상성 ("각도" 레벨): AI가 둥근 접시가 기울어져서 타원형으로 보이더라도, 그것이 여전히 원이라는 것을 알 수 있을까요?
    • 테스트 방식: AI는 문이 약간 열려 있어서 사다리꼴처럼 보이는 모습을 보고, 그것이 실제로는 직사각형이라는 것을 깨달아야 합니다.

2. 결과: 누가 통과했는가?

연구진은 작고 가벼운 모델부터 GPT-4o와 같이 거대하고 매우 똑똑한 모델에 이르기까지 155개의 서로 다른 AI 모델을 테스트했습니다. 그 결과는 다음과 같습니다:

  • "모양" 기술은 쉽다: AI 모델들은 모양 항상성에 대해 놀라울 정도로 뛰어난 모습을 보였습니다. 마치 사물의 "윤곽"을 파지하는 데 능숙한 것 같습니다. 작은 모델들조차 기울어진 직사각형이 여전히 직사각형이라는 것을 알아낼 수 있었습니다.
  • "색상"과 "크기" 기술은 어렵다: 모델들은 색상크기에서 훨씬 더 많이 고전했습니다. 조명이나 거리에 의해 자주 속았습니다. 이는 마치 AI가 3D 세계와 변화하는 빛을 잊어버린 채, 평면적인 사진만을 보고 있는 것과 같습니다.
  • 더 큰 뇌가 더 잘한다: 명확한 규칙이 있었습니다: AI 모델이 클수록, 이 테스트에서 더 높은 성적을 거두었습니다.
    • 작은 모델들은 단순한 속임수에 혼란을 느끼며 자주 실패했습니다.
    • 거대한 모델들(AI 세계의 "거인들")은 특히 크기와 거리를 이해하는 데 있어 훨씬 더 나은 성과를 보였습니다. AI에게 더 많은 "두뇌 능력"(파라미터)을 부여할수록, 3D 세계를 이해하는 능력이 향상되는 것으로 보입니다.

3. 핵심 결론

이 논문은 AI가 아직 인간과 같은 완벽한 시각을 가지고 있지 않다고 결론짓습니다. 대신, AI는 **계층적(stratified)**인 시각을 가지고 있습니다:

  • 기하학적 형태(모양)에는 강합니다.
  • 규모와 조명을 이해하는 능력(크기와 색상)은 향상되고 있지만, 모델이 거대할 때만 가능합니다.

저자들은 이러한 AI 모델들이 점점 똑똑해지고는 있지만, 인간이 세상을 보는 방식과 똑같이 보고 있는 것은 아닐 수도 있다고 제안합니다. 그들은 물리 법칙을 진정으로 이해하기보다는, 학습 데이터에서 본 패턴을 바탕으로 매우 정교하게 추측하고 있는 것일지도 모릅니다.

요약하자면: 만약 당신이 AI에게 모양을 식별하라고 한다면, 그것은 대개 똑똑하게 답할 것입니다. 하지만 조명이나 거리가 까다로울 때 어떤 것의 실제 크기나 색상을 알아내라고 한다면, AI는 여전히 배우는 단계에 있습니다. 그리고 AI가 더 클수록, 속아 넘어갈 확률은 낮아집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →