← 최신 논문
💻 computer science

Do Vision Encoders Exhibit Human-like Color Thresholds?

이 대규모 연구는 합성곱 신경망과 트랜스포머를 모두 포함한 50개 이상의 사전 학습된 비전 인코더들이 일반적으로 인간과 유사한 색상 식별 임계치를 나타내는 데 실패하며, 자기 지도 학습 모델이 가장 우수한 성능을 보임에도 불구하고 여전히 인간의 지각 민감도와는 낮은 일치도를 보인다는 사실을 밝혀냈다.

원저자: Engy Ehab, Pablo Hernández-Cámara, Nahla Belal, Jesús Malo, Javier Vazquez-Corral, Alexandra Gomez-Villa

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Engy Ehab, Pablo Hernández-Cámara, Nahla Belal, Jesús Malo, Javier Vazquez-Corral, Alexandra Gomez-Villa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우리 시대 가장 똑똑한 기계들의 색맹 현상

당신이 노을을 바라보고 있다고 상상해 보세요. 당신의 눈에 하늘은 그저 커다란 주황색 덩어리가 아닙니다. 그것은 어떤 미세한 색 변화는 쉽게 포착되는 반면, 어떤 변화는 너무나 완벽하게 어우러져 서로 구별할 수 없는 매끄러운 그라데이션입니다. 이것이 인간의 시각이 작동하는 방식입니다. 우리의 뇌는 특정 색상에는 매우 민감하고 다른 색상에는 덜 민감하여, 세상에 대한 완벽하게 균일하지 않은 '지도'를 만들어냅니다. 과학자들은 수십 년 전부터 이러한 불균형한 민감성에 대해 알고 있었으며, 우리가 색 변화를 인지하기 위해 색이 얼마나 변해야 하는지를 정확하게 지도화해 왔습니다.

이제 컴퓨터에게 보는 법을 가르친다고 상상해 봅시다. 우리는 수백만 장의 사진을 학습하여 고양이, 자동차, 구름을 인식할 수 있는 '비전 인코더(vision encoders)'라는 거대한 디지털 뇌를 구축했습니다. 이 기계들은 현대 인공지래의 스타들입니다. 하지만 여기서 중요한 질문이 생깁니다. 이 디지털 뇌들은 우리와 같은 방식으로 색을 볼까요? 이들은 인간이 빨간 사과에서 느끼는 것과 같은 미세한 변화를 포착하는 그들만의 버전의 불균일한 '지도'를 가지고 있을까요, 아니면 완전히 다른, 아마도 훨씬 더 생소한 렌즈를 통해 세상을 보고 있을까요? 이것이 새로운 연구가 해결하고자 했던 미스터리입니다. 즉, 우리의 가장 진보된 AI가 우연히 인간처럼 보는 법을 배웠는지, 아니면 우리가 전혀 예상치 못한 방식으로 여전히 색맹 상태인지 테스트하는 것입니다.


위대한 색채 테스트: AI의 뇌는 우리처럼 볼까?

이 연구에서 연구진은 50개가 넘는 다양한 AI 비전 모델들을 테스트하기로 했습니다. 이 모델들을 아주 오래된 클래식한 '합성곱 신경망(convolutional networks)'부터 최신 기술인 초복잡 '트랜스포머(transformers)', 그리고 이미지에 대한 텍스트 설명을 읽으며 보는 법을 배운 모델들에 이르는 거대한 학생 학급이라고 생각하면 됩니다. 연구진은 알고 싶었습니다. 이 기계들이 인간과 유사한 색채 임계값을 가지고 있는가?

이를 알아내기 위해, 그들은 단순히 AI에게 색 이름을 묻지 않았습니다. 대신, 그들은 '틀린 그림 찾기' 게임을 만들었습니다. 연구진은 18개의 특정 기준 색상(예: 특정한 파란색이나 초록색의 색조)을 선정하고, 각 색상을 주변의 약간씩 다른 색상 구름으로 둘러쌌습니다. 인간의 경우, 각 색상 주변에는 인간의 눈에 보이지 않는 '안전 지대'라고 불리는 알려진 영역이 존재합니다. 이는 길쭉한 타원형(맥아담 타원, MacAdam ellipse라고 불림) 모양이며, 이 타원 안에서의 색 변화는 인간의 눈에 보이지 않습니다. 하지만 이 타원 밖으로 아주 조금이라도 벗어나면, 갑자기 차이를 인지하게 됩니다.

연구진은 그런 다음 이 색상들을 AI 모델들에 입력했습니다. 그들은 AI에게 물었습니다. "이 주변 색상들 중 어떤 것이 중심 색상과 가장 유사해 보이는가?" AI는 자신의 디지털 뇌 안에 자신만의 '유사성 지도'를 생성하며 답했습니다. 만약 AI가 인간과 유사하다면, 그들의 '유사한 색상' 지도는 인간의 '안전 지대' 타원과 완벽하게 겹쳐져야 합니다.

결과: 무지개 속의 불일치

결과는 다소 충격적이었습니다. 연구 결과, 일반적으로 이 AI 모델들은 인간처럼 색을 보지 못한다는 것이 밝혀졌습니다.

가장 성능이 좋은 모델조차 인간의 색 민감도와 일치하는 경우가 약 **25%**에 불과했습니다(구체적으로 mIoU 점수가 0.25 미만이었습니다). 이를 체감해 보자면, 만약 당신이 인간의 색 인지 능력을 완벽하게 맞추려고 노력한다면, 이 AI 모델들은 세부 사항의 4분의 1도 채 맞추지 못하고 있는 셈입니다. 그들이 색에 대해 완전히 눈이 먼 것은 아니었지만, 그들의 무지개 '지도'는 왜곡되어 있었습니다.

이 연구는 서로 다른 유형의 AI 학생들에 대해 다음과 같은 사실을 발견했습니다.

  • 독학한 학생들이 승리했다: 라벨 없이 사진만을 보고 스스로 학습한 모델들(자기 지도 학습 모델)이 가장 좋은 성적을 거두었습니다. 이들은 인간의 시각에 가장 가까웠지만, 여전히 완벽과는 거리가 멀었습니다.
  • 텍스트 학습자들은 예측 불허였다: 이미지와 텍스트를 매칭하며 학습한 모델들(CLIP 등)은 가장 예측 불가능했습니다. 이들 중 일부는 학급의 최상위권에 있었던 반면, 다른 이들은 최하위권에 머물렀습니다. 즉, 이들은 양극화되어 있었습니다. 어느 정도 맞히거나, 혹은 아주 틀리거나 둘 중 하나였습니다.
  • 규모가 크다고 더 나은 것은 아니다: 거대하고 초복잡한 AI 모델이 더 작은 구형 모델보다 더 잘 볼 것이라고 생각할 수도 있습니다. 하지만 연구는 모델의 규모를 키우는 것이 자동으로 문제를 해결해주지는 않는다는 것을 보여주었습니다. 실제로, 고전적인 VGG16과 같은 작고 오래된 모델들이 거대한 현대적 파운데이션 모델들과 대등한 성능을 보이기도 했습니다. 이는 단순히 뇌를 크게 만든다고 해서 인간처럼 색을 보도록 가르쳐주는 것은 아님을 시사합니다.
  • 파란색의 문제: AI는 파란색 계열에서 가장 큰 어려움을 겪었습니다. 인간이 매우 유사한 파란색 색조를 구별하기 어려워하는 것처럼, AI 역시 이 부분에서 가장 힘들어했으며, 종종 '안전 지대'를 완전히 잘못 설정하기도 했습니다.

이것이 중요한 이유

연구진은 인간과 유사한 색 민감도가 방대한 양의 사진을 학습한다고 해서 자연스럽게 나타나는 것은 아니다라고 제안합니다. 현재의 모델 학습 방식은 색 인지의 미세하고 섬세한 디테일보다는 다른 것들(예: 객체 인식이나 텍스트 이해)을 우선시하는 것으로 보입니다.

이 연구는 결론적으로, 이러한 AI 모델들이 색을 구조적인 방식으로 조직하는 법은 배웠지만(단순히 무작위적인 노이즈는 아닙니다), 우리와는 다르게 조직하고 있다는 점을 밝혔습니다. 만약 당신이 오래된 그림을 복원하거나, 과일이 익었는지 확인하거나, 디지털 아트를 디자인하는 등 완벽한 색상 매칭이 필요한 작업에 이 모델들을 사용한다면, 문제에 직면할 수 있습니다. AI는 두 색이 동일하다고 생각하지만 인간은 명확히 다르다고 느낄 수도 있고, 그 반대의 경우도 발생할 수 있기 때문입니다.

요약하자면, 우리의 디지털 눈은 '큰 그림'을 보는 데는 점점 더 능숙해지고 있지만, 우리 세상이 실재한다고 느끼게 만드는 그 작고 다채로운 디테일을 보는 법은 여전히 배우는 중입니다. 기계가 보는 노을과 우리가 보는 노을 사이의 간극은 여전히 넓게 열려 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →