← 최신 논문
🧬 biology

Characterizing Universal Object Representations Across Vision Models

본 논문은 162 개의 다양한 비전 모델에 걸쳐 아키텍처나 훈련 변이에 독립적이지만 원숭이와 인간의 생물학적 비전 모두와 강력하게 상관관계를 갖는 보편적이고 의미론적으로 해석 가능한 객체 표현을 규명합니다.

원저자: Florian P. Mahner, Johannes Roth, Ka Chun Lam, Michael F. Bonner, Francisco Pereira, Martin N. Hebart

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Florian P. Mahner, Johannes Roth, Ka Chun Lam, Michael F. Bonner, Francisco Pereira, Martin N. Hebart

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

162 개의 서로 다른 '시각 뇌'로 이루어진 거대한 도서관을 상상해 보세요. 일부는 고전적인 카메라 (CNN) 처럼 만들어졌고, 일부는 최신 트랜스포머처럼 만들어졌으며, 어떤 것은 고양이를 인식하도록 훈련되었고, 다른 어떤 것은 단어와 이미지 간의 관계를 이해하도록 훈련되었습니다. 이 모든 것들은 서로 다른 설계도, 서로 다른 교사, 그리고 서로 다른 목표를 가지고 있습니다.

연구자들이 던진 큰 질문은 이것입니다: 이렇게 다양한 뇌들이 같은 대상 (예를 들어 개) 을 바라볼 때, 그것을 같은 방식으로 보나요?

실험: '시각'을 분해하기

이 질문에 답하기 위해 연구자들은 컴퓨터에게 단순히 "이것은 개인가요?"라고 묻지 않았습니다. 대신 컴퓨터가 개를 내부적으로 어떻게 표현하는지 살펴보았습니다.

각 컴퓨터의 이미지 내부 표현을 50 가지 다른 재료 (차원) 로 구성된 복잡한 레시피라고 생각하세요.

  • 재료 A는 "얼마나 털이 많은가"일 수 있습니다.
  • 재료 B는 "차량처럼 보이는 정도"일 수 있습니다.
  • 재료 C는 "특정 갈색의 농도"일 수 있습니다.

연구자들은 162 개의 시각 모델들로부터 이 '레시피'들을 가져와서, 어떤 재료들이 보편적 (거의 모든 레시피에 등장) 이고 어떤 재료들이 모델 고유의 (단 하나 또는 소수의 레시피에만 고유) 인지를 찾아보았습니다.

발견: '보편적' 재료들

이 모델들이 어떻게 만들어졌는지에 대한 차이에도 불구하고, 연구자들은 특정한 세트의 보편적 차원에 모두 수렴한다는 사실을 발견했습니다.

다음은 간단한 비유를 사용하여 이러한 보편적 차원이 특별한 이유입니다:

  1. 그것들은 단순한 '픽셀'이 아닌 '개념'에 관한 것입니다:

    • 보편적 차원은 '동물'이나 '차량'이라는 아이디어와 같습니다. 이러한 차원을 구성하는 이미지들을 살펴보면, 개들의 명확한 그룹이나 자동차들의 명확한 그룹을 볼 수 있습니다. 그들은 대상의 의미를 포착합니다.
    • 모델 고유 차원은 특정 개가 약간 비뚤어진 귀를 가지고 있거나, 특정 자동차가 특정 녹슨 질감을 가지고 있다는 점을 알아차리는 것과 같습니다. 이러한 것들은 모델들 사이에서 극도로 다양하게 변하는 저수준의 시각적 세부 사항 (색상, 질감, 가장자리) 을 포착합니다.
  2. 그것들은 인간이 이해하기 더 쉽습니다:

    • 연구자들이 인간에게 이러한 차원별로 그룹화된 이미지들을 보게 했을 때, 인간은 쉽게 "아, 이 그룹은 모두 '음식'에 관한 것이구나"라고 말할 수 있었습니다.
    • 모델 고유 차원들은 인간에게 종종 혼란스러운 난장판이었습니다. 인간은 그들이 무엇을 보고 있는지 쉽게 설명할 수 없었습니다.

'왜'와 '어떻게'

연구자들은 이러한 보편적 차원이 왜 존재하는지 알고 싶어 했습니다. 그들은 이것이 다음 때문인지 테스트했습니다:

  • 모델들이 같은 방식으로 만들어졌기 때문인가요? 아닙니다. (CNN 과 트랜스포머 모두 이를 가지고 있었습니다).
  • 같은 데이터로 훈련되었기 때문인가요? 아닙니다. (서로 다른 데이터셋으로 훈련된 모델들도 여전히 이를 공유했습니다).
  • 더 크거나 더 똑똑했기 때문인가요? 아닙니다. (성능과 크기는 중요하지 않았습니다).

결론: 보편성은 코드나 데이터의 트릭이 아닙니다. 그것은 세상을 보는 것을 배우는 데서 자연스럽게 발생하는 결과처럼 보입니다. 이 모든 모델들이 동일한 물리적 세상을 이해하려고 노력하기 때문에, 대상들을 이해하는 데 유용한 동일한 '개념적 단축키' (예: '개다움'이나 '의자다움') 를 자연스럽게 발견하게 됩니다.

'생물학적' 연결

가장 흥미로운 부분은 이러한 보편적 차원이 실제 생물학적 뇌가 작동하는 방식과 일치한다는 점입니다.

  • 연구자들이 모델들을 마카크 원숭이 (시각 시스템이 인간과 유사함) 와 비교했을 때, 모델들의 '보편적 차원'은 '모델 고유' 차원들보다 원숭이의 뇌 활동을 훨씬 더 잘 예측했습니다.
  • 그들은 또한 인간이 대상들 사이의 유사성을 판단하는 방식을 훨씬 더 잘 예측했습니다.

교훈

두 사람이 일몰을 설명하려고 노력한다고 상상해 보세요.

  • **사람 A (모델 고유)**는 이렇게 말합니다: "그것은 특정 픽셀 노이즈 패턴과 함께 #FF5733 의 16 진수 코드가 #C70039 로 서서히 변하는 그라데이션입니다."
  • **사람 B (보편적)**는 이렇게 말합니다: "그것은 아름답고 따뜻한 주황색 하늘입니다."

이 논문은 딥러닝 모델들이 시각에 능숙해지면 사람 A 처럼 말하기 시작하지 않고 사람 B 처럼 말하기 시작한다는 것을 보여줍니다. 그들은 모두 독립적으로 세상을 이해하는 가장 유용한 방식이 단순한 원시 픽셀이 아니라 개념 (예: '주황색 하늘'이나 '개') 을 통한다는 것을 발견합니다. 그리고 우리의 뇌 또한 세상을 보기 위해 이러한 개념들을 사용하기 때문에, 이러한 '보편적 차원'은 인공지능과 생물학적 시각 사이의 다리가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →