← 최신 논문
💬 NLP

Ethology of Latent Spaces

본 연구는 시각-언어 모델의 잠재 공간이 중립적이지 않으며, 훈련 데이터에 의해 유도된 뚜렷한 '알고리즘적 시각 체제(algorithmic scopic regimes)'를 나타내어 예술에 대한 이질적이고 종종 모순적인 정치적·문화적 해석을 생성한다는 점을 입증하기 위해 행동학적 관점을 채택하며, 이는 디지털 미술사에서 이러한 모델들이 사용되는 방식에 대한 비판적 재검토를 필요로 한다.

원저자: Philippe Boisnard

게시일 2026-02-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Philippe Boisnard

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 세 명의 서로 다른 예술 비평가가 있다고 상상해 보십시오. 이들은 모두 15세기부터 1900년대에 이르는 301점의 회화 및 조각 컬렉션을 보고 있습니다. 당신은 그들이 보는 것에 대해 서로 동의할 것이라고 예상할지도 모릅니다. 하지만 이 연구에서 '비평가'들은 인간이 아닙니다. 이들은 세 가지 서로 다른 AI 모델(OpenAI CLIP, OpenCLIP/LAION, SigLIP)입니다.

이 논문은 이 AI 모델들이 중립적이고 백지 상태인 존재가 아니라고 주장합니다. 대신, 각 모델은 자신이 학습한 특정 데이터와 구축된 방식에 의해 형성된 자신만의 독특한 "성격"과 세상을 보는 방식을 발전시켰습니다. 저자는 이를 **"잠재 공간의 행동학(ethology of latent spaces)"**이라고 부릅니다. 기본적으로 생물학자가 야생 동물의 행동을 연구하듯 AI의 "두뇌"가 보이는 "행동"을 연구하는 것입니다.

다음은 쉬운 비유를 사용하여 논문의 주요 내용을 정리한 것입니다.

1. "보이지 않는 안경" 비유

이 AI 모델들을 보이지 않는 안경을 쓰고 있는 것으로 생각하십시오.

  • 수학적 측면: 컴퓨터 내부에서 AI는 이미지를 거대한 다차원 공간 속의 숫자 구름(벡터)으로 봅니다.
  • 의미론적 측면: 우리가 AI에게 "이 이미지는 정치적인가?"라고 물을 때, AI는 정치를 "생각"하지 않습니다. 대신, 자신의 숫자 구름을 살펴보고 어떤 "정치적" 숫자들이 이미지와 가장 가까운지를 확인합니다.
  • 반전: 논문은 각 모델이 쓰고 있는 "안경"이 서로 다르다는 것을 보여줍니다. 어떤 모델은 흑백 사진을 "어둡고 우울하다"고 보는 반면, 다른 모델은 그것을 "대비가 강하고 극적이다"라고 볼 수 있는데, 이는 그들이 어떻게 학습되었느냐에 따라 달라집니다.

2. 세 가지 서로 다른 "성격"

이 연구는 세 가지 특정 모델을 비교하며, 그들이 마치 세 명의 매우 다른 사람처럼 행동한다는 것을 발견했습니다.

  • OpenAI CLIP (박물관 큐레이터): 이 모델은 신중하게 선별된 프라이빗 데이터셋으로 학습되었습니다. 이 모델은 전통적인 미술사학자처럼 행동합니다. 이 모델은 "정치"를 입체파(Cubism)나 다다이즘(Dada) 같은 유명하고 제도적인 예술 사조에서만 찾아내는 경려는 있습니다. 만약 아프리카 가면을 보여준다면, 이 모델은 그것을 "예술"이나 "문화"로 보지만, 반드시 "정치적"이라고 보지는 않습니다.
  • OpenCLIP/LAION (인터넷 스크롤러): 이 모델은 인터넷 전체에서 긁어온 방대하고 무질서한 데이터 덤프를 통해 학습되었습니다. 이 모델은 혼란스러운 인터넷 사용자처럼 행동합니다. 이 모델은 모든 곳에서 "정치"를 발견하지만, 종종 무작위적이고 소음이 섞인 방식으로 봅니다. 예를 들어, 어떤 그림 자체가 식민주의에 관한 것이 아님에도 불구하고, 웹상의 유사한 이미지 캡션에 "식민지(colonial)"라는 단어가 등장했다는 이유만으로 그 그림을 "식민지적"이라고 라벨링할 수 있습니다.
  • SigLIP (비판 이론가): 이 모델은 다른 기술적 구조를 사용합니다. 이 모델은 날카롭고 현대적인 비평가처럼 행동합니다. 이 모델은 거의 모든 것에서 "정치"를 봅니다. 예를 들어, 이 모델은 아프리카 가면을 매우 "정치적"(59%의 확률)이라고 라벨링하는 반면, 다른 모델들은 이를 비정치적이라고 판단합니다. 이 모델은 비서구적 예술이 본질적으로 정치적 투쟁과 연결되어 있다고 학습한 것처럼 보이며, 반대로 서구적 예술은 "중립적"이라고 간직하고 있습니다.

3. "네온사인"의 혼란

논문은 이 AI들이 물리적 대상과 단어 사이의 차이 때문에 어떻게 혼란을 겪는지에 대한 훌륭한 사례를 제시합니다.

  • 테스트: 연구진은 모델들에게 "밝기"에 따라 이미지를 순위 매기도록 요청했습니다.
  • 결과: OpenAI CLIP은 조셉 코스스(Joseph Kosuth)의 네온 아트(종종 검은 배경 앞에 촬영됨)를 컬렉션에서 가장 밝은 작품 중 하나로 꼽았습니다.
  • 이유: AI는 픽셀을 "본" 것이 아닙니다. 학습 데이터에서 "네온(neon)"이라는 단어를 보고, "네온"이라는 단어를 "밝은 빛"이라는 개념과 연관시킨 것입니다. 즉, 라벨실제와 혼동한 것입니다.
  • 반면, SigLIP은 실제로 픽셀을 관찰하여 어두운 사진들이 어둡다는 것을 정확히 식별해 냈습니다.

4. "창발적 편향(Emergent Bias)" vs "통계적 편향(Statistical Bias)"

보통 우리가 AI의 편향을 이야기할 때, "데이터셋에 여성 사진이 충분하지 않다"와 같은 "통계적 편향"을 떠올립니다.

  • 논문의 새로운 아이디어: 이 연구는 **"창발적 편향"**을 소개합니다. 이것은 화학 반응처럼 어디선가 갑자기 나타나는 편향입니다. 이는 원시 데이터에 직접 들어있는 것이 아닙니다. 단어와 이미지 사이의 복잡한 연결 방식에서 발생하는 것입니다.
  • 비유: 요리법을 상상해 보십시오. 소금을 빠뜨리면 음식이 싱겁습니다(통계적 편향). 하지만 밀가루, 설탕, 효모를 특정한 방식으로 섞으면 빵이 부풀어 오릅니다(창발적 속성). AI의 "정치적" 견해는 부풀어 오르는 빵과 같습니다. 그것들이 그릇 안에 직접 넣어지지는 않았지만, 재료(데이터)가 섞이는 방식에 따라 위로 솟아오른 것입니다.

5. "세 가지 시선" (그들이 보는 방식)

저자는 이 모델들이 세상을 어떻게 "보는가"를 설명하기 위해 미술사에서 사용하는 은유를 사용합니다.

  • 엔트로피적 시선 (LAION): 인터넷이 말하는 모든 것을 포착하여 종종 웹 검색에서 발견되는 고정관념을 강화하는, 혼란스럽고 소음이 섞인 시선입니다.
  • 제도적 시선 (OpenAI): 확립된 서구 미술사의 규칙을 강화하는, 통제되고 박물관 같은 시선입니다.
  • 기호학적 시선 (SigLIP): 모든 것에서 깊고 비판적인 의미를 찾으려 노력하며, 때로는 인간이 단순히 형태로 볼 수 있는 것에도 정치적 해석을 강요하는 이론적인 시선입니다.

결론

논문은 AI가 예술사를 위한 중립적인 도구가 아니다라고 결론짓습니다.
만약 당신이 예술을 분석하기 위해 AI를 사용한다면, 당신은 단순히 "컴퓨터의 의견"을 얻는 것이 아닙니다. 당신은 그 모델의 학습 데이터가 가진 특정한, 숨겨진 "성격"을 얻는 것입니다.

  • 만약 모델 A를 사용한다면, 당신은 예술을 "중립적이고 미적인 것"으로 볼 수 있습니다.
  • 만 만약 모델 B를 사용한다면, 당신은 동일한 예술을 "깊이 정치적이고 식민적인 것"으로 볼 수 있습니다.

저자는 우리가 서로 다른 모델들을 서로 대조해 봄으로써 그들이 가진 보이지 않는 규칙과 편향을 이해하지 못한 채, 예술의 해석을 AI에 단순히 "위임"해서는 안 된다고 경고합니다. AI가 보는 "진실"은 전적으로 그 AI가 어떤 "안경"을 쓰고 있느냐에 달려 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →