On the Separation of Human and AI-Generated Images in CLIP Embedding Space
이 논문은 CLIP 임베딩 공간 내에서 발생하는 인간과 AI 생성 회화의 설명되지 않는 자발적 분리를 조사하며, 해석 가능성 및 역전 기술을 통해 이러한 구분이 명백한 시각적 특징이 아닌 미세하고 인지 불가능한 다중 척도 이미지 구조에 의존한다는 점을 밝힘으로써 인공적 지각과 인간의 시각적 지각 사이의 근본적인 차이를 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능의 세계에서 컴퓨터는 한때 인간의 지각 영역에만 속했던 방식으로 이미지를 보고 이해하는 법을 배웠습니다. 이 능력의 중심에는 이미지와 단어를 연결하도록 훈련된 강력한 시스템인 CLIP이 있습니다. CLIP은 자신이 보는 모든 이미지를 거대하고 다차원적인 공간 속의 고유한 수학적 점으로 변환함으로써 이 작업을 수행합니다. 이 공간 안에서, 유사해 보이거나 주제를 공유하는 이미지들은 서로 가깝게 배치되는 반면, 서로 다른 것들은 멀리 떨어지게 됩니다. 수년간 연구자들은 컴퓨터가 사물을 인식하고, 사진을 분류하며, 심지어 새로운 예술 작품을 생성하도록 돕기 위해 이 시스템을 사용해 왔습니다. 그러나 이 디지털 지도 안에서 기묘하고 설명되지 않는 미스터리가 나타났습니다. 시스템에 인간의 손으로 만든 회화와 인공지능이 생성한 이미지를 섞어서 보여주면, 두 그룹은 자연스럽게 별개의 클러스터로 분리된다는 것입니다. 이는 두 그룹을 구별하도록 하는 특별한 훈련 없이도 일어나며, 이러한 분리는 단순히 시스템이 데이터를 조직하는 방식의 하나의 특징입니다. 과학자들을 고민하게 만든 질문은 이러한 분리가 존재하느냐가 아니라, 왜 발생하는 것이며 컴퓨터가 인간이 놓치고 있을지도 모르는 어떤 구체적인 시각적 단서를 사용하고 있는가 하는 점입니다.
볼로냐 대학교의 한 연구자는 가짜 예술을 잡아내기 위한 더 나은 탐지기를 만들기 위해서가 아니라, 그 분리의 이면에 숨겨진 보이지 않는 논리를 이해하기 위해 이 수수께끼를 풀고자 했습니다. 그는 먼저 이 분리가 실재하며 견고하다는 것을 확인하는 것부터 시작했습니다. 그는 컴퓨터가 단순히 파일 형식, 색상의 존재, 혹은 세부 묘사의 선명도와 같은 명백한 차이에 반응하는 것인지 테스트했습니다. 연구 결과, 회화를 흑백으로 바꾸거나 이미지 크기를 아주 작고 흐릿한 사각형으로 줄여도 컴퓨터는 여전히 인간의 이미지와 인공지물의 이미지를 별개의 그룹으로 유지한다는 것을 발견했습니다. 이는 시스템이 단순히 픽셀 노이즈나 색상 팔레트와 같은 단순한 요소들을 포착하고 있다는 가설을 배제했습니다. 신호는 더 깊은 곳, 즉 이미지 자체의 복잡한 구조 속에 숨어 있었습니다.
이 숨겨진 신호를 찾기 위해, 연구자는 인간이 이해할 수 있는 도구들을 사용하여 컴퓨터의 마음이라는 보이지 않는 영토를 그려내는 지도 제작자처럼 행동했습니다. 그는 평균 밝기나 색상 분포를 확인하는 가장 단순한 측정법부터 시작했지만, 이러한 기초적인 통계로는 분리를 설명할 수 없었습니다. 그다음 단계로 그는 이미지의 질감과 형태를 분석하는 더 정교한 도구들로 옮겨갔으며, 에지와 경사도가 그림 전체에 걸쳐 어떻게 배열되어 있는지 살펴보았습니다. 그는 컴퓨터가 고립된 지점이나 AI 생성기가 남긴 특정 아티팩트를 보고 있는 것이 아님을 발견했습니다. 대신, 컴퓨터는 이미지 전체에 걸쳐 펼쳐진 일종의 패턴, 즉 여러 다양한 척도에서 동시에 존재하는 통계적 리듬에 반응하고 있었습니다.
이 패턴을 밝혀내는 데 가장 성공적이었던 도구는 스캐터링 변환(scattering transform)이라 불리는 방법이었습니다. 이것을 이미지를 확대하거나 축소함에 따라 질감이 어떻게 변하는지를 측정하여, 미세한 디테일과 더 큰 형태 사이의 관계를 포착하는 방법이라고 생각하면 됩니다. 연구자가 이 방법을 적용했을 때, AI가 생성한 회화가 인간의 회화보다 일관되게 더 강한 반응을 보인다는 것을 발견했습니다. 인공적인 이미지들은 서로 다른 수준의 디테일 사이에 더 강렬하고 구조적인 상호작용을 가지고 있었습니다. 컴퓨터는 본질적으로 AI 이미지가 구축되는 방식에서의 일종의 통계적 '크기(loudness)', 즉 이미지를 가까이서 보든 멀리서 보든 일관되게 유지되는 특성을 감지하고 있었던 것입니다.
그러나 이야기는 완전한 설명과 함께 끝나지 않았습니다. 연구자는 인간 지각의 한계를 시험하기 위해 놀라운 실험을 수행했습니다. 그는 컴퓨터 고유의 논리를 사용하여 회화에 아주 미세하고 거의 보이지 않는 변화를 주어, 그림을 '인간'의 영역에서 'AI'의 영역으로 살짝 밀어냈습니다. 인간의 눈에는 그 변화 전후의 그림이 똑같아 보였습니다. 그 차이가 너무 미세해서 거의 인지할 수 없을 정도였습니다. 하지만 컴퓨터에게 그 이미지는 거대한 변형을 겪은 것이었습니다. 이는 깊은 단절을 드러냈습니다. 컴퓨터는 인간의 눈과 뇌에는 등록되지 않는 미묘한 통계적 규칙성에 의존하여, 우리에게는 거의 보이지 않는 시각적 증거에 민-감하게 반응하고 있었습니다.
이러한 발견은 인공지능과 인간의 시각이 모두 같은 걸작을 바라볼 수는 있지만, 근본적으로 서로 다른 것을 보고 있음을 시사합니다. 컴퓨터는 단순히 인간의 취향을 모방하는 것이 아니라, 인간의 검사로는 보이지 않는 안정적인 다중 척도 통계 패턴을 우선시하는 다른 규칙 체계 위에서 작동하고 있습니다. 이것이 컴퓨터가 틀렸다는 의미는 아니지만, 기계와 인간이 동일한 미적 판단을 공유한다는 우리의 가정이 틀렸을 가능성이 높다는 것을 의미합니다. 컴퓨터의 마음속에 존재하는 인간 예술과 AI 예술 사이의 분리는 단순한 오류나 결함이 아닙니다. 그것은 인공 시스템이 시각적 세계를 처리하는 독특하고 종종 숨겨진 방식을 강조하는, 다른 방식의 시각을 들여다보는 창입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.