Learning visual representations for compositional analysis of artworks and photographs
이 논문은 지각적 그룹화에 기반한 인간 중심의 해석 가능한 접근 방식과 구성 분석을 위해 미세 조정된 파운데이션 모델을 비교하며, 후자가 충분한 데이터가 있을 때 우수한 성능을 달성하는 반면, 전자는 인코더가 고정되었을 때 더 나은 해석 가능성과 일반화 성능을 갖추면서도 경쟁력 있는 결과를 제공한다는 것을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 어떤 그림이나 사진을 보고 있다고 상상해 보십시오. 당신의 뇌는 단순히 색깔로 가득 찬 평평한 벽을 보는 것이 아닙니다. 뇌는 즉각적으로 그 장면을 하나의 이야기로 조직합니다. 사물들을 그룹화하고, 사람이 나무와 어떤 관계로 서 있는지 주목하며, 균형감이나 긴장감을 느낍니다. 이러한 시각의 "스토리텔링" 부분을 **구도(composition)**라고 부릅니다. 이것은 이미지를 아름답거나, 극적이거나, 혹은 딱 적절하게 느껴지게 만드는 비밀 소스입니다. 오랫동안 컴퓨터는 이를 이해하는 데 서툴렀습니다. 컴퓨터는 이미지 안에 무엇이 있는지(개, 자동차, 일몰 등)를 인식하는 데는 뛰어나지만, 그 사물들이 의미를 만들기 위해 어떻게 배치되어 있는지는 이해하는 데 어려움을 겪습니다. 이 논문은 그 간극을 파고들며 커다란 질문을 던집니다. 컴퓨터에게 예술가처럼 "보는" 법을 가르치기 위해서, 우리는 인간처럼 생각하는 뇌를 구축해야 할까요, 아니면 아주 똑똑한 컴퓨터에 충분한 예시를 계속 입력하여 스스로 깨닫게 할 수 있을까요?
벨기에 KU 루벤 대학교의 파테메 베라드(Fatemeh Behrad), 티네 투이텔라르스(Tinne Tuytelaars), 요한 와겜스(Johan Wagemans) 연구진은 컴퓨터에게 구도에 대해 가르치는 두 가지 매우 다른 방법을 테스트하기 위해 이 연구를 수행했습니다. 이것은 마치 학생에게 퍼즐을 푸는 법을 가르치는 것과 같습니다.
두 가지 접근 방식
첫 번째 접근 방식은 "인간 스타일" 방법입니다. 이 방법은 이미지를 흐릿한 픽셀의 덩어리로 보는 대신, 하늘, 산, 사람처럼 이미지를 구별되고 의미 있는 덩어리로 나누려고 시도합니다. 이는 **객체 중심 학습(Object-Centric Learning)**이라는 특별한 기술을 사용하여 이러한 덩어리들을 자동으로 찾아내는데, 이는 마치 "이 덩어리는 사람이고, 저 덩어리는 배다"라고 말하는 스마트한 분류기처럼 작동합니다. 그런 다음, **그래프 어텐션 네트워크(Graph Attention Network)**를 사용하여 이 덩어리들 사이에 보이지 않는 선을 그려 그들이 서로 어떻게 관계를 맺는지 분석합니다. 이는 마치 형사가 범죄 현장에서 총이 피해자 근처에 있고 창문이 탁자 위에 있다는 점을 주목하며 조사하는 것과 같습니다. 이 방식은 투명하게 설계되었습니다. 즉, 우리는 컴퓨터가 이미지의 어느 부분을 보고 있으며 그것들을 어떻게 연결하는지 정확히 볼 수 있습니다.
두 번째 접근 방식은 "빅 데이터" 방법입니다. 이 방식은 이미 수백만 장의 이미지를 본 거대한 사전 학습된 AI 모델(파운데이션 모델이라고 불림)을 사용합니다. 연구진은 이 거인들을 특정 사진 및 회화 데이터셋에 맞춰 단순히 "미세 조정(fine-tuning)"하며, 충분한 연습을 통해 컴퓨터가 스스로 구도의 규칙을 학습하기를 기대합니다. 이는 마치 학생을 미술사 관련 모든 책이 있는 도서관에 던져놓고 "그냥 스스로 알아내 봐"라고 말하는 것과 같습니다. 이는 강력하지만, "블랙박스"와 같습니다. 우리는 컴퓨터가 어떻게 결정을 내리는지 실제로 알 수 없으며, 컴퓨터가 구도를 이해하기보다는 이미지 속의 객체를 인식하는 데 의존하고 있을 수도 있습니다.
연구 결과
연구팀은 두 가지 큰 과제를 통해 두 방법을 테스트했습니다: 사진의 "스타일"(예: "중앙 집중형" 또는 "대각선")을 예측하는 것과 이미지의 구도가 얼마나 좋은지 점수를 매기는 것입니다. 또한 그들은 컴퓨터가 이미지의 가장 중요한 부분(현저성, saliency)을 찾을 수 있는지, 그리고 레이아웃을 기반으로 유사한 이미지를 찾을 수 있는지 확인했습니다.
여기 반전이 있습니다: 그것은 당신이 얼마나 많은 데이터를 가지고 있느냐에 달려 있습니다.
연구진이 거대한 AI 모델들을 고정된 상태(새로운 것을 배우지 못하게 함)로 유지하고 "인간 스타일" 방법을 사용했을 때, 이 방법은 놀라울 정도로 잘 해냈습니다. 이 방식은 객체들을 그룹화하고 그 관계를 이해할 수 있었으며, 종종 고정된 거대 모델들을 능가했습니다. 가장 좋은 점은 무엇일까요? 왜 그런 결정을 내렸는지 이해하기가 매우 쉬웠다는 것입니다. 당신은 그것이 구축한 연결의 "그래프"를 문자 그대로 볼 수 있었습니다.
하지만, 거대 파운데이션 모델들을 완전히 "미세 조정"할 수 있을 만큼 충분한 데이터가 확보되었을 때, 그 거인들이 앞서 나갔습니다. 그들은 점수와 카테고리를 예측하는 데 훨씬 더 뛰어난 성능을 보였습니다. 하지만 문제가 있었습니다. 거대 모델들은 해석하기가 더 어려웠고(불투명했고), 사진에서 회화로 넘어가는 것처럼 서로 다른 유형의 이미지 사이를 전환할 때 더 어려움을 겪었습니다. 그들은 구도(예: "고양이가 삼각형 모양으로 앉아 있다")를 이해하기보다는 객체(예: "이것은 고양이다")를 인식하는 데 크게 의존하는 것처럼 보였습니다.
결론
이 논문은 만약 당신이 방대한 양의 라벨링된 데이터를 가지고 있고 단지 최고의 점수를 얻고 싶다면, "빅 데이터" 접근 방식이 승리한다고 제안합니다. 하지만 효율적이고, 다양한 유형의 예술(사진에서 회화까지)에 걸쳐 작동하며, 왜 이미지가 잘 구성되었다고 생각하는지 실제로 설명할 수 있는 시스템이 필요하다면, "인간 스타일" 접근 방식이 승자입니다.
흥미롭게도, 연구진은 "인간 스타일" 방식이 이미지의 가장 중요한 부분을 포착하는 데 탁-월하다는 것을 발견했습니다. 그래프의 연결 관계를 살펴봄으로써, 이 방식은 "이 사람은 다른 모든 것과 연결되어 있기 때문에 가장 중요한 부분이다"라고 말할 수 있었으며, 이는 인간의 눈이 실제로 머무는 위치와 잘 일치했습니다. 거대 모델들은 강력하긴 했지만, 이 측면에서는 다소 불투명했습니다.
결국, 이 논문은 어느 한 쪽이 절대적인 승자라고 선언하지 않습니다. 대신, 거대 AI 모델이 충분한 데이터가 주어졌을 때 믿을 수 없을 정도로 강력하지만, 인간이 자연스럽게 시각적 요소들을 그룹화하고 연관 짓는 방식을 모방하는 시스템을 구축하는 것에도 여전히 독특한 가치가 있다는 것을 보여줍니다. 이는 때때로 예술을 이해하기 위해서는 예술가의 보는 방식을 이해해야 한다는 점을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.