Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?
이 논문은 멀티모달 데이터를 사용하여 고대 로마 동전의 의미론적 요소를 자동 식별하는 데 비전 트랜스포머(ViT)를 적용한 첫 사례를 제시하며, ViT 모델이 정확도 측면에서 기존의 CNN을 능가함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 수많은 고대 로마 동전이 가득한, 먼지 쌓인 거대한 도서관이 있다고 상상해 보세요. 어떤 것은 빛이 나고, 어떤 것은 마모되었으며, 많은 것들이 흙에 뒤덮여 있습니다. 수 세기 동안, 수십 년의 훈련을 쌓은 소수의 전문가만이 동전을 보고 눈을 가늘게 뜨며 아주 작은 그림을 살핀 뒤, "아, 이것은 말을 품고 있군"이라거나 "이것은 방패를 특징으로 하는구나"라고 말할 수 있었습니다.
이 논문은 컴퓨터에게 그와 똑같은 일을 가르치는 것에 관한 것입니다. 하지만 약간의 차이점이 있습니다. 연구진들은 새로운 유형의 컴퓨터 두뇌인 **비전 트랜스포머(Vision Transformer, ViT)**가 기존의 표준인 **합성곱 신경망(Convolutional Neural Network, CNN)**보다 더 뛰어난지 확인하고 싶었습니다.
다음은 이 실험의 이야기를 쉬운 용어로 풀어서 설명한 것입니다.
문제: 100,000개의 동전이 있는 도서관
연구진은 온라인 경매 사이트에서 가져온 100,000개의 동전 이미지와 그 설명이 담긴 거대한 컬렉션에서 시작했습니다. 이것은 마치 거대한 퍼즐 조각 더미와 같습니다.
- 도전 과제: 고대 동전은 까다롭습니다. 긁힌 자국이 있거나, 그림이 사실적이지 않고 양식화되어 있으며, 같은 종류의 동전이라도 제작된 틀(die)에 따라 모습이 조금씩 다를 수 있습니다.
- 목표: 단순히 한 동전을 다른 동전과 매칭하는 것(예: "쌍둥이 찾기" 게임)을 넘어, 컴퓨터가 그림의 '의미'를 이해하게 하고 싶었습니다. 컴퓨터가 "코르누코피아(풍요의 뿔)"를 찾아낼 수 있을까요? 인물이 "서 있는지" 아니면 "앉아 있는지"를 구별할 수 있을까요?
대결: 구세대 vs 신세대
이를 해결하기 위해 연구진은 두 가지 서로 다른 컴퓨터 아키텍처를 맞붙였습니다.
CNN ( "지역 탐정"):
탐정이 사진을 볼 때 아주 작은 조각들을 하나씩 조사하며 보는 모습을 상상해 보세요. 왼쪽 상단을 보고, 그다음 오른쪽 상단을 보고, 그다음 중앙을 봅니다. 이들은 특정 곡선이나 선과 같은 국소적인 패턴을 포착하는 데 매우 능숙합니다. 하지만 때때로 너무 좁은 곳에만 집중하여 전체적인 큰 그림을 놓치는 '터널 시야'에 빠질 수 있습니다.ViT ( "전역 관찰자"):
비전 트랜스포머는 새로 등장한 신입입니다. 사진을 조각 단위로 하나씩 보는 대신, 사진 전체를 한 번에 보며 왼쪽 상단 모서리가 오른쪽 하단 모서리와 어떻게 연결되는지를 즉각적으로 이해하는 탐정을 상상해 보세요. 이 모델은 이미지를 하나의 문장처럼 취급하며, 모든 부분이 서로 연결되어 있다고 봅니다. 이를 통해 지역 탐정이 놓칠 수 있는 "장거리" 연결성을 파악할 수 있습니다.
실험: 두뇌 훈련시키기
연구진은 먼저 데이터를 정리해야 했습니다. 원래의 사진들은 종종 동전의 양면(앞면과 뒷면)을 모두 보여주거나 여러 개의 동전이 쌓여 있는 모습을 보여주었습니다. 그들은 동전의 뒷면(reverse)만을 잘라내는 프로그램을 작성했는데, 뒷면에 보통 더 흥미로운 그림들이 있기 때문입니다.
그 후, 정제된 이미지들을 두 종류의 컴퓨터에 입력했습니다.
- CNN은 한 번에 하나의 특정 개념에 대해서만 훈련되었습니다 (예: "모든 독수리를 찾아라").
- ViT는 멀티태스커였습니다. 하나의 모델 안에서 모든 개념(독수리, 방패, 말 등)을 동시에 찾는 법을 배웠습니다.
결과: 누가 승리했나?
훈련이 끝난 후, 연구진은 컴퓨터가 한 번도 본 적 없는 새로운 동전들로 테스트를 진행했습니다.
- 승자: **비전 트랜스포머(ViT)**가 일반적으로 승리했습니다. ViT는 CNN보다 의미적 요소(그림)를 식별하는 데 더 정확했습니다.
- 속도: CNN은 훈련 속도가 훨씬 빨랐습니다(단거리 선수처럼). 반면 ViT는 훨씬 오래 걸렸지만(마라톤 선수처럼), 정확도 측면에서는 더 나은 결승선을 통과했습니다.
- 이유: 연구진은 ViT가 동전의 지저고 닳은 특성을 처리하는 데 더 뛰어나다는 것을 발견했습니다. ViT는 예상과 조금 다른 그림이 나와도 쉽게 혼란에 빠지지 않았습니다.
"엑스레이 비전" (살리언시 맵, Saliency Maps)
컴퓨터가 어떻게 생각하는지 이해하기 위해, 연구진은 "살리언시 매핑"이라는 도구를 사용했습니다. 이것은 이미지에 엑스레이를 비추어 컴퓨터가 결정을 내릴 때 어느 부분을 보고 있었는지 확인하는 것과 같습니다.
- CNN의 엑스레이: CNN은 특정 좁은 지점에 집중하는 경향이 있었습니다. 예를 들어, 독수리를 찾을 때 CNN은 거의 항상 독수리의 날개가 자주 나타나는 동전의 오른쪽 하단 구석을 응시했습니다. 이는 마치 실제 새를 인식하는 것이 아니라, "독수리는 항상 오른쪽 하단에 있다"라고 암기한 학생과 같았습니다.
- ViT의 엑스레이: ViT의 초점은 훨씬 더 분산되어 있고 다양했습니다. 때로는 독수리의 깃털을 보기도 하고, 때로는 배경을 보기도 하며, 때로는 근처의 글자를 보기도 했습니다. 어디를 보고 있는지 예측하기는 더 어려웠지만, 이는 ViT가 단순히 위치를 암기하는 것이 아니라 장면 전체를 실제로 "이해"하고 있음을 시사했습니다.
함정: 노이즈가 섞인 레이블 (Noisy Labels)
이 논문은 실험의 주요 결함 중 하나를 인정합니다. 즉, 컴퓨터에게 준 "정답"이 지저분했다는 점입니다.
컴퓨터는 경매 사이트의 텍스트 설명을 사용하여 훈련되었습니다. 하지만 이 설명들은 종종 동전의 양면 모두에 대해 이야기했습니다.
- 예시: 설명이 "앞면: 황제의 머리. 뒷면: 서 있는 말"이라고 되어 있을 수 있습니다.
- 실수: 컴퓨터는 오직 뒷면(말)만을 보여주었지만, 레이블에는 "서 있는(Standing)"이라고 적혀 있었습니다. 그런데 때로는 뒷면에 서 있는 형상이 없음에도 불구하고, 앞면 때문에 "서 있는"이라는 표현이 쓰이기도 했습니다.
- 결과: 컴퓨터는 가끔 잘못된 단서를 통해 학습하고 있었습니다. 연구진은 이러한 "노이즈"가 특히 "서 있는" 또는 "앉아 있는"과 같은 개념에 대해 두 모델 모두의 성능을 저해했을 것이라고 언급했습니다.
결론
이 논문은 비전 트랜스포머가 고대 동전을 연구하는 유망한 새로운 도구라는 결론을 내립니다. ViT는 기존의 CNN 모델보다 정확도 면에서 우수한 성적을 거두었으며, 이는 "전역 관찰자" 방식이 복잡하고 무질서한 고대 세계에 더 적합하다는 것을 시사합니다.
하지만 연구진은 더 나은 결과를 얻으려면 더 깨끗한 데이터가 필요하다고 경고합니다. 만약 우리가 컴퓨터에게 "동전의 앞면" 텍스트를 무시하고 "동전의 뒷면" 이미지만 보도록 가르칠 수 있다면, 이 디지털 역사학자들은 더욱 강력해질 수 있을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.