Institutional Books - Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections
이 논문은 디지털화된 도서관 컬렉션에서의 새로운 연구 및 AI 학습 기회를 열기 위해, 비텍스트 콘텐츠의 탐지, 분류, 중복 제거 및 캡션 생성을 자동화하도록 설계된, 약 100만 권의 역사적 서적에서 추출한 2,260만 개의 시각적 요소로 구성된 새로운 데이터셋과 오픈 소스 파이프라인을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
도서관은 인류 역사의 방대한 저장고이지만, 수십 년 동안 그 책들의 디지털 버전은 이야기의 절반만을 들려주었습니다. 기관들이 오래된 서적을 스캔하여 검색 가능하게 만들 때, 전통적으로는 단어를 읽고 이를 데이터로 변환하는 소프트웨어를 사용하여 텍스트에 집중해 왔습니다. 광학 문자 인식(OCR)이라고 알려진 이 과정은 연구자들이 수백만 페이지를 몇 초 만에 검색할 수 있게 해준 하나의 승리였습니다. 그러나 그 책들 속에 담긴 이미지들—삽화, 사진, 판화, 그리고 장식적인 테두리들—은 기계에게 여전히 보이지 않는 상태로 남아 있었습니다. 이러한 시각적 요소들은 텍в만으로는 포착할 수 없는 독특한 맥락과 뉘으로를 담고 있지만, 컴퓨터가 쉽게 이해할 수 있는 방식으로 구조화되지 않았기 때문에 대규모로 연구하기가 어려웠습니다. 인공지능 시스템이 세상을 '보고' 해석하는 능력이 더욱 정교해짐에 따라 중대한 격차가 발생했습니다. 즉, 이 시스템들은 주로 인터넷의 현대적 이미지들로 학습되었으며, 역사적 시각 문화의 의미를 파악하는 데 종종 어려움을 겪는다는 점입니다. 이 격차를 메우기 위해 연구자들에게는 조직화되어 있고 기계가 학습할 준비가 된 방대하고 다양한 역사적 이미지 컬렉션이 필요합니다.
하버드 대학교의 연구진은 약 100만 권의 디지털화된 도서 속에 들어 있는 시각적 요소들을 찾아내고, 분류하고, 설명하기 위해 설계된 새로운 오픈 소스 시스템을 구축함으로써 이 과제를 해결했습니다. 기술 보고서에 상세히 기술된 이들의 작업은 마치 숙련된 사서가 책을 훑어보며 모든 그림을 찾아내고, 그것이 무엇인지 파악한 뒤, 인간의 개입 없이 짧은 설명을 작성하는 것과 같은 파이프라인을 만들어냅니다. 그 결과 983,004권의 서적에서 추출한 2,200만 개 이상의 시각적 요소를 포함하는 데이터셋이 탄생했습니다. 이 컬렉션에는 과학적 도표와 악보부터 초상화와 장식 예술에 이르기까지 모든 것이 포함되어 있으며, 각 요소에는 유형에 대한 정보와 경우에 따라 컴퓨터가 생성한 캡션이 태그로 붙어 있습니다. 이 데이터를 공개함으로써 연구진은 인공지능 모델이 역사적 자료를 더 잘 이해하도록 돕기를 희망하며, 이는 더 나은 도구가 더 많은 데이터를 낳고, 그 데이터가 다시 더 나은 탐구 도구를 낳는 순환 구조를 만드는 것을 목표로 합니다.
과정은 가장 기본적인 작업인 그림 찾기에서 시작됩니다. 연구진은 디지털 페이지를 스캔하여 이미지가 포함된 영역을 찾아내는 시스템을 개발했습니다. 수억 페이지에 달하는 방대한 컬렉션을 다루어야 했기에, 이 시스템은 매우 효율적이어야 했습니다. 그들은 그림이 있는 페이지와 없는 페이지의 수천 가지 사례를 보여줌으로써 시각적 요소를 인식하도록 특화된 컴퓨터 모델을 훈련시켰습니다. 이 모델은 텍스트를 무시하고 시각적인 부분에 집중하는 법을 배웠으며, 발견된 모든 삽화, 사진 또는 도표 주위에 상자를 그렸습니다. 최종 실행 단계에서 시스템은 전체 컬렉션을 처리하여 2,800만 개 이상의 잠재적 이미지를 식별했습니다. 높은 품질을 보장하기 위해 연구진은 얼룩이나 스캔 오류와 같은 가짜 알람을 제거하는 엄격한 필터를 적용했으며, 그 결과 2,260만 개의 뚜렷한 시각적 요소를 남겼습니다.
이미지를 찾은 후, 다음 단계는 그것들이 무엇인지 이해하는 것이었습니다. 시스템은 2,260만 개의 이미지를 다섯 가지 주요 범주로 분류했습니다: 일반 삽화 및 사진, 음악 기호, 북플레이트와 같은 장식 요소, 차트 및 그래프, 그리고 스캔 과정에서 우연히 찍힌 손가락이나 클립 같은 스캔 아티팩트입니다. 연구진은 또 다른 모델을 훈련시켜 음악 악보와 텍text 페이지의 차이점, 혹은 장식 테두리와 과학적 도표의 차이점을 구별하도록 가르쳤습니다. 시스템은 매우 높은 정확도를 보였는데, 예를 들어 음악 기호는 거의 완벽한 확신도로 구별해 냈지만, 장식 테두리와 같은 일부 범주는 다른 유형의 삽화와 분리하는 데 약간의 어려움을 겪기도 했습니다. 이 분류 과정은 매우 중요한데, 왜냐하면 연구자들이 "18세기의 모든 차트를 보여줘"라거나 "특정한 북플레이트의 모든 사례를 찾아줘"와 같이 구체적인 질문을 던질 수 있게 해주기 때문입니다.
분류를 마친 후, 팀은 중복 문제에 착수했습니다. 대규모 디지털화 프로젝트에서는 동일한 이미지가 여러 번 나타나는 경우가 흔한데, 이는 여러 판본의 책에 사용되었거나 스캔 과정에서 같은 페이지가 실수로 두 번 캡처되었기 때문입니다. 이를 정리하기 위해 연구진은 일치하는 이미지를 찾는 두 가지 방법을 사용했습니다. 첫 번째 방법은 이미지의 픽셀 패턴을 비교하여 정확한 복사본을 찾는 것이었고, 두 번째 방법은 이미지의 더 깊은 의미를 살펴봄으로써 스캔 변동으로 인해 약간 달라 보일 수 있는 유사 중복 이미지를 찾는 것이었습니다. 이 두 접근 방식을 결합함으로써 연구진은 수백만 개의 반복되는 이미지를 식별하고 그룹화하여, 최종 데이터셋이 단순히 이미지가 나타난 모든 횟수의 목록이 아니라 고유한 시각적 콘텐츠를 나타내도록 보장했습니다. 이 단계는 전체 항목 수를 약 20% 감소시켜, 연구에 더 깨끗하고 가치 있는 컬 collection을 남겼습니다.
프로젝트의 마지막이자 가장 실험적인 부분은 시스템에게 이미지에 대한 설명을 쓰도록 가르치는 것이었습니다. 대규모 언어 모델을 사용하여 연구진은 컴퓨터에게 각 이미지가 무엇을 보여주는지 설명하는 짧은 캡션을 생성하도록 요청했습니다. 컴퓨터가 맥락을 이해할 수 있도록, 그들은 이미지 자체와 함께 주변 페이지의 텍스트를 함께 입력했습니다. 시스템은 정확하게 기술하고 추측을 피하며, 명확하게 보이는 것만을 설명하도록 지시받았습니다. 연구진은 이 캡션들이 실험적이며 주의해서 사용해야 한다고 언급했지만, 성공적으로 약 1,800만 개의 설명을 생성해 냈습니다. 가능한 경우 원문의 언어로 작성된 이 캡션들은 시각적 콘텐츠를 검색하는 새로운 방법을 제공하며, 사용자가 단순히 파일 이름이나 카테고리가 아닌 실제 내용을 바탕으로 이미지를 찾을 수 있게 해줍니다.
연구진은 또한 이 거대한 작업의 실무적인 측면에도 주의를 기울여, 과정이 효율적이고 다른 기관에서도 반복될 수 있도록 했습니다. 그들은 가장 큰 병목 현상이 컴퓨터의 사고 능력이 아니라, 이미지를 처리하기 위해 로드하고 준비하는 데 걸리는 시간이라는 것을 발견했습니다. 워크플로우를 최적화함으로써, 그들은 표준 컴퓨팅 자원을 사용하여 몇 주 만에 전체 컬렉션을 처리할 수 있었습니다. 팀은 훈련시킨 모델과 결과 데이터셋을 포함한 전체 파이프라인을 오픈 소스 도구로 공개하여, 다른 도서관과 연구자들이 이 작업을 사용하고 개선할 수 있도록 초대했습니다. 또한 그들은 데이터의 한계에 대한 명확한 경고도 포함했는데, 일부 이미지는 제작 당시의 시대상을 반영하는 역사적 편향이나 유해한 언어를 포함하고 있을 수 있으며, 컴퓨터가 생성한 캡션이 완벽하지 않을 수 있다는 점을 명시했습니다.
이 프로젝트는 인류 문화의 시각적 역사를 인간과 기계 모두가 접근할 수 있도록 만드는 데 있어 중요한 진전을 의미합니다. 방대한 양의 비구조화된 도서 이미지 컬렉션을 검색 가능하고 분류되며 설명이 달린 데이터셋으로 전환함으로써, 연구진은 과거를 연구하기 위한 새로운 토대를 마련했습니다. 이 데이터셋은 2,200만 개 이상의 시각적 요소를 포함하고 있어, 인공지능이 역사적 맥락을 이해하도록 훈련시키고 디지털 인문학 연구의 새로운 형태를 가능하게 하는 풍부한 자원을 제공합니다. 이 작업은 세심한 계획과 적절한 도구가 있다면, 수백만 권의 오래된 책 속에 숨겨진 시각적 보물들을 세상 밖으로 끌어내어 그들이 들려주는 이야기에 대한 새로운 통찰력을 제공할 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.