Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers
이 논문은 보스턴 공공 도서관과 함께 개발한 모듈식이며 계산 효율적인 시스템인 Institutional Newspapers Pipeline을 소개하며, 이는 세그멘테이션, OCR, 그리고 고급 텍스트 분석의 다단계 워크플로우를 통해 140만 개 이상의 역사적 신문 스캔본을 163억 개의 고품질 토큰을 포함하는 구조화된 오픈 데이터셋으로 처리하였습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
신문은 지역 선거부터 밀가루 가격, 부고 기사에서 새로운 발명품 광고에 이르기까지 인간 삶의 모든 것을 포착하는 일상의 기록입니다. 수 세기 동안 이러한 이야기들은 깨지기 쉬운 종이 위에 보존되어 왔으나, 디지털 시대에 들어서며 도서관들은 이 수백만 페이지를 스캔하여 접근 가능하게 만들었습니다. 하지만 신문 페이지의 이미지를 유용하고 검색 가능한 텍스트로 변환하는 것은 놀라울 정도로 어렵습니다. 신문 페이지는 텍스트 열, 장식적인 헤드라인, 그리고 서로 뒤섞이는 광고들로 가득 차 있어 매우 조밀하고 무질서합니다. 깨끗한 문서에는 잘 작동하는 표준 컴퓨터 프로그램들은 이러한 혼란에 의해 혼동을 일으켜, 오류가 가득하거나 전체 섹션이 누락된 텍스트를 생성하곤 합니다. 이는 역사를 통해 학습하고자 하는 연구자들과 인공지능 시스템에게 장벽을 형성하는데, 그들이 페이지에 적힌 내용을 쉽게 읽을 수 없기 때문입니다.
하버드 법대와 보스턴 공공도서관의 연구팀은 이 문제를 해결하기 위한 새로운 방법을 개발했습니다. 그들은 단일 신문 페이지를 가장 작고 논리적인 조각들로 분해하고, 각 조각의 텍스트를 높은 정확도로 읽어낸 다음, 컴퓨터가 레이아웃과 콘텐츠를 이해할 수 있도록 모든 것을 정리하도록 설계된 단계별 시스템을 만들었습니다. 그들의 목표는 단순히 텍스트를 디지털화하는 것이 아니라, 100만 개 이상의 역사적 신문 스캔본의 진정한 콘텐츠를 드러내는 깨끗하고 구조화된 데이터셋을 만드는 것이었습니다. 각 텍스트 블록이나 이미지를 별개의 항목으로 취급함으로써, 그들은 이전에는 효과적으로 사용하기에 너무 무질서했던 자료들로부터 수십억 개의 단어를 추출해 냈습니다.
과정은 디지털 신문 페이지 이미지를 가져와 컴퓨터가 인간 독자처럼 그것을 보도록 가르치는 것으로 시작됩니다. 시스템은 페이지 전체를 한꺼번에 읽으려고 시도하는 대신, 먼저 단일 기사, 사진, 또는 광고와 같은 모든 뚜렷한 콘텐츠 블록을 식별합니다. 연구진은 수천 개의 사례를 보여줌으로써 컴퓨터 모델이 이러한 블록, 즉 '크롭(crops)'을 인식하도록 훈련시켰습니다. 이 모델은 가장자리 주변의 빈 흰색 공간과 열 사이의 복잡한 경계선을 무시하고 실제 콘텐츠에만 집중하는 법을 배웠습니다. 테스트 결과, 이 세그멘테이션(segmentation) 도구는 140만 개 이상의 신문 페이지에 걸쳐 8,300만 개 이상의 개별 블록을 성공적으로 식별하며 매우 효과적임을 입증했습니다. 평균적으로 각 페이지는 약 56개의 별개 조각으로 나뉘었으며, 이를 통해 시스템은 과거의 복잡한 레이아웃을 정밀하게 처리할 수 있었습니다.
페이지가 관리 가능한 조각들로 나뉘면, 시스템은 각 조각 내의 텍스트를 읽습니다. 연구진은 최선의 결과를 보장하기 위해 두 가지 다른 방법을 병행하여 사용했습니다. 첫 번째 방법은 이미지를 디지털 문자로 변환하기 위해 수십 년 동안 사용되어 온 전통적인 도구를 사용합니다. 두 두 번째 방법은 이미지의 맥락을 더 잘 이해할 수 있는 더 새롭고 발전된 유형의 인공지능 모델을 사용합니다. 이 새로운 모델은 특히 오래된 도구가 혼란을 느꼈던 손상되거나 흐릿하거나 장식적인 글꼴로 쓰인 텍스트를 읽는 데 탁월했습니다. 많은 경우, 이 고급 모델은 페이지의 찢어진 부분에서 누락된 글자를 추측하여 문장을 완성할 수도 있었습니다. 두 방법의 출력을 결합함으로써, 팀은 수천 권의 책을 채울 수 있는 양인 총 163억 개의 토큰에 달하는 방대한 텍text 컬렉션을 생성했습니다.
텍스트가 추출되면, 시스템은 각 콘텐츠 조각이 실제로 무엇인지 이해하기 위해 작동합니다. 시스템은 수백만 개의 블록을 뉴스 기사, 광고, 사진, 만화 등의 카테고리로 분류합니다. 이를 정확하게 수행하기 위해 시스템은 블록의 시각적 외형과 포함된 단어를 모두 살펴봅니다. 예를 들어, 텍스트가 없는 사진 형태의 블록은 이미지로 식별되고, 헤드라인과 이야기가 있는 블록은 뉴스로 식별됩니다. 연구진은 광고가 가장 많은 수의 블록을 차지하지만, 실제 뉴스 기사가 대부분의 단어를 포함하고 있다는 사실을 발견했습니다. 이러한 구분은 매우 중요한데, 이는 연구자들이 시간이 흐름에 따라 신문의 시각적 특성이 어떻게 변화했는지, 즉 수십 년이 지나면서 광고가 점점 더 시각적으로 변하고 페이지에서 차지하는 비중이 늘어났다는 점을 주목할 수 있게 해주기 때문입니다.
또한 시스템은 텍스트를 인간이 자연스럽게 읽는 순서대로 정리합니다. 신문은 기사가 한 열에서 시작하여 다른 열로 이어지거나, 그림에 의해 중단되는 경우가 많습니다. 연구진은 어떤 블록이 다음에 오고 그 다음에 무엇이 오는지를 결정하는 경로를 맵핑하는 방법을 개발했습니다. 이는 복잡한 작업이지만, 그들의 접근 방식은 상당 부분의 페이지에 대해 읽기 순서를 성공적으로 재구성하여 거시적 수준에서 72.1%, 미시적 수준에서 80.8%의 정확도를 달s성했으며, 텍스트가 논리적으로 처음부터 끝까지 흐를 수 있게 했습니다. 이 단계는 엉클어진 이미지 파편들을 검색 및 분석이 가능한 일관된 서사로 변모시킵니다.
단순히 텍스트를 읽고 정리하는 것을 넘어, 시스템은 모든 블록에 유용한 정보 계층을 추가합니다. 시스템은 사용된 언어를 식별하여, 대부분의 컬렉션이 영어이지만 당시의 다양한 이민자 공동체를 반영하는 유대어, 독일어, 스웨덴어, 프랑스어 부분이 상당하다는 것을 찾아냅니다. 또한 시스템은 텍스트를 스캔하여 사람, 장소, 조직의 이름을 찾아내고, 보스턴이나 뉴욕 같은 위치나 의회 같은 기관의 언급 수백만 건을 태깅합니다. 나아가, 시스템은 각 블록에 주제를 할당하여 어떤 것은 비즈니스 보고서로, 어떤 것은 정치 뉴스로, 또 어떤 것은 과학 업데이트로 라벨을 붙입니다. 이러한 풍부한 태깅을 통해 연구자들은 "광고와 뉴스 기사 중에서 '보스턴'이라는 단어가 얼마나 자주 언급되었는가?" 또는 "1880년대에 가장 흔했던 주제는 무엇인가?"와 같은 구체적인 질문을 던질 수 있습니다.
전체 작업은 값비싼 슈퍼컴퓨터를 필요로 하기보다 표준 컴퓨터 하드웨어에서 실행될 수 있을 만큼 효율적으로 설계되었습니다. 연구진은 데이터가 방대함에도 불구하고 시스템이 멈추거나 느려지지 않도록 각 단계를 최 최적화하여 데이터를 배치(batch) 단위로 처리했습니다. 렌트한 컴퓨터 전력을 사용하여 이 파이프라인을 실행하는 데 드는 총 비용은 약 25,000달러로 추산되었는데, 이는 가장 발전되고 비싼 모델들을 사용하는 데 드는 비용의 극히 일부입니다. 이러한 효율성은 다른 도서관과 기관들이 자신들의 역사적 컬렉션을 여는 데 동일한 도구를 잠재적으로 사용할 수 있음을 의미합니다.
이 작업의 결과물은 1795년부터 1930년 사이의 100만 개 이상의 신문 페이지의 텍스트뿐만 아니라 구조와 맥락을 포함하는 방대한 오픈 데이터셋입니다. 연구진은 도구, 모델, 그리고 최종 데이터를 대중에게 공개하여 누구나 이 역사를 새로운 방식으로 탐구할 수 있게 했습니다. 시스템이 완벽하지는 않으며 여전히 가장 까다로운 사례들에 대해서는 인간의 감독이 필요하지만, 이는 역사적 신문을 접근 가능하게 만드는 데 있어 중대한 도약을 의미합니다. 혼란스럽고 노이즈가 많은 이미지를 깨끗하고 구조화된 데이터로 변환함으로써, 팀은 과거 사람들의 일상을 들여다보는 창을 열었으며, 인공지능이 인류의 역사로부터 학습할 수 있는 토대를 마련했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.