← 최신 논문
🤖 AI

Towards Hierarchical Structure Understanding of Newspaper Images

이 논문은 모듈형 바텀업 파이프라인과 티라미수(Tiramisu)라고 불리는 새로운 엔드 투 엔드 트랜스포머 아키텍처라는 두 가지 상호 보완적인 접근 방식을 제안하고, 역사적 신문의 계층적 정보 검색을 평가하기 위한 새로운 데이터셋인 핀람 라 리베르테(Finlam La Liberté)를 도입함으로써 복잡한 신문 레이아웃을 이해하는 과제를 다룹니다.

원저자: William Mocaër, Solène Tarride, Thomas Constum, Merveilles Agbeti-Messan, Tom Simon, Clément Chatelain, Stéphane Nicolas, Pierrick Tranouez, Sébastien Cretin, Thierry Paquet

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: William Mocaër, Solène Tarride, Thomas Constum, Merveilles Agbeti-Messan, Tom Simon, Clément Chatelain, Stéphane Nicolas, Pierrick Tranouez, Sébastien Cretin, Thierry Paquet

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

구겨지고 커피 얼룩이 묻은 뒤 다시 펼쳐진 거대하고 혼란스러운 광고판을 읽으려고 노력하는 모습을 상상해 보십시오. 이제 그 광고판이 아주 작은 헤드라인, 긴 기사, 기묘한 광고, 그리고 사진들이 명확한 경계선 없이 뒤섞여 있는 오래된 신문 한 페이지라고 상상해 보십시오. 이것이 바로 컴퓨터가 역사를 "읽기" 위해 마주하는 일상의 현실입니다. 수십 년 동안 과학자들은 기계에게 단어를 인식하는 법(OCR이라 불리는 과정)과 페이지의 레이아웃을 이해하는 법을 가르쳐 왔습니다. 하지만 오래된 신문은 특별한 종류의 악몽입니다. 그것들은 매우 조밀하고, 지저도하며, 큰 섹션 안에 작은 기사가 있고, 그 기사는 다시 문단으로 구성되며, 문단은 다시 단어로 이루어지는 복잡한 계층 구조로 조직되어 있기 때문입니다. 만약 컴퓨터가 순서를 틀리게 파악한다면, 이야기의 시작을 읽기도 전에 끝을 먼저 읽거나, 서로 다른 두 개의 뉴스 기사를 하나의 거대하고 터무니없는 문단으로 섞어버릴 수도 있습니다. 이를 이해하는 것은 단순히 글자를 타이핑하는 문제가 아닙니다. 그것은 마치 책들이 쌓여 있는 더미 속에서도 정확히 어떤 책이 어느 선반에 속하는지 아는 사서처럼, 페이지의 '구조'를 이해하는 일입니다.

이 논문은 이 문제를 해결하기 위해 컴퓨터에게 신문 페이지를 해독하는 법을 가르치는 두 가지 매우 다른 방식을 테스트함으로써 바로 그 혼란에 맞섭니다. 프랑스 국립도서관과 협력한 연구진은 컴퓨터가 이러한 역사적 문서의 레이아웃, 읽기 순서, 그리고 내용을 자동으로 파악할 수 있는 시스템을 구축할 수 있는지 확인하고자 했습니다. 그들은 단순히 추측만 한 것이 아니라, 이 일을 수행할 두 가지 서로 다른 "로봇"을 만들어 서로 경쟁시켰습니다.

첫 번째 로봇은 **상향식 파이프라인(Bottom-Up Pipeline)**입니다. 이것은 마치 전문 탐정들이 줄을 지어 일하는 팀과 같습니다. 먼저, 한 명의 탐정(YOLO라는 모델)이 페이지를 스캔하여 모든 개체를 찾아냅니다: "저것은 사진이다", "저것은 제목이다", "저것은 문단이다"라고 말이죠. 다음으로, 두 번째 탐정(LayoutReader)이 흩어져 있는 이 개체들을 살펴보고 점을 잇듯이 어떤 순서로 읽어야 할지를 파악합니다. 마지막으로, 세 번째 탐정은 맞춤형 규칙서를 사용하여 이 점들을 완전한 이야기와 섹션으로 그룹화합니다. 이는 각 단계가 이전 단계로부터 바통을 이어받아야 하는 모듈형 방식입니다.

두 번째 로봇은 **티라미수(Tiramisu)**라고 불리는 **하향식 트랜스포머(Top-Down Transformer)**입니다. 티라미수는 전문가 팀 대신, 페이지 전체를 한 번에 보고 위에서 아래로 향하는 계층 구조를 이해하려고 노력하는 하나의 초지능적인 뇌와 같습니다. 이것은 채소를 하나씩 써는 요리사가 아니라, 식사 전체를 보고 에피타이저, 메인 코스, 디저트가 어떻게 어우러지는지 이해한 뒤에 칼을 대는 마스터 셰프와 같습니다. 티라미수는 "패스(pass)" 방식으로 작동합니다: 먼저 큰 섹션을 식별하고, 그다음 그 섹션 내부의 기사를 찾고, 그다음 기사 내부의 블록을 찾으며, 마지막으로 텍스트를 읽습니다. 이 모든 과정을 한 번에 수행하며, 진행하면서 구조를 학습합니다.

이 두 가지 접근 방로를 테스트하기 위해, 연구진은 1920년대 프랑스 신문의 완전한 호(issue) 1,500개를 포함하는 **핀람 라 리베르테(Finlam La Liberté)**라는 새로운 데이터셋을 만들었습니다. 또한, 실제 역사적 페이지들은 컴퓨터를 가르치기에 너무 지저분하거나 손상된 경우가 많기 때문에, AI를 훈련시키기 위한 완벽하고 인위적인 신문 페이지를 생성하는 "합성(synthetic)" 신문 생성기도 구축했습니다.

결과는 매우 다른 강점을 가진 두 방식의 이야기였습니다. 상향식 파이프라인은 속도와 정밀함의 전문가로 나타났습니다. 이 방식은 믿을 수 없을 정도로 빨랐으며(강력한 컴퓨터에서 1초 미만 소요), 개별 문단이나 이미지와 같은 퍼즐의 아주 작은 조각들을 찾아내고 라벨을 붙이는 데 탁кси 뛰어났습니다. 이 모델은 작은 블록들의 읽기 순서를 87.20%의 확률로 정확히 맞혔습니다. 하지만 이 방식은 다소 복잡한 '루브 골드버그 장치'와 같아서, 첫 번째 탐정이 한 곳이라도 놓치면 전체 체인이 혼란에 빠질 수 있다는 단점이 있습니다.

하나의 통합된 뇌인 티라미수는 조금 더 느렸으며(약 1.5초 소요), 때때로 작은 블록을 아예 감지하지 못하기도 했습니다. 만약 첫 번째 패스에서 섹션을 놓친다면, 그 섹션 안에 있는 모든 것을 놓치게 됩니다. 그러나 티라미수가 무언가를 찾아냈을 때는 전체적인 그림을 이해하는 데 탁월했습니다. 티라미수는 페이지에 있는 기사와 섹션의 개수를 세는 데 놀라운 능력을 보여주었는데, 이 "개수"를 맞힌 확률은 89%로 파이프라인보다 높았습니다. 또한 주요 기사들의 순서를 정하는 데 있어서도 97.43%의 정확도를 보이며 훌륭한 성과를 냈습니다.

이 논문은 아직 단 하나의 "완벽한" 해결책은 없다고 결론짓습니다. 만약 당신이 수백만 페이지를 빠르게 처리해야 하고 모든 작은 문단의 위치를 정확히 알아야 한다면, 모듈형인 상향식 파이프라인이 승자입니다. 하지만 만약 단일한 통합 모델을 통해 문서의 전반적인 구조를 이해할 수 있는 시스템이 필요하고, 속도와 탐지 정밀도를 약간 희생하더라도 그 우아함을 얻고자 한다면, 티라미수는 유망한 새로운 방향입니다. 연구진은 파이프라인의 속도와 정확도에 매우 확신하고 있으며, 이를 통해 2026년 말까지 프랑스 국립도서관의 문서 800만 개 이상을 디지털화할 계획입니다. 이는 때때로 전문가 팀이 복잡한 역사적 퍼즐을 푸는 데 가장 좋은 방법임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →