← 최신 논문
💻 computer science

TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents

TongGuOCR는 일관된 인식 블록을 위한 전처리 모듈과 희귀 글자를 위해 어휘를 확장하고 공간적 전이를 모델링하는 토큰 증강 인식 모듈을 채택함으로써 도전적인 벤치마크에서 기존의 전통적 및 멀티모달 모델들을 크게 능가하며 중국 역사 문서를 정확하게 필사하도록 설계된 새로운 레이아웃 인식 및 토큰 증강 OCR 프레임워크이다.

원저자: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

게시일 2026-08-07
📖 5 분 읽기🧠 심층 분석

원저자: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 천 년 된 일기를 읽으려는 탐정이라고 상상해 보세요. 그런데 페이지는 먼지로 뒤덮여 있고, 잉크는 희미하며, 필체는 너무 기이해서 당신의 가장 똑똑한 친구조차 글자를 알아볼 수 없습니다. 이것이 바로 역사학자들이 중국 역사 문헌의 비밀을 풀기 위해 매일 겪는 고충입니다. 수 세기 동안 이 귀중한 텍스트들은 스캔된 이미지, 즉 컴퓨터가 인간처럼 '읽을' 수는 없지만 '볼' 수는 있는 종이 사진 속에 갇혀 있었습니다. 이 사진들을 검색 가능한 텍스트로 바꾸기 위해 과학자들은 광학 문자 인식(OCR)이라는 기술을 사용합니다. OCR을 페이지의 사진을 보고 단어를 타이핑하는 초고속 로봇 사서라고 생각해보세요. 하지만 이 로봇이 복잡한 레이아웃, 이상한 기호, 그리고 페이지 위에서 혼란스러운 패턴으로 이리저리 튀는 문장을 가진 고서를 마주하게 되면, 로봇은 길을 잃거나 줄을 건너뛰거나 횡설수설한 글자를 만들어내곤 합니다.

여기서 새로운 연구팀이 TongGuOCR라는 영리한 해결책을 들고 등장했습니다. 그들은 로봇에게 이 책들을 가르치는 기존 방식이 마치 피자 한 판을 한 입에 통째로 먹으려는 것과 같다는 점을 깨달았습니다. 너무 지저지고 로봇이 세부 사항을 감당할 수 없었던 것이죠. 대신, 그들은 먼저 피자를 완벽하고 다루기 쉬운 조각으로 자르고(레이아웃 인식 전처리), 그 다음 로봇에게 그 조각 위에 있는 이상하고 희귀한 재료들을 이해할 수 있는 특별한 새로운 언어를 가르쳤습니다(토큰 증강 인식). 이 두 가지 기술을 결합함으로써, 그들은 단순히 단어를 추측하는 것이 아니라, 텍스트가 수직 열로 쓰여 있거나 페이지 곳곳에 흩어져 있는 경우에도 고대 텍스트의 흐름을 실제로 이해하는 로봇을 만들어냈습니다.

문제점: 왜 고서들이 로봇을 고장 내는가

중국 역사 문헌은 문화의 보물 상자와 같지만, 읽기가 매우 까다롭습니다. 이 문서들은 텍�스트가 수직으로 흐르거나, 주석(작은 메모)이 줄 사이에 끼어 있거나, 읽는 순서가 항상 왼쪽에서 오른쪽 또는 위에서 아래로 정해져 있지 않은 복잡한 레이아웃을 가지고 있습니다. 게za 더, 이러한 책들은 현대 사전에는 존재하지 않는 "희귀 글자(고어)"들로 가득 차 있습니다.

표준 AI 모델이 이 페이지들을 읽으려고 할 때, 다음과 같은 세 가지 큰 골칫거리에 직면합니다:

  1. 레이아웃의 혼란: 로봇이 페이지 전체를 한꺼번에 보면 이미지가 흐릿해지고 주변 단어와의 맥락을 놓치게 됩니다. 반대로 한 줄씩만 보면, 전체적인 그림을 놓치고 다음에 어디로 가야 할지 혼란에 빠집니다.
  2. 희귀 글자 문제: 현대 AI는 오늘날의 언어로 훈련되었습니다. AI가 고대의 희귀한 글자를 마주하면, 이를 의미 없는 작은 파편들로 잘게 쪼개버리는 경우가 많습니다(마치 단어 전체를 인식하는 대신 개별 글자를 추측하며 철자를 맞추려는 것과 같습니다). 이는 글자를 정확하게 인식하는 것을 어렵게 만듭니다.
  3. "다음은 어디?"라는 혼란: 한 줄을 읽은 후, 로봇은 아래 줄로 내려가야 할지, 오른쪽 줄로 가야 할지, 아니면 여백의 메모를 읽어야 할지 알지 못합니다. 명확한 지도 없이는 줄을 건너뛰거나 잘못된 순서로 읽게 됩니다.

해결책: TongGuOCR의 두 단계 마법

South China University of Technology와 Huawei의 연구진은 이러한 고대의 퍼즐을 해결하기 위해 설계된 프레임워크인 TongGuOCR를 제안했습니다. 그들은 단순히 더 많은 컴퓨팅 파워를 쏟아부은 것이 아니라, 로봇이 텍스트를 보고 생각하는 방식을 바꿨습니다.

1단계: 스마트 슬라이서 (레이아웃 인식 전처리)

빽빽하고 복잡한 신문을 읽는다고 상상해 보세요. 페이지 전체를 읽으려 하면 눈이 피로해지고, 단어 하나하나를 읽으면 의미를 놓치게 됩니다. TongGuOCR은 "스마트 슬라이서"를 사용하여 페이지를 인식 블록으로 자릅니다.

단순히 직선으로 자르는 대신, 시스템은 페이지를 살펴보고 연속된 텍ست 줄들을 깔끔하고 일관된 덩어리로 묶습니다. 이는 마치 요리사가 케이크를 무작정 자르는 것이 아니라, 프로스팅과 케이크가 함께 유지되도록 완벽하고 한 입 크기의 조각으로 정성스럽게 자르는 것과 같습니다.

  • 작동 방식: 시스템은 텍스트 줄을 가져와 시각적으로 타당한 블록으로 그룹화합니다. 그런 다음 이 블록들을 다듬어, 해당 특정 덩어리에 속하지 않는 주변의 방해 요소들을 제거합니다.
  • 결과: 로봇은 텍스트의 작은 구역을 담은 깨끗하고 집중된 이미지를 얻게 됩니다. 이를 통해 페이지의 나머지 부분에서 오는 노이즈 없이도 로컬 맥락(단어들이 서로 어떻게 가까이 있는지)을 보존할 수 있습니다.

2단계: 특별한 번역기 (토큰 증강 인식)

텍스트가 완벽한 블록으로 잘리고 나면, 로봇은 그것을 읽어야 합니다. 여기서 TongGuOCR은 로봇이 고대 텍스트를 더 잘 이해할 수 있도록 두 가지 새로운 언어를 사용하는 "특별한 번역기"를 사용합니다.

  • 언어 1: 희귀 글자 사전.
    현대 AI 토크나이저(컴퓨터가 읽을 수 있도록 텍스트를 조각내는 도구)는 종종 희귀한 고대 글자를 작고 혼란스러운 파편으로 쪼개버립니다. TongGuOCR은 모든 희귀 글자에 대해 단일 토큰(single-token) 정체성을 부여함으로써 이를 해결합니다.

    • 비유: 당신이 새로운 언어를 배우고 있다고 상상해 보세요. 어려운 단어를 볼 때마다 매번 철자를 하나하나 써야 하는 대신, 그 단어 전체가 적힌 특별한 스티커를 받는 것입니다. 그냥 스티커를 붙이기만 하면 끝납니다. 이는 로봇이 희귀 글자를 훨씬 더 빠르고 정확하게 인식하도록 만듭니다.
  • 언어 2: "다음은 어디?" 지도.
    읽는 순서에 대한 혼란을 해결하기 위해, 시스템은 줄 사이에 특별한 **전이 토큰(transition tokens)**을 삽입합니다. 이것은 로봇에게 다음에 어디를 봐야 할지 알려주는 작은 화살표나 표지판과 같습니다.

    • 비유: 패널이 이리저리 움직이는 만화책을 읽고 있다면, "이 패널 다음에는 오른쪽 상단으로 가세요"라고 알려주는 가이드가 필요합니다. TongGuOCR은 이러한 디지털 표지판(예: <right|down> 또는 <left|up>)을 텍스트 스트림에 추가합니다. 이는 로봇의 시선을 올바른 경로로 안내하여, 줄을 건너뛰거나 거꾸로 읽는 것을 방지합니다.

결과: 고대 텍스트 분야의 새로운 기록

연구팀은 중국 역사 문헌에 대한 두 가지 주요 벤치마크인 MTHv2M5HisDoc를 통해 TongGuOCR을 테스트했습니다. 이 데이터셋들은 복잡한 레이아웃과 희귀 글자로 가득 찬, 마치 고대 텍스트 인식의 "올림픽"과도 같습니다.

결과는 인상적이었습니다. TongGuOCR은 거대한 범용 AI 모델과 다른 전문 OCR 도구들을 포함한 기존의 최선책들을 뛰어넘었습니다.

  • 도전적인 M5HisDoc 벤치마크에서, TongGuOCR은 **93.76%의 정확도(AR)**를 달 achievement 했습니다.
  • 로봇이 저지른 실수의 척도인 **정규화 편집 거리(NED)**를 10.43에서 6.15로 줄였습니다.
  • 무엇보다 읽기 흐름에 중요한 **읽기 순서 편집 거리(RO-ED)**를 7.53에서 3.49로 대폭 낮췄습니다. 이는 로봇이 텍스트를 따라가는 경로를 훨씬 더 잘 파악하여, 줄을 건너뛰거나 길을 잃는 일이 거의 없었음을 의미합니다.

시각적 비교(논문의 그림 4 참조)를 보면, 다른 모델들이 줄을 놓치거나, 잘못된 순서로 읽거나, 희귀 글자를 뭉개버리는 반면, TongGuOCR은 모든 대상 줄을 성공적으로 복구하고 역사적 페이지의 자연스러운 읽기 순서를 따랐습니다.

이것이 의미하는 바

이 논문은 고대 텍스트를 효과적으로 읽기 위해서는 단순히 더 크고 강력한 AI 모델에만 의존해서는 안 된다는 점을 시사합니다. 우리는 데이터를 모델에 어떻게 제공할지에 대해 더 영리해져야 합니다. 페이지를 논리적인 덩어리로 나누고(레이아웃 인식 전처리), 모델에게 더 나은 어휘와 읽기 순서를 위한 명확한 지도를 제공함으로써(토큰 증강 인식), 우리는 이전에는 읽을 수 없는 이미지 뒤에 숨겨져 있던 역사의 비밀을 풀 수 있습니다.

연구진은 이 시스템이 큰 진전이지만 아직 완벽하지는 않다고 언급했습니다. 이 시스템은 훈련 데이터에 포함된 글자에 의존하므로, 완전히 알려지지 않았거나 해독되지 않은 기호에는 여전히 어려움을 겪을 수 있습니다. 하지만 대다수의 중국 역사 문헌에 대해, TongGuOCR은 정적인 이미지를 역사학자와 호기 Curious한 마음을 가진 사람들이 탐구할 수 있는 살아있는 검색 가능 텍스트로 바꿔주는 강력한 새로운 과거의 열쇠를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →