← 최신 논문
🤖 machine learning

Digitizing Nepal's Written Heritage: A Comprehensive HTR Pipeline for Old Nepali Manuscripts

본 논문은 인코더-디코더 아키텍처와 데이터 중심 기법의 체계적 탐구를 통해 4.9%의 문자 오류율을 달성하고, 저자원 역사적 문자 연구 지원을 위해 코드와 설정을 공개함으로써 고대 네팔어 필사본을 위한 최초의 엔드투엔드 필기 텍스트 인식 파이프라인을 제시한다.

원저자: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고대이지만 매우 취약한 책들이 고유의 언어로 쓰여 있고, 그 언어는 수 세기 전부터 원래 형태로 말해지지 않았다고 상상해 보세요. 먹물은 바래고, 종이는 구겨졌으며, 필체는 지문처럼 독특합니다. 한 명도 같은 필체로 쓰지 않았기 때문입니다. 컴퓨터에게 이 책들을 읽게 하려는 시도는 마치 로봇에게 천 명의 다른 예술가들이 서로 다른 필체로 쓴 암호를 해독하라고 요청하는 것과 같습니다. 이 암호는 기호들이 엉킨 덩굴처럼 보입니다.

이 논문은 연구팀이'초고독자'를 구축하여 고대 네팔어 필사본을 디지털화한 과정을 다룹니다. 그들이 어떻게 했는지 간단히 설명하겠습니다:

도전 과제: 건초더미 속의 바늘

연구자들은 컴퓨터에게 고대 네팔어를 읽도록 가르치고자 했습니다. 고대 네팔어는 현대 힌디어와 네팔어에도 사용되는 데바나가리 문자로 쓰였지만, 몇 가지 구식적인 특징이 있습니다.

  • 문제: 컴퓨터가 연구할 수 있는 고대 필기 노트의 예시가 매우 적습니다. 마치 흐릿한 사진 세 장만 가지고 특정 종류의 새를 인식하도록 가르치려는 것과 같습니다.
  • 혼란: 문서들은 지저분합니다. 먹물이 번지고, 종이가 뒤틀렸으며, 작성자들은 단어 사이에 공백을 사용하지 않았습니다. 또한 점이나 선처럼 보이는 이상한 기호들을 사용했는데, 이 기호들은 위치에 따라 의미가 달라집니다.

해결책: 3 단계 훈련 캠프

컴퓨터에게 직접 가르칠 충분한'진짜'고대 책이 없었기 때문에, 그들은 3 단계 훈련 파이프라인을 만들었습니다. 이는 학생이 유치원에서 고등학교를 거쳐 박사 학위 논문을 준비하는 과정과 같습니다.

  1. 1 단계: 합성 놀이터 (유치원)
    아직 진짜 고대 책으로 학습할 수 없었기 때문에, 팀은 컴퓨터가 생성한 텍스트를 사용하여 거대한'가짜'도서관을 구축했습니다. 현대 네팔어 교과서를 가져와 11 가지 다른 폰트로 인쇄한 후, 고의로'훼손'했습니다. 디지털 노이즈를 추가하고, 줄을 흐리게 하며, 페이지를 구부려 200 년 동안 먼지 쌓인 다락방에 놓여 있던 것처럼 보이게 했습니다. 이를 통해 컴퓨터는 글자의 기본 모양을 학습할 100,000 개의 연습 예시를 얻었습니다.

  2. 2 단계: 인쇄된 다리 (고등학교)
    다음으로, 진짜이지만 인쇄된 데바나가리 텍스트로 이동했습니다. 이는 비디오 게임에서 실제 교실로 이동하는 것과 같습니다. 텍스트는 여전히 깨끗하고 명확하지만, 대학 아카이브에서 가져온 실제 데이터입니다. 이 단계는 컴퓨터가'가짜'지저분한 이미지와 실제 세계 사이의 간극을 메우는 데 도움을 주었습니다.

  3. 3 단계: 최종 시험 (대학)
    마지막으로, 그들은 컴퓨터에게 실제 보물을 공급했습니다: 155 개의 고대 필사본에서 가져온 3,100 줄의 실제 필기 고대 네팔어 텍스트입니다. 컴퓨터가 이미 첫 두 단계에서 잘 훈련되었기 때문에, 이제는 고대 필기의 독특한 특징, 먹물 번짐, 그리고 필사자들의 고유한 스타일에 집중할 수 있었습니다.

비밀 소스: 정제와 확장

연구자들은 컴퓨터 두뇌의 복잡성보다 데이터의 품질이 더 중요하다는 것을 깨달았습니다.

  • 레이블 정제: 필기가어떻게되어야 하는지 설명하는 디지털 노트에 작은 오류가 있음을 발견했습니다 (예: 같은 점 기호에 대해 서로 다른 두 가지 코드를 사용하는 경우). 그들은 컴퓨터가 자신의 교사에게 혼란을 느끼지 않도록 이러한 노트를'정제'했습니다.
  • 데이터 증강 (체육관): 컴퓨터를 더 강하게 만들기 위해, 기존 이미지를 디지털 방식으로'늘리고','뒤틀고','번지게'했습니다. 이는 역도 선수가 바벨에 추가 무게를 더하는 것과 같습니다. 컴퓨터가 동일한 페이지의 약간 다른 버전 수천 개로 연습하게 함으로써, 텍스트가 왜곡되어 있더라도 인식하는 법을 배웠습니다.

결과: 거의 완벽한 독서기

팀은 그들의 시스템을 다른 도구들 (구글의 표준 OCR 및 자체 모델의 기본 버전 등) 과 비교하여 테스트했습니다.

  • 점수: 그들의 최상위 모델은 문자의 **4.9%**에서만 실수를 했습니다. 즉, 1,000 개의 글자가 있는 페이지를 주면 약 951 개를 정확하게 인식한다는 뜻입니다.
  • 비교: 표준 도구는 종종 이 문자에서 흔한 복잡한 연결 문자 (연결자) 를 놓치며 완전히 실패했습니다. 그들의 맞춤형 모델은 훨씬 더 우수했습니다.

컴퓨터가 틀린 부분

95% 의 성공률에도 불구하고 컴퓨터는 완벽하지 않습니다. 연구자들은 오류를 분석한 결과, 그것들이 무작위가 아니라는 것을 발견했습니다.

  • 시각적 쌍둥이: 컴퓨터는 필기에서 매우 비슷하게 보이는 문자들 (예:'y'와'p') 을 자주 혼동했습니다. 이는 사람이 필기체'b'와'd'를 혼동하는 것과 같습니다.
  • 긴 싸움: 컴퓨터는 짧고 중간 길이의 문장에서는 훌륭했지만, 매우 긴 줄 (120 자 이상) 에서는 비틀거렸습니다. 텍스트가 너무 길어지면 컴퓨터가'지치거나'위치 감각을 잃는 것으로 보이며, 이는 훈련 중에 긴 예시를 충분히 보지 못했기 때문일 것입니다.

교훈

연구자들은 웹 앱을 구축했는데, 여기서 사용자는 고대 필사본의 사진을 업로드하면 자동으로 텍스트 줄을 찾아서 입력해 줍니다.

큰 교훈: 고대이고 지저분한 필기를 읽는 세계에서는 데이터가 왕입니다. 반드시 더 크고 복잡한 컴퓨터 두뇌가 필요한 것은 아닙니다. 더 나은 훈련 데이터, 더 깨끗한 레이블, 그리고'지저분한'예시들과의 많은 연습이 필요합니다. 훈련 과정을 신중하게 선별함으로써, 그들은 자원이 부족하고 어려운 언어를 컴퓨터가 높은 정확도로 읽을 수 있는 것으로 바꾸어, 네팔의 기록된 역사를 미래에 보존하는 데 기여했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →