← 최신 논문
💻 computer science

TRIDIS: A Comprehensive Medieval and Early Modern Corpus for Handwritten Text Recognition and Named Entity Recognition

이 논문은 중세 및 근세 필사본의 필기체 텍스트 인식(HTR)과 개체명 인식(NER)을 지원하기 위해 설계된 개방형 조화 코퍼스인 TRIDIS를 소개하는 동시에, 유산 문서 벤치마킹에서 기존의 무작위 분할이 갖는 한계를 해결하기 위한 혁신적인 이상치 기반 평가 전략을 제안한다.

원저자: Sergio Torres Aguilar

게시일 2026-06-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sergio Torres Aguilar

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 중세와 르네상스 시대의 수천 권에 달하는 손으로 쓴 편지, 법적 계약서, 그리고 왕실 칙령들이 담긴, 먼지 쌓인 거대한 도서관이 있다고 상상해 보세요. 이 문서들은 라틴어, 프랑스어, 독일어와 같은 다양한 언어로 작성되었으며, 각기 다른 필사가들의 매우 다양한 필체로 쓰여 있고, 심지어 얼룩이 졌거나 찢어진 것도 있습니다.

TRIDIS는 이 문서들을 모아놓은 새로운, 매우 체계적인 디지털 컬렉션의 이름입니다. 이것을 컴퓨터를 위한 "범용 번역가 훈련 체육관"이라고 생각하세요. 목표는 컴퓨터가 이 오래되고 엉망인 손글씨를 정확하게 읽는 법을 가르치는 것입니다.

다음은 이 논문의 내용을 쉬운 비유를 사용하여 설명한 것입니다:

1. 문제점: "너무 쉬운" 테스트

오랫동안 연구자들은 컴퓨터에게 오래된 손글씨를 읽는 법을 가르치려 할 때 한 가지 문제를 겪어왔습니다. 그들은 컴퓨터를 훈련시키기 위해 여러 문서들을 사용하고, 그 후 무작위로 선택된 몇 개의 다른 문서들로 테스트를 진행했습니다.

비유: 어떤 학생이 수학 시험 공부를 하고 있다고 상상해 보세요. 학생은 1장에서 쉬운 문제들을 가지고 연습합니다. 선생님이 1장에서 무작위로 시험 문제를 뽑으면, 학생은 A를 받습니다. 하지만 현실 세계에서 시험은 5장에 있는, 연습했던 것과는 전혀 다르게 생긴 까다로운 문제가 나올 수도 있습니다. 무작위 테스트는 학생이 실제보다 더 똑똑해 보이게 만드는 잘못된 안도감을 줍니다.

고문서의 세계에서 이는 컴퓨터가 단순히 훈련 중에 본 특정 필체를 암기하는 것이 아니라, '어떤' 스타일도 처리할 수 있는 법을 배우는 것이 아니라, 단지 그 스타일을 외우고 있을 뿐이기 때문에 실제보다 더 똑라 보이게 만든다는 것을 의미합니다.

2. 해결책: "아웃라이어(Outlier)" 챌린지

저자인 세르히오 토레스 아길라르(Sergio Torres Aguilar)는 이를 해결하기 위해 TRIDIS를 만들었습니다. 하지만 진짜 혁신은 단순히 문서 컬렉션을 만든 것이 아니라, 컴퓨터를 테스트하는 방식에 있습니다.

무작위로 테스트 질문을 뽑는 대신, 그들은 **"아웃라이어 기반 분할(Outlier-Based Splitting)"**이라는 전략을 사용합니다.

비유: 당신이 개에게 물건을 가져오도록 훈련시킨다고 상상해 보세요.

  • 무작위 테스트: 당신은 뒷마당에 공을 던집니다. 개가 공을 잡습니다.
  • 아웃라이어 테스트: 당신은 원반, 막대기, 삑삑 소리가 나는 장난감, 그리고 진흙 묻은 돌을 던집니다. 또한 비가 오는 날, 어두운 곳에서, 혹은 이상한 각도로 던지기도 합니다.

"아웃라이어" 전략은 모든 손으로 쓴 문장들을 살펴보고 가장 이상하거나, 손상되었거나, 특이한 것들을 찾아냅니다. 여기에는 다음과 같은 것들이 포함될 수 있습니다:

  • 매우 특이한 필체.
  • 거의 보이지 않는 단어들 (흐릿한 잉크).
  • 믿기 힘들 정도로 길거나 기이한 레이아웃을 가진 문장들.
  • 매우 희귀한 이름이나 단어들.

이러한 "이상한" 문장들은 따로 분류되어 **테스트 세트(Test Set)**가 됩니다. 컴퓨터는 "정상적인" 것들로 훈련되지만, 오직 이 "이상한" 것들을 얼마나 잘 처리하는지에 따라 성적이 매겨집니다. 이는 컴퓨터가 실제로 얼마나 똑똑한지에 대한 훨씬 더 정직한 점수를 제공합니다.

3. 상자 안에 무엇이 들어있나? (코퍼스)

TRIDIS는 다양한 역사적 컬렉션에서 가져온 거의 20만 줄의 텍스트를 담고 있는 거대한 도구 상자입니다.

  • 시간 여행: 1100년대부터 1700년대에 이르는 문서들을 다룹니다.
  • 언어: 라틴어, 고대 프랑스어, 중세 고지 독일어, 스페인어를 포함합니다.
  • 스타일: 깔끔하고 각진 글씨부터 엉망이고 흘려 쓴 필체까지 다양한 유형의 손글씨를 포함합니다.
  • 정제: 텍스트는 인간 편집자들에 의해 "정제"되었습니다. 그들은 약어(예: "dms"를 "dominus"로 확장)를 확장하고 구두점을 수정하여 컴퓨터가 의미를 더 잘 이해할 수 있도록 했습니다.

4. 결과: "좋음"과 "훌륭함" 사이의 간극

저자는 이 새로운 방법을 사용하여 두 가지 인기 있는 컴퓨터 모델(TrOCR 및 MiniCPM)을 테스트했습니다.

  • 무작위 테스트: 무작위 문장으로 테스트했을 때, 컴퓨터들은 꽤 잘 해냈습니다 (오차율 약 9%). 이는 학생이 쉬운 1장 테스트에서 A를 받는 것과 같습니다.
  • 아웃라이어 테스트: "이상한" 문장들로 테스트했을 때, 오차율이 눈에 띄게 높아졌습니다 (최대 12~13%).

시사점: 이 간극은 현재의 컴퓨터들이 우리가 생각했던 것만큼 견고하지 않다는 것을 증명합니다. 컴퓨터는 오래된 문서의 지저치고 예측 불가능한 현실을 마주할 때 어려움을 겪습니다. 이 "아웃라이어" 테스트를 사용함으로써, 연구자들은 이제 컴퓨터가 정확히 어디에서 실패하는지 알 수 있으며, 다음에 무엇을 배워야 하는지 알 수 있습니다.

요약

TRIDIS는 컴퓨터가 역사를 읽는 법을 배우도록 설계된, 오래된 손글씨 문서들의 거대한 오픈 라이브러리입니다. 이의 가장 중요한 특징은 새로운 테스트 방식입니다. 컴퓨터에게 쉽고 무작위적인 퀴즈를 주는 대신, 가장 어렵고 특이한 사례들을 던져주는 것입니다. 이를 통해 우리가 컴퓨터가 고문서를 읽을 수 있다고 말할 때, 그것이 단지 완벽한 예시들뿐만 아니라 실제의 복잡하고 엉망인 역사의 세계를 실제로 감당할 수 있는지 확인할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →