← 최신 논문
💬 NLP

Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models

이 논문은 사전 학습된 LLM의 지식과 명시적으로 검색된 외부 문맥을 결합함으로써 역사적 문헌, 특히 고유 명사의 복원을 크게 향상시키는 검색 증강 대규모 언어 모델 프레임워크인 ARI를 소개한다.

원저자: Gabeen Kim, Kyeongpil Kang

게시일 2026-07-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gabeen Kim, Kyeongpil Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수수께끼를 풀려는 탐정이라고 상상해 보십시오. 하지만 당신이 가진 유일한 단서는 400년 전 쓰인, 찢어지고 물에 젖은 일기장 한 페이지뿐입니다. 잉크는 희미해졌고, 종이는 찢어졌으며, 텍스트의 거대한 부분들이 사라진 채 빈 칸으로 남아 있습니다. 이것이 고대 문헌을 읽으려는 역사학자들이 마주하는 일상적인 현실입니다. 수 세기 동안 이러한 기록들은 과거를 이해할 수 있는 유일한 방법이었지만, 시간과 습기, 그리고 서투른 필사가 이들을 거의 읽을 수 없는 상태로 만들어 버렸습니다. 이를 해결하기 위해, 과학자들은 컴퓨터가 초지능적인 추측가처럼 행동하도록 가르치고 있습니다. 그들은 "마스크 언어 모델링(Masked Language Modeling)"이라는 기술을 사용하는데, 이는 마치 고액의 판돈이 걸린 "빈칸 채우기" 게임을 하는 것과 같습니다. 컴퓨터는 사라진 부분 주변의 단어들을 살펴보고, 바로 앞뒤 문맥을 바탕으로 어떤 단어가 가장 잘 어울릴지 추측합니다.

하지만 여기에는 함정이 있습니다. 때때로 사라진 단어는 단순히 "달렸다"나 "먹었다"와 같은 흔한 동사가 아닐 수도 있습니다. 그것은 특정 인물의 이름, 희귀한 지명, 혹은 문장 자체만 읽어서는 알 수 없고 세상의 전체 역사를 알아야만 이해할 수 있는 칭호일 수도 있습니다. 오직 눈앞의 문장만을 보고 추측하는 컴퓨터는 "왕"이라고 추측할 수도 있지만, 실제 정답은 "세종대왕"일 수 있습니다. 왜냐하면 컴퓨터의 머릿속에는 전체 백과사전이 들어있지 않기 때문입니다. 여기서 논문은 아주 단순하지만 강력한 질문을 던집니다. 만약 우리의 탐정이 찢어진 페이지를 뚫어지게 쳐다보는 것에 그치지 않고, 정답을 찾아보기 위해 바로 옆에 거대한 도서관을 두고 있다면 어떻게 될까요?

조선왕조실록과 같은 한국의 역사 기록물을 활용하여 연구를 진행한 연구진은 ARI(Archive Restoration Intelligence, 기록물 복원 지능)라는 새로운 종류의 탐정 도구를 만들기로 했습니다. 그들은 표준적인 컴퓨터 모델들이 흔한 단어들을 추측하는 데는 뛰어나지만, "외부 지식"이 부족하기 때문에 특정 이름이나 장소를 복원할 때는 자주 실수한다는 점을 깨달았습니다. 이를 해결하기 위해 연구팀은 두 가지 강력한 아이디어를 결합했습니다. 바로 **거대 언어 모델(LLM)**과 **검색 증강 생성(RAG)**입니다. LLM은 인터넷상의 거의 모든 것을 읽었으며 내재화된 깊은 역사적 감각을 가진 AI 시스템입니다. 그리고 RAG는 AI에게 "컨닝 페이퍼"나 검색 엔진을 주는 것과 같습니다. 단순히 기억에 의존해 추측하는 대신, AI는 방대한 데이터베이스를 검색하여 유사한 문장들을 찾아내고 이를 단서로 사용할 수 있게 됩니다.

연구팀은 이 아이디어를 수천 권의 손상된 한국 문헌에 테스트했습니다. 그들은 단순히 AI가 더 많이 "생각"하게 하거나 내부 기억을 사용하는 것만으로는 까다로운 부분을 해결하기에 충분하지 않다는 것을 발견했습니다. 하지만 AI가 관련 역사 기록을 검색할 수 있는 능력(검색)을 부여하고, 이 특정 작업에 맞게 미세 조정(fine-tuning)했을 때 결과는 매우 인상적이었습니다. 우리의 새로운 모델인 ARI는 기존의 방식들을 크게 능가했으며, 특히 인물의 이름, 장소, 날짜와 같은 '개체명(named entities)'을 복원하는 어려운 부분에서 탁월한 성능을 보였습니다. 실제로 인간 전문가들이 결과를 테스트했을 때, 그들은 다른 최상위 모델들보다 ARI의 제안을 더 선호하며 ARI가 과거를 해독하는 데 훨씬 더 신뢰할 수 있는 파트너라고 평가했습니다.

또한 이 연구는 AI가 해당 시대의 "맥락"(예를 들어, 당시 어떤 왕이 재위 중이었는지 등)을 파악할 수 있을 때 가장 잘 작동하며, 손상된 문서와 매우 유사한 문헌들을 찾을 수 있을 때 효과적이라는 점을 보여주었습니다. 그러나 연구진은 AI의 학습 데이터와 복원하려는 문서 사이의 시간 간격이 너무 넓어질 경우(예: 12세기 문서를 고치기 위해 18세기 서적을 사용하는 경우), 정확도가 다소 떨어진다는 점을 언급했습니다. 이는 이 도구가 강력하기는 하지만, 여전히 적절한 역사적 시대와 정교하게 맞추어져야 함을 시사합니다. 궁극적으로 이 논문은 AI의 지적 능력과 디지털 도서관을 결합함으로써, 우리가 마침내 읽을 수 없는 것을 읽고 빈 칸을 역사의 생생한 이야기로 되돌릴 수 있다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →