← 최신 논문
💬 NLP

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

이 논문은 시각 언어 모델(Vision Language Models)과 대규모 언어 모델(Large Language Models)을 활용하여 다국어 사전을 기계 판독 가능한 형식으로 효과적으로 디지털화하는 2단계 프레임워크인 MUDIDI를 소개하며, 새로운 주석 데이터셋과 복잡한 스크립트 및 레이아웃을 처리하는 데 있어 LLM의 우수한 성능을 입증하는 벤치마크를 함께 제시한다.

원저자: David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수백 개의 서로 다른 언어로 쓰인, 오래되고 먼지 쌓인 사전들이 가득한 거대한 도서관을 상상해 보세요. 어떤 사전들은 영어로 되어 있지만, 많은 사전은 고대 룬 문자나 복잡한 캘리그래피처럼 보이는 독특한 문자를 가진 희귀하고 멸종 위기에 처한 언어들로 쓰여 있습니다. 이 책들은 언어학자들과 그 언어를 사용하는 공동체에게는 보물과도 같지만, 지금은 그저 '스캔 모드'에 갇혀 있습니다. 그저 페이지의 사진일 뿐이죠. 당신은 이 책들을 검색하거나, 단어 수를 세거나, 언어를 가르치거나 번역 앱을 만들기 위해 쉽게 활용할 수 없습니다.

문제는 이 사전들이 매우 지저진하다는 점입니다. 이상한 레이아웃, 아주 작은 약어, 그리고 일반적인 컴퓨터 스캐너(영수증을 스캔할 때 쓰는 것 같은)를 완전히 혼란스럽게 만드는 기호들이 있습니다.

이 논문의 저자들인 MUDIDI는 이를 해결하기 위해 새로운 '디지털 번역기'를 구축했습니다. 이것은 사전 페이지의 사진을 깨끗하고 정리된 디지털 데이터베이스로 바꾸는 2단계 조립 라인이라고 생각하면 됩니다.

2단계 조립 라인

1단계: "슈퍼 스캐너" (페이지 읽기)
매우 세심한 사서가 혼란스러운 텍스트 페이지를 보고, 굵은 글씨, 이탤릭체, 열의 순서를 그대로 유지하며 정확하게 타이핑하는 모습을 상상해 보세요.

  • 과제: 일반적인 스캐너는 글자를 놓치거나 열의 순서를 뒤섞곤 합니다.
  • 해결책: 저자들은 다양한 "AI 사서"(구체적으로는 거대 언어 모델과 시각 언어 모델)를 테스트했습니다. 그들은 가장 똑똑한 AI 모델(Gemini와 같은)이 초인적인 능력을 가진 사서와 같다는 것을 발견했습니다. 이 모델들은 복잡한 스크립트(고대 쐐기문이나 아랍어 기반 스크립트 등)를 읽어낼 수 있으며, 서식을 완벽하게 유지하는 능력이 기존의 전통적인 스캐닝 소프트웨어보다 훨씬 뛰어납니다.
  • 비결: 때때로 AI에게 "치트 시트"(해당 언어에 유효한 글자 목록)를 제공하면 더 잘 읽을 수 있지만, 항상 그런 것은 아닙니다. 때로는 그냥 AI가 사진을 보는 것만으로도 충분합니다.

2단계: "정리 전문가" (항목 분류)
텍스트를 타이핑하고 나면, 그것은 여전히 단어의 벽에 불과합니다. 이제 이를 깔끔한 작은 상자들로 분류해야 합니다. 사전 항목은 단순히 단어 하나가 아닙니다. 정의, 품사(명사/동사), 예시, 그리고 교차 참조를 포함합니다.

  • 과제: AI는 텍의 벽을 보고 "좋아, 이 굵은 글씨는 **표제어(Headword)**이고, 이 이탤릭체 부분은 **예시(Example)**이며, 이 기호는 **교차 참조(Cross-reference)**를 의미하는구나"라고 말할 수 있어야 합니다.
  • 해결책: AI에게 특정 규칙집(MDF 스키마라고 불리는, 사전의 표준 파일링 시스템과 같은 것)이 주어집니다. AI는 텍스트를 개별 항목으로 자르고 모든 정보에 올바르게 태그를 붙이는 법을 배웁니다.
  • 강화 요소: 저자들은 AI에게 사전의 서문 페이지(책이 어떻게 구성되어 있는지 설명하는 페이지)를 규칙집과 함께 제공했을 때, AI가 데이터를 분류하는 능력이 훨씬 좋아진다는 것을 발견했습니다. 이는 마치 신입 사원에게 파일을 정리하라고 시키기 전에 직원 핸드북을 먼저 주는 것과 같습니다.

그들이 발견한 것

  1. 스마트한 AI가 오래된 스캐너를 이깁니다: 새로운 "범용" AI 모델들은 우리가 수십 년 동안 사용해 온 특수 스캐닝 소프트웨어보다 이러한 까다로운 사전들을 훨씬 더 잘 읽습니다. 이 모델들은 이상한 폰트와 레이아웃을 쉽게 처리합니다.
  2. 맥락이 핵심입니다: 만약 AI가 사전 항목을 올바르게 분류하기를 원한다면, 반드시 "맥락"을 제공해야 합니다. AI에게 사전의 서문 페이지를 보여주는 것은 해당 책의 규칙을 이해하도록 도와주며, 이는 오류를 훨씬 줄여줍니다.
  3. 어려운 작업에도 작동합니다: 이 시스템은 그리스어나 일본어 같은 흔한 언어부터 추크치어나 시리아어 같은 멸종 위기 언어에 이르기까지 매우 다양한 언어에서 작동합니다.

결과: 디지털 보물 상자

저자들은 단순히 도구를 만든 것이 아니라, 하나의 테스트 키트도 만들었습니다. 그들은 30개의 서로 다른 사전을 모았고, 인간 전문가들이 작업을 검토하게 했으며, 시스템이 작동함을 증명하기 위한 데이터셋을 구축했습니다.

요약하자면: 그들은 먼지 쌓인 복잡한 사전 페이지의 사진을 찍어 깨끗하고 검색 가능하며 기계가 읽을 수 있는 파일로 바꾸는 방법을 만들어냈습니다. 이를 통해 공동체와 연구자들은 마침내 오래된 책 속에 갇혀 있던 지식을 해방시켜, 사라질 수도 있는 언어들을 보존할 수 있게 되었습니다.

주의 사항: AI가 놀랍기는 하지만, 완벽하지는 않습니다. 매우 희귀한 스크립트나 극도로 지저분한 레이아웃의 경우, 여전히 인간 전문가의 검수가 필요합니다. 하지만 이 새로운 방식은 인간의 업무를 이전보다 훨씬 빠르고 쉽게 만들어 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →