← 최신 논문
💬 NLP

CzechDocs: A Multiway Parallel Dataset of Formatted Documents for Minority Languages in Czechia

이 논문은 문서 레이아웃을 보존할 수 있는 기계 번역 시스템을 평가하고 발전시키기 위해 설계된, 체코어 및 소수 언어로 된 서식화된 문서의 다방향 병렬 데이터셋인 CzechDocs를 소개한다.

원저자: Josef Jon, Ondřej Bojar

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Josef Jon, Ondřej Bojar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 아름답게 장식된 케이크가 하나 있다고 상상해 보세요. 케이크 자체는 당신이 번역하고자 하는 텍스트(즉, "맛")이고, 프로스팅(크림), 양초, 작은 깃발, 그리고 화려한 파이핑 장식은 포맷 태그(HTML 코드, 굵은 글씨, 또는 링크와 같은 것들)입니다.

오랫동안 컴퓨터가 이 케이크들을 번역하려고 시도할 때, 종종 케이크를 먹어 치우거나 장식은 무시한 채, 양초를 다시 어디에 놓아야 할지 추측하곤 했습니다. 때로는 양초를 크림 위에 놓기도 하고, 때로는 접시 위에 놓기도 했으며, 아예 양초를 잊어버리기도 했습니다. 이는 최종 결과물을 지저분하고 망가진 상태로 만들었습니다.

CzechDocs는 이 문제를 해결하기 위해 찰스 대학교(Charles University)의 연구원들이 만든 새로운 도구입니다. 다음은 그들이 무엇을 했고 무엇을 발견했는지에 대한 간단한 요약입니다.

1. 문제점: "긴급한 케이크"

연구진은 현실 세계의 필요성을 포착했습니다. 2022년 수천 명의 우크라이나 난민들이 체코 공화국에 도착했을 때, 정부 웹사이트, 법적 양식, 건강 가이드 등을 번역해야 하는 긴급한 수요가 발생했습니다. 이러한 문서들은 단순한 텍스트가 아닙니다. 버튼, 링크, 특정 레이아웃을 가진 복잡한 문서들입니다. 만약 번역이 레이아웃을 깨뜨린다면, 그 정보는 쓸모없어지거나 읽기 어려워집니다.

2. 해결책: 새로운 "케이크 팬" (데이터셋)

연구팀은 여러 언어로 동시에 존재하는 77개의 고유한 문서(정부 양식이나 교육 가이드 등)로 구성된 방대한 컬렉션을 구축했습니다.

  • 재료: 이들은 실제 체코 웹사이트에서 자료를 모았습니다.
  • 형식: 문서들은 세 가지 형태인 HTML(웹 페이지), DOCX(Word 파일), PDF(인쇄용 브로슈어)로 구성됩니다.
  • 언어: 주요 초점은 체코어와 우크라이나어이지만, 영어, 베트남어, 러시아어 등도 포함되었습니다.
  • 마법: 그들은 모든 체코어 문장이 다른 언어에서도 완벽하게 일치하는 문장을 갖도록, 즉 모든 양초와 크림 소용돌이가 모든 버전에서 완벽하게 정렬된 마스터 청사진을 갖도록 이 문서들을 정교하게 정제했습니다. 여기에는 정확히 동일한 포맷 태그가 포함됩니다.

3. 실험: 어떻게 케이크를 구울 것인가?

연구진은 이 데이터셋을 사용하여 현대적인 AI(대규모 언어 모델)를 이용해 이 "장식된 케이크"를 번역하는 두 가지 다른 방법을 테스트했습니다.

  • 방법 A: "벗겨내고 다시 만들기" (Detag-and-Project)
    케이크에서 모든 양초와 크림을 떼어내어, 제빵사에게 순수한 케이크만 주고 번역하게 한 뒤, 로봇 팔을 사용하여 이전 위치에 정확히 다시 붙이려고 시도한다고 상상해 보세요.

    • 결리: 이것은 전통적인 방식입니다. 어느 정도 작동하지만, 로봇 팔이 목표 지점을 놓칠 때가 있습니다.
  • 방법 B: "보여주고 말하기" (Direct Tagged Input)
    제빵사에게 전체 장식된 케이크를 건네주며 이렇게 말한다고 상상해 보세요. "케이크의 맛은 번역하되, 양초와 크림은 원래 있던 자리에 그대로 두세요."

    • 결과: 연구진은 AI가 이 전체를 보고 자연스럽게 수행할 수 있는지 테스트했습니다. 그들은 AI에게 장식에 주의하라는 특정 지시(프롬프트)를 내리면, 놀라울 정도로 잘 해낸다는 것을 발견했습니다.

4. 결과: 누가 최고의 케이크를 구웠는가?

연구진은 이 데이터셋을 사용하여 두 가지 다른 AI "제빵사"(OpenAI와 Cohere의 모델)를 테스트했습니다.

  • 판결: 두 방법 모두 잘 작동했지만, 각기 다른 강점이 있었습니다.
    • "벗겨내고 다시 만들기" 방식은 장식을 제자리에 놓는 데 매우 일관적이었지만, 때때로 텍스트 자체의 번역이 약간 덜 자연스러웠습니다.
    • "보여주고 말하기" 방식(AI의 자연스러운 능력 사용)은 매우 높은 품질의 텍스트 번역을 만들어냈습니다. 연구진이 AI에게 "태그를 유지하라"는 특정 지시를 내리자, AI는 나중에 고칠 로봇 팔 없이도 구조를 보존하며 훌륭하게 수행했습니다.
  • 놀라운 점: AI는 이를 위해 특별히 훈련될 필요가 없었습니다. 그저 명확하게 무엇을 해야 할지 알려주기만 하면 되었습니다.

5. 향란 계획

연구진은 다른 과학자들이 즉시 사용할 수 있도록 "정제된" 부분(검증 세트)을 공개했습니다. 또한, 서로 다른 팀들이 누가 이 장식된 문서들을 가장 잘 번역하는지 겨루는 미래의 경연 대회를 위해 "비밀 테스트 세트"(최종 시험)를 남겨두고 있습니다.

요약하자면: 그들은 컴퓨터가 포맷을 깨뜨리지 않고 텍스트를 번역하는 법을 배울 수 있도록 고품질의 실제 다국어 문서 라이브러리를 구축했습니다. 그들은 현대의 AI가 장식을 온전히 유지하라고 친절하게 요청하기만 하면 이 작업에 매우 능숙하다는 것을 발견했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →