← 최신 논문
💬 NLP

Bundesrecht: An Open Library and Corpus for German Statutory Reference Processing

이 논문은 가공되지 않은 인용 문자열로부터 특정 법률 조항에 이르기까지 독일 법령 참조를 파싱, 정규화 및 해결하기 위한 최초의 엔드 투 엔드 파이프라인을 제공하는 오픈 소스 파이썬 라이브러리이자 구조화된 코퍼스인 **bundesrecht**를 소개한다.

원저자: Harshil Darji, Martin Heckelmann, Christina Kratsch, Gerard de Melo

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Harshil Darji, Martin Heckelmann, Christina Kratsch, Gerard de Melo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 독일 법률 문서를 읽고 있다고 상상해 보십시오. 당신은 다음과 같은 문장을 마주하게 됩니다: "See § 312 i.V.m. § 355 BGB."

인간 변호사에게 이것은 명확한 지침입니다: "민법(BGB) 제312조를 보고, 제355조도 함께 보시오." 하지만 컴퓨터에게 이것은 기호, 약어, 그리고 숨겨진 연결 고리들이 뒤섞인 엉망진창인 데이터로 보입니다. 컴퓨터는 "i.V.m."이 "conjunction with(결합하여)"를 의미한다는 것도, 두 번째 조항이 첫 번째 조항과 동일한 법률에 속해 있다는 것도 알지 못합니다.

이 논문은 독일 법률의 궁극적인 번역가이자 사서가 되기 위해 설계된 새로운 오픈 소스 툴킷인 **bundesrecht**를 소개합니다. 이 툴킷은 컴퓨터가 인간 전문가처럼 독일 법령의 특정 부분을 이해하고, 정리하고, 찾아낼 수 있도록 돕습니다.

이것이 어떻게 작동하는지, 도서관 비유를 사용하여 세 가지 간단한 단계로 설명하겠습니다.

1. 사서 (파서, The Parser)

어떤 책들은 표지에 서로 다른 필체로 낙서가 되어 있는 엉망진창인 책 더미를 상상해 보십시오. 어떤 것은 "책 A, 제1장"이라고 적혀 있고, 다른 것은 "A-1" 또는 "책 A, 제1장, 제2절"이라고 적혀 있습니다.

**파서(Parser)**는 낙서된 메모(원문 인용 문자열)를 집어 들고 그것이 정확히 무엇을 의미하는지 파악하는 사서입니다. 파서는 메모를 다음과 같이 구성 요소별로 분해합니다:

  • 어떤 법인가? (예: BGB, 민법)
  • 몇 조인가? (예: § 312)
  • 어느 항/호인가? (예: 제2항 제1호)

파서는 혼란스러운 텍스트 문자열을 "법률: BGB, 조: 312, 항: 2, 호: 1"이라고 적힌 깔끔하고 구조화된 카드 형태로 변환합니다.

2. 표준화 도구 (노멀라이저, The Standardizer)

이제 같은 도서관을 상상해 보되, 책들이 매우 다양한 스타일로 쓰여 있다고 가정해 봅시다. 어떤 책은 "제12조부터 15조까지"라고 적혀 있고, 다른 책은 "§§ 12–15"라고 되어 있으며, 또 다른 책은 "12, 13, 14, 그리고 15조를 보시오"라고 되어 있습니다. 컴퓨터는 이들이 모두 같은 것을 의미한다는 것을 쉽게 알 수 없습니다.

**노멀라이저(Normalizer)**는 이 모든 다양한 스타일을 하나의 표준화된 "정형(canonical)" 형식으로 다시 쓰는 편집자입니다.

  • 만약 당신이 "제12조부터 15조까지"라고 말한다면, 노멀라이저는 이를 네 개의 별개이고 명확한 지침으로 나눕니다: "12를 보시오", "13을 보시오", "14를 보시오", "15를 보시오".
  • 만약 당신이 "제312조와 그 다음 조"(약어 f. 사용)라고 말한다면, 이는 "제312조 및 제313조"로 확장됩니다.

이를 통해 원문 문서에 법이 어떻게 기록되었든 상관없이, 컴퓨터가 정확히 어느 부분을 확인해야 하는지에 대한 깔끔하고 일관된 목록을 얻을 수 있게 합니다.

3. 탐색기 (리졸버, The Resolver)

마지막으로, 모든 독일 법률의 전체 텍스트가 가장 작은 하위 조항(예: 특정 글자나 숫자 단위)까지 체계적으로 정리된 거대한 디지털 도서관이 있다고 상상해 보십시오.

**리졸버(Resolver)**는 당신의 깔끔하게 표준화된 목록을 가지고 도서관으로 가서 실제 텍스트를 가져옵니다.

  • 만약 당신이 "제312조 제2항 제7호"를 요청한다면, 리졸버는 단순히 해당 조항 전체를 주는 것이 아니라, 깊숙이 파고들어 오직 그 특정 항목만을 건네줍니다.
  • 만약 해당 항목이 정확히 존재하지 않는다면(예: 법이 제5호까지만 있는 경우), 리졸버는 똑똑하게도 "제7호를 찾을 수 없었지만, 제가 가진 가장 가까운 매칭 결과는 이것이며, 저는 제5호에서 멈췄음을 알려드립니다"라고 말할 수 있습니다.

이것이 왜 중요한가요?

이 도구가 나오기 전까지, 컴퓨터는 다음 중 하나만 할 수 있었습니다:

  1. 인용문을 텍스트에서 찾을 수는 있지만 그 구조를 이해하지 못함.
  2. 완벽하게 미리 형식이 갖춰진 주소를 제공했을 때만 법을 찾아냄.

하지만 컴퓨터는 법률가들이 사용하는 실제 방식(약어, 범위 지정, 결합 참조 등)의 복잡하고 무질서한 인용을 처리할 수 없었습니다. **bundesrecht**는 이 모든 과정을 수행하는 최초의 오픈 도구입니다. 즉, 지저로 된 인용을 가져와서, 이를 정제하고, 분해한 다음, 법률 내의 정확한 텍스트를 찾아냅니다.

얼마나 잘 작동하나요?

저자들은 이 도구를 거의 3,000개의 실제 법률 인용문에 대해 테스트했습니다.

  • 정확도: 대부분의 법률 부분에 대해 구조를 98% 이상의 높은 확률로 정확하게 파악했습니다.
  • 그룹화: 단순한 텍스트 검색을 수행하는 것보다 "§ 12–15"와 "§ 12, 13, 14, 15"가 동일한 것임을 인식하는 데 훨씬 뛰어난 성능을 보였습니다.

요약하자면, **bundesrecht**는 컴퓨터에게 안경과 지도를 쥐여주어, 인간 변호사가 하는 것처럼 밀도가 높고 복잡한 독일 성문법의 숲을 헤쳐 나갈 수 있게 해주는 것과 같습니다. 이 도구는 현재 누구나 바로 사용할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →