← 최신 논문
💻 computer science

NormDef-FR: an annotated corpus of normative definitions for the automatic processing of French legal codes

이 논문은 지식 추출, 정보 검색, 검색 증강 생성과 같은 자동화된 법률 NLP 작업을 가능하게 하고 벤치마킹하기 위해 설계된, 693개의 프랑스어 규범적 정의를 포함하는 고품질 오픈 소스 주석 코퍼스인 NormDef-FR을 소개한다.

원저자: Aboudourazakou Tetereou, Tarik Boudaa, Dadi El Wardani

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Aboudourazakou Tetereou, Tarik Boudaa, Dadi El Wardani

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

법은 흔히 규칙의 거대한 도서관으로 상상되곤 하지만, 컴퓨터에게 그것은 텍스트의 혼란스러운 바다와 같습니다. 프랑스에서 법 체계는 코드(codes), 즉 모든 단어가 특정한 무게를 지니는 법률의 방대한 집합체 위에 구축되어 있습니다. 이 수천 페이지의 문서 안에서 입법자들은 종종 자신들의 용어를 정의하기 위해 멈춰 섭니다. 그들은 "개인 데이터란 식별된 개인과 관련된 모든 정보를 의미한다"라거나, "이 조항의 목적을 위해, 차량에는 자전거가 포함된다"라고 적을 수 있습니다. 이것들은 단순히 도움이 되는 설명이 아닙니다. 이것들은 권리와 의무가 어떻게 작동하는지를 결정하는 법적 엔진입니다. 이러한 정밀한 정의가 없다면 나머지 법은 올바르게 기능할 수 없습니다. 그러나 이러한 정의를 찾는 것은 어렵습니다. 왜냐하면 그것들이 보건에서 조세에 이르기까지 다양한 코드에 흩어져 있는 161,000개 이상의 활성 조문 속에 파묻혀 있으며, 검색을 안내할 조직적인 지도가 없기 때문입니다.

이러한 구조의 부재는 기술에 중대한 문제를 야기합니다. 만약 변호사나 디지털 시스템이 법의 관점에서 특정 용어가 정확히 무엇을 의미하는지 알고 싶다면, 그들은 모든 사례를 모두 찾았다는 보장 없이 수많은 페이지를 수동으로 읽어야 할 때가 많습니다. 기계가 인간의 언어를 이해하도록 가르치는 컴퓨터 과학 분야인 자연어 처리(NLP)는 법률 텍스트를 분석하는 데 있어 큰 발전을 이루었지만, 이 특정 작업에서는 어려움을 겪어 왔습니다. 기존의 대부분의 도구들은 영어 혹은 일반 사전에서 발견되는 일반적인 정의를 위해 설계되었으며, 프랑스 법령에서 발견되는 엄격하고 구속력 있는 정의를 위해서는 설계되지 않았습니다. 이 간극을 메우기 위해 연구자들은 NormDef-FR이라 불리는 새로운 리소스를 만들었습니다. 이는 컴퓨터가 법적 정의를 자동으로 찾아내고 이해할 수 있도록 가르치기 위해 정교하게 큐레이션된 법적 정의 모음집입니다.

모로코의 압델말렉 에사디 대학교(Abdelmalek Essaadi University)에서 연구하는 연구진은 인간의 전문 지식과 기계의 자동화 사이에 다리를 놓는 방식으로 이 문제에 접근했습니다. 그들은 공식 프랑스 법률 데이터베이스로부터 현재 활성화된 법률들을 수집하는 것으로 시작했습니다. 도서관 전체를 한꺼번에 읽도록 컴퓨터를 가르치려 하는 대신, 그들은 먼저 단순한 규칙 기반 패턴을 사용하여 가능성이 높은 후보들을 포착했습니다. 그들은 "정의된다" 또는 "~로 간주된다"와 같이 정의를 도입하는 데 사용되는 프랑스 법률의 특정 문구나, 용어와 그 의미를 구분하기 위해 콜론(:)을 사용하는 방식 등을 살펴보았습니다. 이 초기 탐색 작업은 잠재적인 정의 목록을 생성했지만, 결코 완벽하지는 않았습니다. 많은 후보가 실제로는 정의가 아니라 제출해야 할 서류 목록이나 법적 효과에 대한 설명과 같은 다른 것들인 '가짜 경보'였습니다.

이 거친 목록을 신뢰할 수 있는 훈련 도구로 바꾸기 위해, 팀은 인간 전문가들을 투입했습니다. 그들은 수천 개의 후보를 수동으로 검토하며, 어떤 것이 진정으로 사용 가능한 법적 정의이고 어떤 것을 폐기해야 하는지를 결정했습니다. 또한 그들은 텍스트의 경계를 수정하여, 정의되는 '용어'와 '정의' 자체가 정확하게 잘려 나갔는지 확인했습니다. 이 과정은 매우 엄격했습니다. 연구진은 데이터 샘ло플에 대해 두 명의 독립적인 전문가가 라벨링을 수행하게 하여, 무엇이 정의로 간주되는지에 대해 서로 동의하는지 확인했습니다. 그 결과 높은 수준의 일치도가 나타났으며, 이는 정의를 식별하기 위한 규칙이 명확하고 일관됨을 확인시켜 주었습니다. 최종 결과물인 NormDef-FR 버전 1.0.0은 50개의 서로 다른 법전 내 363개의 서로 다른 조문에서 추출된 693개의 검증된 정의를 포함하고 있습니다. 각 항목은 정의된 용어를 그 의미와 연결하고, 출처에 대한 메타데이터를 포함하며, 해당 정의의 유형을 명시합니다.

이러한 골드 스탠다드(gold-standard) 컬렉션을 손에 넣은 후, 연구진은 컴퓨터가 이를 통해 얼마나 잘 학습할 수 있는지 테스트했습니다. 그들은 기계가 어디에서 성공하고 어디에서 비틀거리는지 확인하기 위해 세 가지 서로 다른 과제를 설정했습니다. 첫 번째 과제는 단순한 추출이었습니다. 시스템이 정의를 포착하고 용어와 의미를 뽑아낼 수 있는가 하는 것이었습니다. 두 번째 과제는 더 넓은 범위였습니다. 시스템이 전체 조문을 보고 정의를 포함하고 있는지 여부를 결정할 수 있는가 하는 것이었습니다. 세 번째 과제는 가장 어려운 것이었습니다. 시스템이 컴퓨터에 의해 생성된 후보 정의를 보고, 그것이 유지하기에 충분히 좋은 것인지 아니 아니면 버려야 할 실수인지를 결정할 수 있는가 하는 것이었습니다.

결과는 명확한 난이도의 계층 구조를 드러냈습니다. 기계들은 두 번째 과제에서 놀라울 정도로 뛰어난 성능을 보였습니다. 정의를 포함하는 조문을 식별하라는 요청을 받았을 때, 모델들은 특히 정의가 전혀 포함되어 있지 않음을 수동으로 확인한 '진성 부정(true negatives)' 세트로 훈련되었을 때 완벽에 가까운 정확도를 보였습니다. 이 발견은 매우 중요했는데, 왜냐하면 정의 목록에 없는 조문은 모두 '부정'이라고 가정했던 초기 방식이 결함이 있었음을 보여주었기 때문입니다. 즉, 많은 조문에 숨겨진 정의가 들어있었습니다. 연구진이 부정적인 예시들을 정리하자, 컴퓨터는 정의가 많은 조문과 일반적인 조문을 쉽게 구별할 수 있었습니다.

그러나 세 번째 과제는 실질적인 병목 구간임이 드러났습니다. 컴퓨터가 특정 용어-정의 쌍을 검증해야 했을 때, 성능이 현저히 떨어졌습니다. 시스템은 정의가 있을 법한 일반적인 영역은 쉽게 찾아냈지만, 자신이 뽑아낸 특정 쌍이 법적으로 유효한지를 판단하는 데는 어려움을 겪었습니다. 그들은 요구 사항의 목록이나 절차적 지침을 정의로 오해하곤 했습니다. 가장 우수한 모델들도 이 어려운 결정들을 약 71퍼센트 정도만 맞혔는데, 이는 조문 탐지 과제에서 보여준 완벽에 가까운 점수와는 큰 차이가 있었습니다. 이는 컴퓨터가 올바른 동네는 찾을 수 있을지언정, 정확한 집을 검증하기 위해서는 여전히 인간의 도움이 필요함을 시사합니다.

또한 이 연구는 이 특정 맥락에서의 고도화된 인공지능의 놀라운 한계를 강조했습니다. 연구진은 일반적인 대화를 위해 사용되는 것과 유사한 정교한 언어 모델을 단순한 단어 패턴 기반의 전통적인 방법과 비교 테스트했습니다. 후보를 검증하는 어려운 과제의 경우, 복잡한 모델은 더 단순한 모델보다 뛰어난 성능을 보이지 못했습니다. 사실, 더 단순한 방법이 더 안정적이고 신뢰할 수 있었습니다. 이는 규칙이 엄격하고 패턴이 특정한 고도로 전문화된 법률 텍스트의 경우, 텍스트를 일반적인 의미에서 "이해"하려고 노력하는 복잡한 시스템보다 명확한 언어적 표식에 의존하는 직설적인 접근 방식이 더 효과적일 수 있음을 나타냅니다.

NormDef-FR의 제작은 단순한 데이터셋 그 이상입니다. 이는 법률 기술을 위한 신뢰할 수 있는 리소스를 구축하는 방법에 대한 시연입니다. 연구진은 단순히 데이터의 부재를 가정하는 것만으로는 부족하며, 존재하지 않는 것을 능동적으로 검증해야 한다는 점을 보여주었습니다. 부정적인 예시들을 수동으로 확인함으로써, 그들은 시스템이 잘못된 교훈을 배우는 것을 방지했습니다. 이러한 접근 방식은 리소스가 견고하고 신뢰할 수 있도록 보장합니다. 이 데이터셋은 문서화와 재현을 위한 스크립트와 함께 공개되어 있습니다. 이는 법률 연구를 위한 더 나은 도구를 구축하기 위한 토대로서 기능하며, 변호사와 시스템이 의미를 찾는 데 시간을 허비하는 대신 법을 해석하는 데 집중할 수 있도록 법적 정의를 찾는 지루한 작업을 자동화하는 데 도움을 줍니다. 비록 작업이 끝난 것은 아니지만(미래의 버전은 더 많은 유형의 법률을 다루고 정의가 어떻게 변화하는지 추적해야 할 것입니다), 이는 복잡한 프랑스 법전의 세계에 명료함을 가져오기 위한 견고한 출발점을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →