The Saudi Legal Corpus for AI: An Auditable, Official-Source-Grounded, Article-Level Corpus of Saudi Arabian Legislation
이 논문은 고유한 출처 추적, 인용 그래프 및 정의된 용어 사전과 같은 구조화된 분석 계층, 그리고 아랍어 법률 자연어 처리(NLP)를 위한 표준 베이스라인 대비 메타데이터 강화 검색의 우수한 성능을 입증하는 검색 벤치마크를 특징으로 하는, 290개의 사우디 입법 도구로 구성된 포괄적이고 공식적인 출처를 가진 감사 가능한 조항 수준의 데이터셋인 '사우디 AI 법률 코퍼스(Saudi Legal Corpus for AI)'를 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 사회에서 컴퓨터는 법률에 관한 질문에 답하도록 점점 더 많은 요구를 받고 있습니다. 이를 정확하게 수행하기 위해 컴퓨터는 '검색 증강 생성(retrieval-augmented generation)'이라 불리는 기술에 의존합니다. 이 과정은 마치 사서가 질문에 답하기 전, 정답을 담고 있는 정확한 구절을 찾기 위해 방대한 신뢰할 수 있는 문헌의 도서관을 먼저 검색하는 것과 같습니다. 만약 컴퓨터가 적절한 텍스트를 찾을 수 있다면, 내용을 지어내지 않고 사용자에게 요약하여 전달할 수 있습니다. 그러나 이 시스템은 도서관이 컴퓨터가 읽고 이해할 수 있는 형식으로 존재할 때만 작동합니다. 많은 언어와 법 체계, 특히 아랍 세계의 경우 이러한 도서관이 부재해 왔습니다. 주요 글로벌 경제국인 사우디아라비아의 법률은 관보와 정부 웹사이트에 게시되어 있지만, 소프트웨어가 쉽게 검색할 수 있는 구조화된 데이터가 아니라 사람이 읽을 수 있는 페이지와 문서 형태로 존재합니다. 기계가 읽을 수 있는 버전의 법률이 없다면 인공지능은 왕국 내의 법률 문제에 안정적으로 도움을 줄 수 없으며, 이는 기술과 정의에 대한 접근성 모두에서 중대한 공백을 남깁니다.
이 간극을 메우기 위해 연구자 압둘라 알모함메디(Abdullah Almohammedi)는 사우디 법률 AI 코퍼스(Saudi Legal for AI), 즉 왕국의 법률을 집대성한 거대하고 구조화된 디지털 컬렉션을 구축했습니다. 이것은 단순한 링크 목록이나 스캔된 PDF의 모음이 아닙니다. 대신, 주요 성문법부터 세부적인 시행 규정 및 절차 규칙에 이르기까지 290개의 별개 입법 도구를 포함하는 정교하게 조직된 데이터베이스입니다. 이 컬렉션은 상업 비즈니스, 형사 사법, 노동 권리, 조세 등 12가지의 서로 다른 법률 분야를 다룹니다. 이 작업의 핵심은 290개의 법률을 15,689개의 개별 조항 단위 기록으로 변환한 것입니다. 각 기록은 하나의 특정 법률 조항과 같은 단일하고 독립적인 텍스트 조각이며, 총 약 120만 단어의 아랍어로 구성됩니다. 전체 컬렉션은 감사 가능하도록 설계되었습니다. 즉, 모든 텍{t}은 공식 출처로 추적될 수 있어, 컴퓨터가 요약본이나 추측이 아닌 실제 법률을 읽고 있음을 보장합니다.
이 코퍼스의 구축은 정확성과 신뢰성을 보장하기 위해 엄격한 규칙을 따릅니다. 가장 중요한 규칙은 공식 아랍어 텍스트만이 유일한 버전이라는 점입니다. 컬렉션에는 영어와 중국어 번역이 포함되어 있지만, 이들은 이해를 돕기 위한 용도일 뿐 법적 구속력이 없는 비권위적 참조 자료임을 명확히 표시해 두었습니다. 데이터베이스의 모든 조항은 그것이 어디에서 왔으며 어떻게 검증되었는지를 설명하는 라벨을 가지고 있습니다. 연구자는 각 출처의 신뢰도를 등급화하기 위해 4단계 시스템을 사용하였는데, 이는 여러 공식 문서와 교차 확인된 법률과 단일 출처에서 온 법률을 구분합니다. 이러한 세부 수준 덕나 사용자들은 필요한 증거의 양에 따라 데이터를 필터링할 수 있습니다. 예를 들어, 고도의 위험이 따르는 법률 자문을 위한 시스템은 가장 엄격하게 검증된 출처만을 사용할 수 있고, 연구 프로젝트는 더 넓은 범위의 자료를 수용할 수 있습니다. 또한 데이터베이스에는 정부 포털에 아직 최신 개정안이 반영되지 않았을 수 있는 16개의 특정 트랙을 표시하는 '신선도 매니페스트(freshness manifest)'가 포함되어 있어, 사용자가 잘못된 정보에 속지 않도록 주의를 줍니다.
단순히 텍스트를 저장하는 것을 넘어, 연구자는 사우디 법률에 대해 이전에 존재하지 않았던 몇 가지 분석 계층을 추가했습니다. 코퍼스에는 법률들이 서로를 어떻게 인용하는지를 보여주는 법률 간 참조 지도가 포함되어 있으며, 어떤 조항이 다른 조항을 인용하는지를 보여줍니다. 이 인용 그래프는 3,600개 이상의 참조를 포함하고 있으며, 노동법이나 회사법처럼 다른 규정들에 의해 자주 인용되는 법률들이 법 체계 내에서 어떤 중심 허브 역할을 하는지를 밝혀냅니다. 또한 어떤 법률이 이전의 법률을 대체하거나 폐지했는지를 보여주는 수동 분류 지도가 있어 법적 변화의 역사를 추적하는 데 도움을 줍니다. 아울러, 이 프로젝트는 법률 내에서 구체적으로 정의된 약 2,000개의 용어와 3,300개 이상의 정의를 담은 용어 사전을 만들었습니다. 이는 동일한 단어가 맥락에 따라 어떻게 다른 의미를 가질 수 있는지 명확히 해줍니다. 현대 AI 도구에 적합하도록 텍스트는 또한 작은 단위의 관리 가능한 덩어리로 나뉘어, 컴퓨터가 수천 페이지의 텍스트 속에서 길을 잃지 않고 법률의 특정 섹션을 처리할 수 있게 했습니다.
이 새로운 리소스가 얼마나 잘 작동하는지 테스트하기 위해, 연구자는 사우디 법률에 관한 519개의 특정 질문을 만들었으며, 각 질문은 정답을 포함하고 있는 정확한 조항과 쌍을 이루도록 했습니다. 이 질문들은 실제 법률을 읽고 사람이 던질 법한 질의를 구성하여 작성되었습니다. 연구진이 표준 검색 방식과 이 새로운 메타데이터가 풍부한 시스템을 비교 테스트했을 때, 결과는 시사하는 바가 컸습니다. 새로운 시스템은 정답 조항을 93.3%의 확률로 정확히 식별해 낸 반면, 표준 방식은 90.4%를 기록했습니다. 차이는 "매매 계약이란 무엇인가?"와 같이 정의를 묻는 질문에서 가장 두드러졌습니다. 이러한 경우, 새 시스템은 90.9%의 정확도로 올바른 정의를 찾아낸 반면, 표준 방식은 74.5%에 그쳤습니다. 이 격차는 데이터를 정리하고 상세한 라벨을 추가하는 데 들인 추가적인 노력이 결실을 맺어, 검색어가 텍스트와 완벽하게 일치하지 않더라도 컴퓨터가 올로한 정보를 훨씬 더 쉽게 찾을 수 있게 함을 입증합니다.
이 코퍼스의 공개는 지역 내 법률 기술의 중요한 진전이지만, 명확한 경계와 한계도 수반합니다. 이 컬렉션은 포괄적이지 않습니다. 주요 법률은 다루지만 모든 장관 결정이나 지방 자치 규칙을 포함하지는 않습니다. 연구자는 컬렉션의 범위와 각 데이터와 관련된 구체적인 위험을 문서화함으로써 투명성을 유지하고 있습니다. 이 작업은 명시적으로 정부의 공식 출판물이 아니며, 영어와 중국어 계층 또한 공식 번역이 아닙니다. 유일하게 구속력을 갖는 텍스트는 공식 관보에 게시된 원래의 아랍어입니다. 이 구조화되고 검증되었으며 감사 가능한 리소스를 제공함으로써, 이 프로젝트는 신뢰할 수 있는 법률 보조 도구를 구축하고 사우디 법의 구조에 대한 심층적인 연구를 수행할 수 있는 토대를 제공합니다. 이는 기계가 읽을 수 있는 관보가 없는 다른 국가들이 디지털 시대에 맞춰 자신의 법 체계를 어떻게 정리할 수 있는지에 대한 템플릿을 제공하며, 법이 사실에 근거하여 접근 가능하고 이해하기 쉬운 상태로 유지되도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.