Freeing the Law with LOCUS: A Local Ordinance Corpus for the United States
이 논문은 파편화된 출처로부터 OCR을 통해 추출한 거의 모든 공개된 미국 시 및 카운티 조례를 포함하는 포괄적이고 기계 판독 가능한 코퍼스인 LOCUS를 소개하며, 이는 대규모의 지방 법률 연구 및 분석을 가능하게 하는 조화된 접근 계층과 특화된 AI 모델을 동반한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
법률을 거대하고 다층적인 도서관이라고 상상해 보십시오. 수년 동안 법률 AI(법을 이해하는 컴퓨터 프로그램)는 "큰 책들", 즉 연방법, 주 법전, 그리고 판례와 같이 국가 전체나 주 전체에 적용되는 규칙들을 읽는 데 매우 능숙했습니다.
하지만 이 도서관에는 오랫동안 잠겨 있고 먼지가 쌓여 있던 지하 층이 있습니다. 바로 **지역 조례(local laws)**입니다. 이것들은 용도 지역 설정(어디에 집을 지을 것인가), 소음 수준, 사업자 면허, 동물 통제와 같이 여러분의 도시나 카운티가 만드는 규칙들입니다.
이 논문은 LOCUS(미국 지역 조례 코퍼스)를 소개합니다. 이는 본질적으로 이 지하 층을 개방하고, 책들을 깨끗이 정리하여 컴퓨터가 마침내 읽을 수 있는 디지털 선반 위에 올려놓는 거대한 프로젝트입니다.
다음은 그들이 한 일을 쉬운 비유를 사용하여 정리한 내용입니다.
1. 문제점: 카탈로그가 없는 도서관
LOCUS 이전의 지역 법률을 찾는 것은 모든 마을마다 자신만의 요리책을 가지고 있지만, 다음과 같은 상황의 도서관에서 특정 레시피를 찾는 것과 같았습니다:
- 책들이 서로 다른 언어(형식)로 되어 있었습니다.
- 어떤 것은 손으로 썼고, 어떤 것은 타이핑되었으며, 어떤 것은 그저 복사본의 복사본(스캔된 PDF)이었습니다.
- 어느 마을에 어떤 책이 있는지 알려주는 마스터 리스트가 없었습니다.
- 검색 엔진(사서)에게 "미국의 모든 주차 관련 규칙을 알려줘"라고 물을 수 없었습니다. 왜냐하면 책들이 컴퓨터가 스캔하기 용이한 형식이 아니라 인간이 둘러보기 위해 설계된 수천 개의 서로 다른 웹사이트에 흩어져 있었기 때문입니다.
2. 해결책: "LOCUS" 프로젝트
저자들은 이를 해결하기 위한 거대한 파이프라인을 구축했습니다. 이것은 초강력 눈과 두뇌를 가진 로봇 팀이라고 생각하면 됩니다:
- 수집가(The Collectors): 그들은 로봇을 보내 수천 개의 시와 카운티 웹사이트를 방문하여 법률 책들을 다운로드했습니다.
- 번역가(OCR): 많은 법률이 텍스트가 담긴 사진(스캔된 PDF) 형태였기 때문에, 그들은 특수한 AI(LightOnOCR라고 불림)를 사용하여 사진을 "읽고" 이를 디지털 텍스트로 변환했습니다. 마치 손편지를 워드 문서로 변환하는 것과 같습니다.
- 정리 전문가(The Organizers): 그들은 페이지 번호나 헤더를 제거하여 텍스트를 정리하고, 거대한 책들을 개별 "법률" 단위로 잘게 나누었습니다(마치 하나의 요리책에서 단일 레시피를 분리하는 것과 같습니다).
- 라벨러(The Labelers): 그들은 AI를 사용하여 모든 법률에 "이것은 건물에 관한 것이다", "이것은 사업에 관한 것이다", 또는 "이것은 소음에 관한 것이다"와 같은 라벨을 붙였습니다.
3. 결과: "카운티 조화형" 지도
최종 결과물은 9,239개의 도시와 카운티를 포괄합니다. 그러나 연구를 위해 유용하게 만들기 위해, 그들은 **"카운티 조화형 액세스 레이어(County-Harmonized Access Layer)"**라는 단순화된 버전을 만들었습니다.
비유: 미국 전역의 날씨를 연구하고 싶다고 가정해 봅시다. 여러분은 모든 거리 모퉁이마다 별도의 보고서를 필요로 하는 것이 아니라, 모든 카운티에 대해 하나의 신뢰할 수 있는 보고서를 필요로 합니다.
- 모든 미국 카운티에 대해, LOCUS는 사용 가능한 가장 "큰" 지역 법률 책(해당 카운티의 책 또는 해당 카운티 내에서 가장 큰 도시의 책)을 선택합니다.
- 이것이 모든 지역적 질문(예: "내 뒷마당에 헛간을 지을 수 있는가?")을 해결한다는 뜻은 아니지만, 연구자들이 전국적으로 지역 법률을 연구할 수 있는 견고하고 비교 가능한 토대를 제공합니다.
4. 법률에 "성격 점수" 부여하기
이 논문의 가장 멋진 부분 중 하나는 그들이 단순히 텍xt를 정리한 것이 아니라, 법률에 네 가지 특정 성격 특성에 따른 "점수"를 부여했다는 점입니다. 그들은 AI를 훈련시켜 법률을 읽고 그것이 느껴지는 정도를 척도로 예측하게 했습니다:
- 불투명성 (Opacity - 혼란스러운가 vs 명확한가): 이 법은 평이한 영어로 쓰여 있습니까, 아니면 혼란스러운 전문 용어의 미로입니까?
- 가부장성 (Paternalism - 당신을 보호하는가 vs 타인을 보호하는가): 이 법은 당신이 스스로를 해치는 것을 막으려는 것입니까(예: 아이들을 위한 통행금지), 아니면 당신이 타인에게 해를 끼치는 것을 막으려는 것입니까(예: 소음 조례)?
- 집행 재량권 (Enforcement Discretion - 엄격한가 vs 유연한가): 이 법은 경찰관에게 무엇을 할지 결정할 수 있는 많은 재량을 줍니까, 아니면 엄격한 "예/아니오" 규칙입니까?
- 문제 현저성 (Problem Salience - 긴급한가 vs 사소한가): 이 법은 해당 문제를 거대한 비상사태로 취급합니까, 아니면 사소한 불편함으로 취급합니까?
예시: "16세 미만은 성인 없이 축제에 갈 수 없다"라는 법은 가부장성 점수가 높고(아이들을 보호함), 불투명성 점수는 낮습니다(매우 명확함).
5. 이것이 중요한 이유
저자들은 지역 법률이 단순히 무작위적인 혼란이 아니라는 것을 발견했습니다. 그것들은 숨겨진 구조를 가지고 있습니다.
- **도시(Cities)**는 주로 "공해/방해(nuisance)"(소음, 반려동물, 공공 질서)에 집중하는 경향이 있습니다.
- **카운티(Counties)**는 주로 "용도 지역(zoning)"(토지 이용, 건축 허가)에 집중하는 경향이 있습니다.
- 지역마다 법률의 "풍미(flavor)"가 다릅니다(예: 플로리다 법은 매우 혼란스럽거나 불투명한 경향이 있는 반면, 다른 주들은 더 명확합니다).
핵심 요약
이 논문은 지역 법률을 먼지 쌓이고 파편화된 형식에서 "해방"시켜 깨끗하고 검색 가능한 데이터셋으로 전환함으로써, 차세대 법률 AI를 위한 인프라를 구축했다고 주장합니다.
그들은 AI가 이제 판사 역할을 하거나 법률 자문을 제공할 수 있다고 주장하는 것이 아닙니다. 대신 이렇게 말하고 있습니다: "우리는 마침 finally 지도와 도서관을 만들었습니다. 이제 연구자들은 지역 법률이 어떻게 작동하는지, 지역 간에 어떻게 다른지, 그리고 그것이 사람들의 일상생활에 어떤 영향을 미치는지에 대한 거대한 질문들을 던질 수 있습니다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.