By Their Fruits You Will Know Them: Comparing Formalizations of Law by the Decisions They Encode
본 논문은 법적 형식화 간의 체계적 비교를 위해 이견이 발생하는 경계 사례를 열거하고 언어화하는 방법을 제시하여, 구조적 유사성이 행동적 일관성을 보장하지 않으며 LLM 에 의해 생성된 형식화가 구별되며 법적으로 중요한 차이를 초래할 수 있음을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 약간 모호한 언어로 작성된 매우 복잡한 법적 규칙의 레시피가 있다고 가정해 봅시다. 이제 이 레시피를 로봇이 따를 수 있는 엄격한 단계별 흐름도로 번역해 달라고 9 명의 전문가 셰프 (AI 모델) 에게 요청합니다.
문제는 다음과 같습니다: 셰프들이 동일한 재료를 사용하고 단계를 비슷한 순서로 작성하더라도, 몇 가지 핵심 지시를 다르게 해석할 수 있습니다. 한 셰프는 "소금을 넣으라"는 지시를 "꼬집만큼"으로 해석하는 반면, 다른 셰프는 "한 컵"으로 해석할 수 있습니다. 만약 그들의 흐름도를 나란히 비교하기만 한다면, 90% 는 동일해 보일 것입니다. 하지만 로봇에게 특정하고 까다로운 재료 조합을 입력하면, 한 셰프의 로봇은 "이 요리를 서빙하라"고 말하지만, 다른 셰프의 로봇은 "이것을 버리라"고 말할 수 있습니다.
이 논문은 누군가 다치기 전에 이러한 숨겨진 불일치를 발견하는 새로운 방법에 관한 것입니다.
핵심 문제: "그들의 열매로 그들을 알리라"
제목은 오래된 속담에서 유래했습니다: 나무를 외모로 판단할 수 없으며, 그 열매를 맛봐야 합니다. AI 와 법률 세계에서는 "나무"가 형식화된 규칙 (흐름도) 이고, "열매"는 특정 사건에 대해 내리는 결정입니다.
저자들은 두 개의 AI 생성 법적 규칙의 구조를 단순히 비교하는 것만으로는 부족하다고 주장합니다. 두 규칙은 종이 위에서는 거의 동일해 보일 수 있지만, 실제 시나리오에서는 완전히 반대되는 결과를 낳을 수 있습니다. 그들은 동일한 법에 대한 서로 다른 AI 해석이 충돌하는 "에지 케이스 (edge cases)"—즉, 기이하고 구체적인 상황들—를 체계적으로 찾아낼 수 있는 방법을 원했습니다.
방법론: 세 단계의 탐정 과정
연구자들은 이러한 불일치를 포착하기 위해 "그들의 열매로"라고 명명한 파이프라인을 구축했습니다. 간단한 비유를 통해 작동 방식을 설명해 보겠습니다:
1. 번역 (형식화)
먼저, GDPR 이나 AI 법과 같은 10 가지 EU 법을 취하여 9 명의 최상위 AI 모델에게 각 법을 "의사결정 트리"로 변환하도록 요청했습니다. 이는 모호한 설명을 바탕으로 9 명의 다른 건축가에게 같은 집의 설계도를 그리도록 요청하는 것과 같습니다.
2. 지도 제작 (매칭)
다음으로, 설계도들을 비교해야 했습니다. 하지만 건축가들은 같은 방을 다른 라벨로 불렀습니다. 한 사람은 "부엌"이라고 부르고, 다른 사람은 "조리 구역"이라고 불렀습니다. 연구자들은 AI 를 번역기로 활용하여 서로 다른 트리에서 동일한 법적 개념을 나타내는 노드 (단계) 를 매칭했습니다. 그리고 나무들이 겹치는 부분을 나타내는 "공유 지도"를 구축했습니다.
3. 스트레스 테스트 (SAT 솔버 및 에지 케이스)
이것이 마법 같은 부분입니다. 공유 지도를 확보한 후, 그들은 수학적 도구 (SAT 솔버) 를 스트레스 테스트 엔지니어처럼 활용했습니다. 그들은 이렇게 물었습니다: "이 두 설계도가 서로 다른 답변을 내게 만드는 절대적으로 가장 작고 기이한 사실의 집합은 무엇인가?"
이 도구는 규칙이 갈라지는 특정 사실 조합인 "에지 케이스"를 찾아냈습니다. 예를 들어, 규칙이 경찰이 로봇을 사용 하고 데이터가 합법적으로 수집되었 지만 특정 의료 목적을 위한 것은 아닐 때에만 불일치한다는 사실을 발견할 수 있습니다.
4. 스토리텔링 (구술화)
마지막으로, "참/거짓" 변수 목록처럼 보이는 원시 수학은 지루하고 인간이 이해하기 어렵습니다. 따라서 그들은 또 다른 AI 를 사용하여 이러한 수학 문제를 짧고 현실적인 이야기로 변환했습니다.
- 대신: "입력 A=참, 입력 B=거짓, 입력 C=참."
- 다음과 같이 얻음: "한 회사가 인종 식별을 위해 경찰에 얼굴 인식 시스템을 판매합니다. 데이터는 합법적으로 수집되었지만, 시스템은 필터링 목적으로 사용되지 않습니다."
그들이 발견한 것들
10 가지 EU 법과 9 개의 AI 모델을 대상으로 이 실험을 수행했을 때, 그들은 몇 가지 놀라운 사실을 발견했습니다:
- 외모는 속일 수 있다: 규칙이 구조적으로 얼마나 유사해 보이는지와 결과에 대해 얼마나 자주 불일치하는지 사이에는 거의 연관성이 없었습니다. 두 모델은 구조의 95% 가 일치할지라도 에지 케이스의 50% 에 대해서는 여전히 불일치할 수 있습니다.
- 실제 법적 드라마: "열매들"(에지 케이스) 은 법을 어떻게 해석해야 하는지에 대한 진정한, 뿌리 깊은 불일치를 드러냈습니다.
- 예시: 경찰 업무용 인종 분류 AI 에 관한 주제에서 AI 모델들은 반반으로 갈렸습니다. 절반은 엄격히 금지된다고 했고,另一半는 데이터가 합법적으로 수집되었다면 허용된다고 했습니다. 이는 컴퓨터 오류가 아니라, 법이 실제로 무엇을 의미하는지에 대한 인간 법률 전문가들 사이에서 ongoing(진행 중인) 논쟁을 반영한 것이었습니다.
- 숨겨진 오류: 이 방법은 명백한 실수도 포착했습니다. 한 AI 모델은 실수로 법적 조건이 법이 의도한 것보다 훨씬 더 충족하기 어렵게 만드는 추가 규칙을 추가했습니다. "열매"(에지 케이스) 는 이 오류를 즉시 폭로했습니다.
결론
이 논문은 AI 가 법을 올바르게 해석하고 있는지 진정으로 이해하려면 코드나 흐름도를 단순히 살펴보는 것만으로는 부족하다고 결론 내립니다. 대신 특정하고 까다로운 시나리오에 대해 테스트해야 합니다.
그들의 방법은 마치 스포트라이트처럼, 법에 대한 서로 다른 AI 해석이 충돌하는 정확한 순간들을 비추는 역할을 합니다. 이는 추상적인 수학적 차이를 인간 변호사가 읽고, 이해하고, 논쟁할 수 있는 구체적인 이야기로 변환합니다. 이는 어떤 AI 가 "옳은지"를 알려주지는 않습니다 (그것은 인간 전문가의 일입니다). 하지만 그들이 정확히 어디서 그리고 왜 불일치하는지 확실히 알게 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.