Multi-Legal-Bench: Evaluating LLMs on Legal Reasoning Across Jurisdictions, Languages, and Legal Traditions
본 논문은 여섯 개 국가와 네 가지 어족에 걸친 법적 추론을 평가하는 최초의 초법역적 벤치마크인 Multi-Legal-Bench 를 소개하며, 작업 수행도가 관할권에 따라 현저히 달라지며 언어적 근접성이나 토크나이저 효율성보다는 레이블 집합 정렬이 초언어적 퓨샷 전이 성공의 주요 예측 요인임을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
새로운 초지능 학생들 (대규모 언어 모델 또는 LLM) 이 법을 얼마나 잘 이해하는지 테스트해 보려 한다고 상상해 보세요.
과거에는 연구자들이 이러한 학생들을 한 나라 (보통 미국 또는 영국) 와 한 언어 (영어) 에서만 테스트했습니다. 이는 뉴욕의 학생들에게 수학 시험을 치르게 하고, 그 결과가 도쿄에서의 수학 시험 성적도 정확히 예측해 줄 것이라고 가정하는 것과 같습니다. 하지만 법은 나라마다 다르고 언어도 다르기 때문에, 그러한 가정은 결함이 있었습니다.
이 논문은 이러한 문제를 해결하기 위해 설계된 새로운 "글로벌 성적표"인 Multi-Legal-Bench를 소개합니다. 간단한 비유를 들어 작동 방식을 설명해 보겠습니다.
1. "같은 시험, 다른 교실" 아이디어
연구자들은 질문은 정확히 동일하지만 교실은 서로 다른 벤치마크를 만들었습니다.
- 학생들: 그들은 11 개의 서로 다른 AI 모델 (일부는 거대하고 일부는 작음) 을 테스트했습니다.
- 교실: 그들은 우크라이나, 프랑스, 네덜란드, 폴란드, 체코, 리투아니아 등 6 개 국가를 선정했습니다.
- 과목: 그들은 AI 에게 에세이를 쓰도록 요청하지 않았습니다. 대신 실제 법원 문서를 기반으로 한 5 가지 구체적인 논리적 과제를 부여했습니다.
- 법원 유형 분류: "이 사건은 형사 사건인가 민사 사건인가?" (우편물을 "광고"와 "청구서"로 분류하는 것과 유사).
- 판결 형식 분류: "이것은 최종 판결인가 아니면 임시 명령인가?" ("기말고사"와 "단답형 퀴즈"를 구분하는 것과 유사).
- 사건 결과 예측: "사실에 기반하여 누가 승리하는가?" (가장 어려운 부분으로, 체스 게임이 끝날 전에 승자를 추측하는 것과 유사).
- 법적 규범 추출: "이 텍스트에서 인용된 구체적인 법 조항을 찾아라." (단락에서 모든 빨간색 단어를 찾는 것과 유사).
- 소송 원인 카테고리 예측: "이 사건은 무엇에 관한 것인가? 세금? 가족? 계약?" (책을 장르별로 분류하는 것과 유사).
2. "희소 지도"의 현실
연구자들은 모든 국가가 모든 과제에 대한 데이터를 갖도록 강요하지 않았습니다. 그들은 현실 세계의 복잡함에 대해 솔직했습니다.
- 비유: 교통 신호등이 있는 거리와 없는 거리가 섞인 도시 지도를 상상해 보세요. 그들은 신호등이 없는 거리에 가짜 신호등을 만들지 않았습니다. 대신 데이터가 존재하는 위치를 정확히 매핑했을 뿐입니다. 이로 인해 "희소"한 그리드 (일부 칸은 채워지고 일부는 비어 있음) 가 생성되었는데, 이는 실제로 각국에서 법적 데이터가 어떻게 저장되어 있는지에 대해 더 정직한 이야기를 들려줍니다.
3. 큰 놀라움 (그들이 발견한 것)
A. "한 가지 크기가 모두에게 맞지 않는다"
법 분야에서 "최고의 AI"는 존재하지 않습니다.
- 비유: AI 모델을 다양한 종류의 자동차로 생각해 보세요. 한 자동차는 경주 트랙 (프랑스 법) 에서 가장 빠를 수 있지만, 진흙밭 (폴란드 법) 에서는 끔찍할 수 있습니다. 다른 자동차는 진흙밭에서는 훌륭하지만 트랙에서는 느릴 수 있습니다.
- 결과: 프랑스에서 1 위인 모델이 폴란드에서는 꼴찌일 수 있습니다. 단순히 "가장 똑똑한" 모델을 선택할 수 없으며, 특정 국가와 과제에 맞는 올바른 모델을 선택해야 합니다.
B. "언어 가족" 신화
연구자들은 우크라이나어와 폴란드어 (둘 다 슬라브어족) 와 같이 "사촌" 관계인 언어들이 AI 가 지식을 전이하기에 더 쉬울 것이라고 생각했습니다.
- 비유: 그들은 우크라이나어 학생에게 가르쳤다면, 유사한 폴란드어 시험을 쉽게 이해할 것이라고 기대했습니다.
- 결과: 그들은 틀렸습니다. AI 는 실제로 먼 사촌인 프랑스어보다 우크라이나어에서 폴란드어로 전이할 때 더 잘 수행했습니다.
- 이유: 그것은 언어가 아니라 라벨에 관한 문제였습니다. "정답 키"(AI 가 선택해야 하는 카테고리) 가 비슷하면 언어가 완전히 달라도 AI 는 잘 수행했습니다. 반면 정답 키가 엉망이고 다르면 언어가 비슷해도 AI 는 어려움을 겪었습니다.
C. "힌트" 효과 (퓨샷 학습)
그들은 시험 전에 몇 가지 예시 (힌트) 를 제공하는 것이 AI 에게 도움이 되는지 테스트했습니다.
- 결과: 그것은 과제에 따라 다릅니다.
- 문서 분류 (판결 형식) 의 경우, 예시를 제공하는 것은 학생에게 치트 시트를 주는 것과 같아 어디서나 도움이 되었습니다.
- 사건 승자를 예측하는 경우, 예시를 제공하는 것은 동전 던지기였습니다. 때로는 도움이 되지만 때로는 AI 를 혼란스럽게 했습니다.
- 단순 분류 (법원 유형) 의 경우, AI 는 이미 너무 잘해서 힌트가 필요하지 않았습니다.
D. "단어 수" 함정
그들은 "토크나이저 비옥도"를 살펴보았는데, 이는 기본적으로 모델이 단어를 분해하는 데 필요한 작은 조각 (토큰) 의 수를 의미합니다.
- 비유: 한 학생은 단어를 2 글자로 쓰고, 다른 학생은 10 글자로 쓴다고 상상해 보세요. 10 글자로 쓰는 학생이 비효율적이라고 생각할 수 있습니다.
- 결과: 그들은 단어를 분해하는 데 있어 모델이 얼마나 "효율적인가"가 실제 법적 과제에서 얼마나 똑똑한지를 예측하지 못한다는 사실을 발견했습니다. 단어를 작성하는 데 더 많은 "글자"를 사용하는 모델이더라도 글자를 적게 사용하는 모델만큼 정확할 수 있습니다. "효율성" 지표는 시험 비용이 얼마나 들지 추측하는 데는 좋지만, 모델이 실제로 얼마나 잘 수행할지 추측하는 데는 나쁜 지표입니다.
4. 결론
이 논문은 법 분야에서 AI 를 사용하려는 모든 사람에게 경고합니다: 한 나라에서 작동한다고 해서 다른 나라에서도 작동한다고 가정하지 마십시오.
- 프랑스를 위한 법적 AI 를 구축했다면, 둘 다 유럽에 있다는 이유만으로 폴란드에서도 작동할 것이라고 가정하지 마십시오.
- 모델이 단어 처리에 "효율적"이라고 해서 법적 문제를 해결하는 데 가장 뛰어나다고 가정하지 마십시오.
- AI 가 특정 법적 시스템에 적합한지 알 수 있는 유일한 방법은 귀하의 특정 데이터와 귀하의 특정 규칙으로 테스트하는 것입니다.
연구자들은 모든 데이터, 질문, 결과를 공개하여 누구나 자신의 특정 법적 환경에 가장 적합한 AI 가 무엇인지 확인하기 위해 자체 "성적표"를 실행할 수 있도록 했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.