Retrieval Augmented Generation Framework for the Nepali Legal Domain Question Answering
이 연구는 저자원 법률 도메인의 데이터 부족 문제를 해결하기 위해 네팔 카눈 파트리카(Nepal Kanun Patrika) 아카이브를 활용하여 높은 정밀도와 진실성 점수를 달성함으로써, 네팔 법률 질의응답을 위한 최초의 검색 증강 생성(RAG) 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
네팔의 법률 시스템을 거대하고 오래된 도서관이라고 상상해 보십시오. 이 도서관에는 네팔어로 쓰인 수천 개의 판례(case laws)가 담긴 책들이 있습니다. 하지만 두 가지 큰 문제가 있습니다:
- 책들이 엉망입니다: 이 책들은 구식 언어로 쓰여 있고, 여기저기 흩어져 있으며, 제대로 디지털화되지도 않았습니다.
- 사서가 신입입니다: 인공지능(AI) 모델들은 보통 영어 책들로 학습됩니다. 그래서 여러분이 네팔 법에 대해 물어보면, AI는 충분한 네팔어 법률 텍스트를 읽고 규칙을 배울 기회가 없었기 때문에 혼란스러워하거나 말을 지어내곤 합니다.
이 논문은 **RAG(Retrieval-Augmented Generation, 검색 증강 생성)**라는 시스템을 사용하여 이를 해결하는 새로운 방법을 소개합니다. RAG를 교과서를 통째로 암기하려는 학생이 아니라, 말을 하기 전에 도서관에서 답을 찾아볼 수 있는 권한을 가진 스마트한 연구 보조원이라고 생각하십시오.
연구진이 이 보조원을 어떻게 구축하고 테스트했는지 설명합니다:
1. 도서관 (데이터)
연구팀은 네팔 대법원의 공식 디지털 아카이브(Nepal Kanun Patrika)를 조사했습니다. 그들은 10,320개의 법률 문서를 수집하고 정제했습니다.
- 과제: 이 방대한 문서를 AI에 그대로 입력할 수는 없었습니다. 이는 500페이지짜리 책 전체를 한 번에 읽어서 특정 문장을 찾아내려는 것과 같습니다.
- 해결책: 그들은 AI가 더 잘 처리할 수 있도록 문서를 작은 "덩어리(chunks)"(마치 긴 이야기를 짧은 단락으로 나누는 것과 같은 방식)로 잘게 나누었습니다.
2. 검색 엔진 (올바른 페이지 찾기)
AI가 질문에 답하기 전에, 먼저 도서관에서 올바른 페이지를 찾아야 합니다. 연구진은 두 가지 서로 다른 검색 방식을 테스트했습니다.
방법 A: "키워드 사냥꾼" (BM25)
- 작동 방식: 이것은 정확한 단어를 찾는 전통적인 사서와 같습니다. 만약 여러분이 "절도에 대한 처벌은 무엇인가?"라고 묻는다면, 사서는 "처벌", "절도", "법"이라는 정확한 단어를 스캔합니다.
- 결과: 이 방법이 우승자였습니다. 작은 덩어리를 찾을 때는 91%, 전체 문서를 찾을 때는 88%의 확률로 올바른 문서를 찾아냈습니다. 법률 용어는 매우 구체적이고 반복적이기 때문에 이 방법이 매우 정밀했습니다.
방법 B: "의미 매칭" (Dense Retrieval)
- 작동 방식: 이것은 단어가 다르더라도 질문의 '분위기'나 '의미'를 이해하는 사서와 같습니다. 수학적 임베딩(embeddings)을 사용하여 "훔치다(stealing)"와 "절도(theft)"가 같은 의미임을 추측합니다.
- 결과: 이 방법은 좋았지만, 이 특정 작업에는 아주 뛰어나지는 않았습니다. 이 방법은 올바른 문서를 75%의 확률로만 찾아냈습니다. 연구진은 네팔 법의 경우 법률 용어가 매우 엄격하기 때문에, 의미를 추측하는 것보다 정확한 단어 매칭이 더 효과적이라는 것을 발견했습니다.
속도의 함정:
"키워드 사냥꾼"(BM25)에게는 주의할 점이 있었습니다. 정확도를 높이기 위해 문서를 아주 작은 덩어리로 나누면, 검색 속도가 매우 느려졌습니다 (10,000권의 책 대신 110,000개의 아주 작은 인덱스 카드를 검색하는 것과 같습니다). 시스템을 유용할 만큼 빠르게 유지하기 위해, 그들은 약간 덜 정확하더라도 훨씬 빠른 "전체 문서" 버전의 키워드 사냥꾼을 선택했습니다.
3. 답변 작성자 (응답 생성)
시스템이 올바른 문서를 찾고 나면, 이제 답변을 작성해야 합니다.
- 규칙: AI에게는 엄격하게 명령되었습니다: "지어내지 마시오."
- 전략: 연구진은 두 단계의 과정을 사용했습니다. 첫째, AI는 반드시 답변을 증명하는 문서 내의 정확한 문장을 지목해야 합니다. 둘째, AI는 오직 그 문장에만 기반하여 답변을 작성해야 합니다. 만약 증거를 찾을 수 없다면, 추측하는 대신 "모릅로지다"라고 말하도록 교육받았습니다.
4. 결과 (성공했는가?)
연구팀은 법률 전문가들이 작성한 100개의 질문으로 이 시스템을 테스트했습니다. 가장 성능이 좋았던 버전(키워드 사냥꾼 + 전체 문서)의 결과는 다음과 같습니다:
- 성공률: 질문의 **92%**에 대해 성공적으로 답변을 생성했습니다.
- 진실성: 다른 AI와 인간 변호사들이 검증했을 때, 답변의 85%가 진실이었습니다 (즉, 사실을 왜곡하거나 환각 현상을 일으키지 않았습니다).
- 근거성: 답변의 **74%**가 도서관에서 찾은 텍스트에 의해 직접적으로 뒷받받되었습니다.
핵심 요약
이 논문은 저자원 언어인 네팔어의 경우, 모든 것을 암기한 초지능 AI가 필요한 것이 아니라는 점을 증명합니다. 대신, 정확한 법률 텍스트를 찾아내는 신뢰할 수 있는 검색 도구와, 텍스트가 눈앞에 없을 때는 입을 다무는 엄격한 AI가 필요합니다.
단순하고 빠른 검색 방법(BM25)과 신중한 작성 과정을 결합함으로써, 그들은 사실을 지어내지 않고 네팔어 법률 질문에 안정적으로 답할 수 있는 최초의 시스템을 만들었습니다. 이는 궁극적으로 일반 사람들이 법학 학위 없이도 자신의 법적 권리를 이해할 수 있도록 돕는 토대가 될 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.