Inject or Navigate? Token-Efficient Retrieval for LLM Analysis of Transactional Legal Documents
이 논문은 전체 코퍼스 주입을 구조화된 검색 방식, 특히 소형 인덱스에 대한 LLM 내비게이션(NAVINDEX)으로 대체하는 것이 트랜잭션 법률 문서 벤치마크에서 베이스라인 주입 방식과 대등한 정확도를 달성하는 동시에 토큰 소비, 컨텍스트 크기 및 운영 비용을 크게 줄인다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 복잡한 퍼즐을 풀려는 변호사라고 상상해 보십시오. 당신에게는 방대한 양의 법률 문서(계약서, 수정안, 부속 서신) 뭉치가 있고, 이를 읽을 수 있는 매우 똑똑하지만 비용이 많이 드는 조수(AI)가 있습니다.
이 논문은 간단한 질문을 던집니다: 돈과 시간을 낭비하지 않으면서 AI가 질문에 정확하게 답할 수 있도록 이 문서들을 전달하는 가장 좋은 방법은 무엇인가?
다음은 연구진이 테스트한 세 가지 방법이며, 일상적인 비유를 통해 설명합니다.
문제점: "도서관 전체" 방식
기본 방식 (Inject):
특정 계약 조항에 대해 질문이 있는 경우, 가장 단순한 방법은 질문을 할 때마다 AI에게 도서관 전체를 건네주는 것입니다.
- 장점: AI가 모든 것을 보기 때문에 놓치는 것이 없습니다.
- 단점: 믿을 수 없을 정도로 비싸고 느립니다. 이는 마치 42권의 책 중 12페이지에 있는 단 하나의 물건 가격을 찾기 위해 사서에게 책 500권을 다 읽어달라고 요청하는 것과 같습니다. 또한, 도서관이 너무 커지면 AI가 "혼란"을 느껴 이야기의 중간 부분을 잊어버리기도 합니다.
경쟁자들: 더 스마트하게 검색하는 두 가지 방법
연구진은 관련 있는 페이지를 먼저 찾아낸 뒤 AI에게 보여주는 두 가지 "스마트 검색" 방법을 테스트했습니다.
1. "의미론적 검색" 방식 (NavEmbed)
비유: 키워드 색인.
책 전체를 읽는 대신, AI는 당신의 질문을 보고 단어의 의미를 이해한 뒤, 디지털 색인을 검색하여 가장 유사한 단락 10개를 찾아냅니다.
- 작동 원리: "벡터"(의미를 수학적으로 표현한 것)를 사용하여 어떤 페이지가 관련 있는지 추측합니다.
- 결과: 이 방식은 비용을 절감하는 데 매우 효과적이었습니다. "전체 도서관" 방식과 비교했을 때 AI가 읽어야 하는 텍스트 양을 17배에서 30배까지 줄였습니다.
- 함정: 때때로 법률 문서는 특정 구조(예: "섹션 A는 섹션 B를 참조함")에 의존합니다. 순수한 의미 매칭은 이러한 구조적 연결 고치를 놓칠 수 있어, 답변을 몇 개 놓치는 결과를 초래하기도 합니다.
2. "구조적 탐색" 방식 (NavIndex)
비유: 지도가 포함된 목차.
이 방식은 단순히 의미를 바탕으로 추측만 하지 않습니다. 이 방식은 "이 단락은 용어를 정의함", "이 조항은 저 스케줄을 참조함", "이 수정안은 원본을 무효화함"과 같이 명시적으로 기록된 특별한 문서를 만들어 문서의 지도를 구축합니다.
- 작동 원리: AI는 이 압축된 지도(전체 텍스트에 비해 매우 작음)를 스캔하여 적절한 "노드"(페이지)를 선택한 다음, 해당 특정 페이지와 그 페이지가 명시적으로 연결하고 있는 페이지들만을 가져옵니다.
- 결과: 이 방식이 우승자였습니다. "전체 도서관" 방식과 동일한 정확도(18개 질문 중 18개 모두 정답)를 기록하면서도, 비용은 25% 적게 들었고, 답변을 생성할 때 AI가 읽어야 하는 텍스트 양은 56배나 적었습니다.
"교차" 규칙: 언제 무엇을 사용할 것인가?
연구진은 비용에 관한 수학적 임계점인 **캐싱 교차(Caching Crossover)**를 발견했습니다.
- 규칙: 만약 당신의 문서 뭉치가 작다면(찾고자 하는 특정 답변 크기의 약 10배 미만), 재사용되는 캐시 텍스트에 대한 할인 혜택 덕분에 문서 전체를 AI의 메모리에 한꺼번에 넣는 것이 실제로 더 저렴합니다.
- 현실: 법률 거래는 보통 매우 큽니다. 문서가 이 임계값보다 커지면 "전체 도서관" 방식은 돈 낭비가 됩니다.
- 판결: 작고 일회성인 작업에는 전체를 다 넣으십시오. 크고 복잡한 법률 거래에는 "구조적 탐색"(NavIndex) 방식을 사용하십시오.
핵심 요점 (교훈)
- 욕심을 부리지 마십시오: AI가 읽을 수 있는 관련 페이지를 최대 10개로 제한하는 것이 정확도를 해치지 않으면서 비용을 절감했습니다.
- 키워드보다 구조가 우선입니다: 일반적인 키워드 검색(구글 검색과 같은 방식)과 의미 검색을 혼합하는 것은 오히려 상황을 악화시키고 비용을 높였습니다. 왜냐하면 관련 없는 텍스트를 너무 많이 끌어들였기 때문입니다.
- 가장 중요한 것: 어떤 "검색 엔진"(임베딩 모델)을 사용하는지는 중요하지 않았습니다. 중요한 것은 검색 결과에 어떤 정보가 첨부되어 있는가였습니다. AI에게 문서의 구조에 대한 지도를 제공하는 것이 검색 알고리즘 자체보다 훨씬 더 중요했습니다.
요약
이 논문은 복잡한 법률 문서를 분석하기 위해 AI에게 책 전체를 먹일 필요가 없다는 것을 증명합니다. 문서의 스마트하고 구조화된 지도를 만들고 AI가 그 지도를 탐색하게 함으로써, 완벽한 정확도를 얻는 동시에 비용을 대폭 절감하고 데이터 처리량을 크게 줄일 수 있습니다.
- 작은 문서: 전체를 다 넣으십시오 (충분히 저렴합니다).
- 큰 문서: 돈을 아끼고 AI가 집중할 수 있도록 스마트한 지도(NavIndex)를 사용하십시오.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.