Hyperparameter Analysis in Retrieval-Augmented Generation Systems Applied to the Public Prosecutor’s Office of the State of Espírito Santo Corpus
본 연구는 에스피리투산투 검찰청을 위해 맞춤 설계된 검색 증강 생성(RAG) 시스템 내에서 청킹 전략, 컨텍스트 볼륨, LLM 선택이라는 핵심 하이퍼파라미터를 분석하고 최적화하기 위해 실험 계획법(Design of Experiments) 방법론을 채택하였으며, 정렬 순위 변환(Aligned Rank Transform)을 이용한 통계적 분석을 통해 이러한 요인들이 응답 품질에 유의미한 영향을 미친다는 것을 밝혀냈다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 글도 쓰고, 농담도 하고, 거의 모든 질문에 답할 수 있는 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 이 로봇은 인터넷 전체를 읽은 천재적인 학생과 같습니다. 하지만 여기 함정이 있습니다. 이 학생은 사실에 대한 기억력이 형편없습니다. 만약 당신이 특정 법률에 대해 묻는다면, 이 로봇은 완벽하게 들리지만 실제로는 완전히 가짜인 규칙을 자신 있게 지어낼 수도 있습니다. 이것을 "환각(hallucination)"이라고 부르며, 법정이나 병원처럼 정확한 정보가 필요한 곳에서는 큰 문제가 됩니다.
이를 해결하기 위해 과학자들은 **검색 증강 생성(Retrieval-Augmented Generation, RAG)**이라는 영리한 기술을 발명했습니다. 이것은 마치 시험 직전에 로봇 친구에게 교과서 한 더미를 건네주는 것과 같습니다. 자신의 기억에 의존해 추측하는 대신, 로봇은 먼저 책에서 답을 찾아본 다음, 찾아낸 내용만을 바탕으로 답변을 작성합니다. 이는 마치 사건 파일을 확인한 후에 보고서를 쓰는 탐정과 같습니다. 하지만 반전이 있습니다. 그 책들을 어떻게 정리하느냐가 중요합니다. 페이지를 작은 조각으로 찢어야 할까요? 아니면 챕터 전체를 그대로 두어야 할까요? 그리고 로봇이 글을 쓰기 시작하기 전에 몇 페이지나 읽게 해야 할까요? 만약 이 설정들을 잘못 맞춘다면, 로봇은 결정적인 단서를 놓치거나 너무 많은 소음 때문에 혼란에 빠질 수 있습니다. 이것이 바로 브라질의 연구팀이 해결하기로 결정한 퍼즐입니다.
탐정의 딜레마: 기계의 조율
브라질 에스피리투산투 주(Espírito Santo)의 검찰청(MPES)에는 수천 개의 법률, 규칙, 조례가 담긴 방대한 법률 문서 도서관이 있습니다. 수년 동안 특정 규칙을 찾는 것은 악몽과 같았습니다. 공무원들은 정확히 어디를 찾아봐야 하는지 미리 알고 있어야 했고, 그렇지 않으면 길을 잃기 일쑤였습니다. 이를 돕기 위해 그들은 **파비(Fabi)**라는 가상 비서를 만들었습니다(실제 매우 박식한 직원 이름을 따서 명명되었습니다). 파비는 RAG 기술을 사용합니다. 그녀는 법률 도서관을 읽고 직원들의 질문에 답합니다.
하지만 파비는 완벽하지 않았습니다. 때때로 중요한 세부 사항을 놓치기도 했고, 모호한 답변을 내놓기도 했습니다. 헤이토르 과르테자니(Heitor Quartezani)와 그의 팀이 이끄는 연구진은 간단한 질문을 던졌습니다. 어떤 설정이 파비를 최고의 탐정으로 만드는가? 그들은 단순히 추측하지 않았습니다. 그들은 이 문제를 거대한 과학 실험처럼 다루었습니다. 그들은 어떤 설정이 가장 정확하고, 정직하며, 도움이 되는 답변을 만들어내는지 확인하기 위해 시스템의 네 가지 서로 다른 "노브(knob)" 조합을 모두 테스트했습니다.
그들이 어떤 노브를 돌렸고 무엇을 발견했는지 소개합니다.
1. "자르기" 전략 (청킹, Chunking)
길고 복잡한 법률 이야기를 어떻게 잘라서 로봇에게 줄 수 있을까요?
- 기존 방식 (재귀적 방식, Recursive): 이야기를 고정된 크기의 덩어리로 자르는 것입니다. 예를 들어, 500자 단위로 빵을 썰 듯이 자르는 것이죠. 이는 쉽지만, 문장의 중간을 잘라버려 의미를 잃게 만들 수 있습니다.
- 스마트한 방식 (의미론적 방식, Semantic): 주제가 바뀔 때만 이야기를 자르는 것입니다. 만약 법률 내용이 "휴가 규칙"에서 "시간 외 수당"으로 바뀐다면, 바로 그 지점에서 자르는 것입니다. 이렇게 하면 아이디어를 온전하게 유지할 수 있습니다.
발견된 사실: 연구진은 "스마트한 방식"(의문론적 자르기)이 확실한 승자라는 것을 발견했습니다. 구체적으로, 주제 변화의 95백분위수(즉, 주제가 크게 바뀔 때만 자르는 방식)를 기준으로 자르는 것이 정보를 가장 온전하게 유지했습니다. 500자 단위로 작게 쪼개는 "기존 방식"은 최악이었습니다. 그것은 법적 논리를 파편화하여 로봇이 올바른 답을 찾는 것을 불가능하게 만들었습니다. 법률 업무에서는 단 하나의 세부 사항을 놓치는 것도 재앙이 될 수 있으므로, 이야기를 온전하게 유지하는 것이 가장 중요한 요소였습니다.
2. 검색 방법 (Retrieval)
파비는 도서관에서 어떻게 올바른 페이지를 찾을까요?
- 벡터 검색 (Vector Search): 이것은 로봇에게 "이 질문과 '느낌'이 비슷한 것을 찾아줘"라고 요청하는 것과 같습니다. 의미를 이해하는 데는 뛰어나지만, 정확한 단어를 놓칠 수 있습니다.
- 어휘 검색 (Lexical Search): 이것은 고전적인 도서관 카탈로그와 같습니다. 정확한 단어 일치를 찾습니다. 특정 용어를 찾는 데는 좋지만, 맥락을 이해하는 데는 부족합니다.
- 하이브리드 검색 (Hybrid Search): 이것은 두 방식의 장점을 결합한 최고의 방법입니다. "역순 순위 융합(Reciprocal Rank Fusion)"이라는 특별한 수학적 기법을 사용하여 "느낌" 검색과 "정확한 단어" 검색을 결합합니다.
발견된 사실: 하이브리드 검색이 챔피언이었습니다. 두 방법을 결합함으로써, 사용자가 질문을 이상하게 하거나 매우 특정한 법률 용어를 사용하더라도 파비는 올바른 문서를 찾을 수 있었습니다. "느낌" 검색만으로는 충분하지 않았고, "정확한 단어" 검색만으로는 너무 경직되어 있었습니다. 이 둘이 합쳐졌을 때 시스템은 훨씬 더 신뢰할 수 있게 되었습니다.
3. 얼마나 읽을 것인가 (Top-K)
파비가 최적의 문서를 찾았을 때, 답변을 하기 전까지 얼마나 많이 읽어야 할까요? 5페이지를 읽어야 할까요? 20페이지를 읽어야 할까요?
- 발견된 사실: 더 많이 읽을수록 더 좋아졌습니다. 적어도 어느 지점까지는 말이죠. 20개의 문서를 읽었을 때 가장 좋은 결과를 얻었습니다. 로봇에게 더 큰 "그물"을 주어 정보를 잡게 하는 것이, 설령 추가된 페이지 중에 약간의 소음(불필요한 정보)이 섞여 있더라도 올-바른 단서를 찾는 데 도움이 된다는 것이 밝혀졌습니다. 그러나 연구진은 15개의 문서 이후부터는 최종 답변의 품질 향상이 통계적으로 유의미해지지 않는다는 점을 주목했습니다. 따라서 20개를 읽는 것이 약간 더 나은 결과는 주었지만, 그만큼 더 많은 컴퓨터 자원을 소모했습니다. 그들은 향-후 시스템이 더 적은 페이지를 읽으면서도 동일하게 훌륭한 결과를 얻을 수 있도록 더 스마트한 필터를 사용할 수 있을 것이라고 제안했습니다.
4. 두뇌의 선택 (LLM 선택)
마지막으로, 그들은 파비의 두 가지 서로 다른 "두뇌"를 테스트했습니다. 거대하고 초지능적인 gpt-4o와 더 작고 빠른 gpt-4o-mini입니다.
- 놀라운 결과: 여러분은 더 크고 비싼 두뇌가 이길 것이라고 생각할 수도 있습니다. 하지만 더 작은 gpt-4o-mini가 실제로 대등하거나 때로는 더 나은 성능을 보였습니다!
- 이유는? 거대한 두뇌는 너무 똑똑해서 때때로 지나치게 창의적이려고 했습니다. 로봇이 20개의 문서를 읽을 때, 큰 두뇌는 아이디어를 섞거나 텍스트를 과잉 해석하여 작은 오류를 범하곤 했습니다. 반면, 더 작은 두뇌는 훨씬 더 순종적이었습니다. 제공된 텍스트에 엄격하게 달라붙어, 자신만의 "풍미"를 더하지 않고 사실만을 추출했습니다. 정밀함이 필요한 법률 비서에게는, 조금 더 문자 그대로 해석하는 능력이 오히려 강력한 무기가 된 것입니다.
최종 판결
연구진은 단순히 추측한 것이 아니라, 3,840번의 서로 다른 실험(40개의 질문에 대해 96가지의 서로 다른 설정 테스트)을 수행했으며, 고급 수학을 사용하여 결과를 입증했습니다.
그들은 최고의 법률 비서를 구축하기 위해 다음과 같이 결론지었습니다:
- 문서를 고정된 크기가 아닌 주제별로 자를 것.
- 의미와 정확한 단어를 결합한 하이브리드 검색을 사용할 것.
- 놓치는 것이 없도록 약 20개의 문서를 읽을 것.
- 지시 사항을 더 엄격하게 따르고 실수를 덜 하는 더 작고 저렴한 AI 모델(gpt-4o-mini)을 사용할 것.
이 연구는 "이것저로 해보고 어떻게 되는지 보자"는 식의 접근을 넘어섭니다. 이 연구는 이러한 강력한 도구들이 단순히 똑똑해 보이는 것을 넘어, 실제로 똑똑하고 신뢰할 수 있게 만들기 위해 어떻게 조율해야 하는지를 엄격한 과학을 통해 알려줍니다. 검찰청의 경우, 이제 파비가 더 빠르고 실수 없이 올바른 법률을 찾아내어 법률 시스템이 모두를 위해 더 잘 작동하도록 도울 수 있음을 의미합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.