Hierarchical Reranking for Scalable Financial RAG System
이 논문은 ACM-ICAIF '24 FinanceRAG 챌린지에서의 최상위 성과로 입증되었듯이, 복잡한 금융 문서 분석을 위해 검색 정밀도와 사실적 일관성을 크게 향상시키고자 사전 검색 최적화, 2단계 랭킹 메커니즘, 그리고 롱 컨텍스트 관리를 통합한 확장 가능한 RAG 프레임워크인 Hierarchical Reranker를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 단일 범죄 현장이 아니라, 수백만 권의 책이 담긴 도서관을 맡게 된 탐정이라고 상상해 보십시오. 각 책은 작고 혼란스러운 텍스트와 복잡한 차트로 가득 찬 수천 페이지로 이루어져 있습니다. 이것이 바로 특정 숫자나 사실을 찾아내야 하는 금융 분석가들이 10-K 보고서(기업이 정부에 제출하는 거대한 보고서)와 같은 문서를 읽을 때 마주하는 일상의 현실입니다. 인공지능의 세계에는 RAG(Retrieval-Augmented Generation, 검색 증강 생성)라고 불리는 도구가 있는데, 이는 마치 매우 똑똑한 사서와 같습니다. 이 사서는 단순히 책을 읽는 것에 그치지 않고, 당신이 필요한 정확한 페이지를 찾아낸 뒤 오직 그 발견된 내용만을 바탕으로 요약문을 작성합니다. 하지만 일반적인 사서들은 이 거대한 금융 도서관의 규모에 압도당하거나, 단어와 숫자의 혼합에 혼란을 느끼거나, 문서가 너무 길 경우 사실을 지어내기도 합니다. 이 논문은 어떻게 하면 작업 규모가 커져도 빠르고 정확하며 세부 사항 속에서 길을 잃지 않는 사서를 구축할 것인가라는 문제를 다룹니다.
이 논문의 저자인 이주현과 홍성우는 **계층적 리랭커(Hierarchical Reranker)**라고 불리는 새로운 시스템을 제안합니다. 이 시스템을 탐정 팀을 고용하는 2단계 채용 과정이라고 생각해 보십시오. 10만 페이지짜리 책의 모든 페이지를 읽기 위해 하나의 거대하고 비싸며 느린 탐정을 고용하는 대신, 이 시스템은 "소규모 및 대규모" 팀 전략을 사용합니다. 먼저, 빠르고 가벼운 탐정(작은 AI 모델)이 전체 도서관을 빠르게 훑으며 명백히 관련 없는 페이지들을 버려, 가장 유망한 상위 100페이지로 범위를 좁힙니다. 그다음, 고도로 숙련된 전문가 탐정(크고 강력한 AI 모델)이 단 100페이지만을 아주 깊고 세밀하게 살펴보고, 질문에 진정으로 답할 수 있는 최종 상위 20개를 골라냅니다. 이러한 접근 방식은 값비싼 전문가가 전체 도서관에서 에너지를 낭비하는 대신 가장 가능성 높은 후보들에 대해서만 힘든 일을 수행하게 함으로써 시간과 비용을 절약해 줍니다.
하지만 적절한 페이지를 찾는 것은 전투의 절반에 불과합니다. 이 논문은 탐정들이 조사를 시작하기 전, 문서를 처리하는 영리한 방법을 소개합니다. 금융 문서는 매우 지저분합니다. "YoY"(전년 대비)나 "EPS"(주당순익)와 같은 약어를 사용하며, 텍스트 단락과 거대한 숫자 표를 혼합하여 사용합니다. 시스템의 첫 번째 단계는 질의(query)와 문서를 "정제(clean)"하는 것입니다. 이 과정은 혼란스러운 약어들을 완전한 단어로 바꾸고, 단위(예: "1M"과 "1,000,000")를 표준화하며, 결정적으로, 그 지저한 표들을 JSON이라는 구조화된 형식으로 변환합니다. 이는 마치 손으로 쓴 스프레드시트를 디지털 데이터베이스로 바꾸어, AI가 어떤 숫자가 어떤 카테고리에 속하는지 헷-갈리지 않도록 만드는 것과 같습니다. 이러한 "사전 정제"를 통해, 시스템은 검색을 시작하기 전에 AI가 질문과 증거를 완벽하게 이해할 수 있도록 보장합니다.
저자들이 사용하는 세 번째 주요 기술은 문서가 AI의 메모리에 한 번에 담기에는 너무 길 때를 대비한 전략입니다. 현대의 AI 모델들이 방대한 양의 텍스트를 읽을 수 있다고 주장하더라도, 이 논문은 텍스트의 길이가 특정 지점(구체적으로는 텍isi 64,000 토큰, 즉 텍스트 길이의 척도)을 넘어서면 AI가 특히 숫자와 관련하여 실수를 하기 시작한다는 것을 발견했습니다. 이를 해결하기 위해, 시스템은 거대한 연회를 준비하는 요리사처럼 행동합니다. 한꺼번에 모든 식사를 하려고 하는 대신, 긴 문서를 두 개의 더 작고 관리 가능한 덩어리로 자릅니다. AI에게 첫 번째 덩어리를 분석하여 초안 답변을 작성하게 하고, 그다음 두 번째 덩어리를 분석하여 또 다른 초안을 작성하게 합니다. 마지막으로, "퓨전(fusion)" 단계에서 이 두 초안을 하나의 최종 답변으로 결합하며, 두 내용이 서로 일치하는지 확인하고 충돌을 해결합니다. 이를 통해 문서가 10만 페이지에 달하는 거대한 보고서라 할지라도 AI가 사실을 놓치지 않도록 보장합니다.
연구진이 몇 가지 유명한 금융 벤치마크(FinQA 및 FinanceBench 등)를 통해 시스템을 테스트했을 때, 결과는 인상적이었습니다. 이 시스템은 올바른 정보를 목록 상단에 얼마나 잘 배치하는지를 측정하는 지표인 NDCG@20에서 0.7918의 점수를 기록했습니다. 이 점수는 특별한 정제 및 2단계 랭킹 방법을 사용하지 않은 시스템보다 유의미하게 높았습니다. 실제로 이 접근 방식은 매우 효과적이어서, 팀이 AI가 금융 데이터를 얼마나 잘 처리할 수 있는지 테스트하도록 설계된 ACM-ICAIF '24 FinanceRAG 챌린지에서 2위를 차지하는 데 기여했습니다. 이 논문은 데이터 정제, 2단계 탐정 팀 활용, 그리고 긴 문서를 영리하게 나누는 기술이라는 세 가지 혁신을 결 조합함으로써, 금융 기관들이 AI가 사실을 지어내거나 소음 속에서 길을 잃는 일 없이, 감사나 투자 분석과 같은 실제 업무에 신뢰할 수 있는 AI 시스템을 구축할 수 있게 된다고 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.