ScalableRAG: High-Quality RAG at Zero Ingestion Cost
이 논문은 동적인 워크스페이스를 활용하여 즉석에서 집약적 추론을 수행함으로써 인제스션 비용 없이 여러 데이터셋에 걸쳐 우수한 정확도를 달리는 고품질 검색 증강 생성 방식인 ScalableRAG를 소개하며, 또한 최소한의 벡터 데이터베이스 사용량으로 대규모 환경에서의 성능을 더욱 향상시키는 Limited-Ingestion 변형 모델도 함께 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 백만 권의 책이 있는 도서관에서 거대한 미스터리를 풀기 위해 책을 읽고 있다고 상상해 보세요. 인공지능의 세계에서 이것은 **검색 증강 생성(Retrieval-Augmented Generation, RAG)**이라고 불립니다. 표준적인 AI를 인터넷 전체를 읽었지만 먼지 쌓인 기록 보관소의 구체적인 세부 사항은 기억하지 못하는 아주 똑똑한 탐정이라고 생각해 보세요. 탐정을 돕기 위해, 우리는 보통 탐정이 작업을 시작하기 전에 "카드 목록"이나 "지식 그래프"를 구축합니다. 이는 모든 책을 읽고, 요약하고, AI가 적절한 페이지를 빠르게 찾을 수 있도록 복잡한 데이터베이스로 정리하는 과정을 포함합니다. 이는 마치 탐정이 도착하기도 전에 도서관의 색인을 만들기 위해 사서 팀을 고용하여 몇 주 동안 작업하게 하는 것과 같습니다. 이 과정은 비용이 많이 들고, 느리며, 시작 단계에서부터 많은 컴퓨팅 파워를 요구합니다. 하지만 만약 탐정이 미리 만들어진 카탈로그 없이도 도서관에 걸어 들어가 책을 보고 즉석에서 답을 찾아낼 수 있다면 어떨까요? 이것이 바로 이 논문이 다루는 핵심 질문입니다: 우리가 그 거대한 데이터베이스를 구축하기 위한 높은 "수집(ingestion)" 비용을 지불하지 않고도 동일하게 훌륭한 결과를 얻을 수 있을까요?
Hilaf Hasson과 그녀의 팀이 이끄는 Cohesity의 연구원들은 그 대답이 확고한 "예"라고 말합니다. 그들은 ScalableRAG라는 새로운 시스템을 소개하며, 이는 **제로-수집(Zero-Ingestion)**과 **제한적-수집(Limited-Ingestion)**이라는 두 가지 방식으로 제공됩니다. 그들의 주요 발견은 복잡한 질문에 답하기 위해 전체 문서를 미리 처리할 필요가 없다는 것입니다. 대신, 그들의 AI 에이전트는 마법 같고 확장 가능한 클립보드를 들고 다니는 매우 체계적인 탐정처럼 행동합니다. 탐정이 특정 사실을 찾아야 할 때, 단순히 키워드를 검색하는 것이 아니라, 관련 문서들의 일시적인 "그룹"을 만들고, 이를 필터링하며, 그 자리에서 결과에 대해 수학적 계산까지 수행합니다.
이들의 "제로-수집" 방식이 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다: 당신에게 일 년 동안 쇼핑하며 모은 뒤섞인 영수증 뭉치가 있다고 가정해 봅시다. 전통적인 시스템은 당신이 "6월에 기름값으로 얼마를 썼지?"와 같은 질문을 하기 전에, 누군가가 앉아서 모든 영수증을 읽고 라벨이 붙은 폴더(식료품, 주유, 전자제품 등)로 분류해야 합니다. 이 분류 작업은 시간이 너무 오래 걸립니다. 하지만 ScalableRG는 이 분류 과정을 통째로 건너뜁니다. 질문을 던지면, AI는 영수증 더미를 살펴보고 "주유"가 언급된 모든 영수증을 찾은 다음, 그 작은 더미를 다시 "6월"에 해당하는 것들로 필터링하고, 마지막으로 숫자를 모두 더합니다. 이 과정은 실시간으로 문서의 "집합(sets)"을 생성하고 관리함으로써 이루어집니다. 이는 마치 탐정이 영수증을 먼저 파일로 정리할 필요 없이, 즉석에서 관련 영수증에 원을 그려 표시하고, 개수를 세고, 수학 계산을 할 수 있는 것과 같습니다.
이 논문은 이러한 "즉석(on-the-fly)" 접근 방식이 믿기 힘들 정도로 강력하다는 것을 보여줍니다. 정부 청문회 녹취록부터 재무 보고서, 영화 대본에 이르기까지 6개의 서로 다른 문서 컬렉션에 대한 테스트에서, 이들의 제로-수집 시스템은 6개 데이터셋 중 3개(MuSiQue, Transcripts, Hotels)에서 모든 베이스라인(지식 그래프 방식 포함)을 가뿐히 능가했습니다. 나머지 3개 데이터셋(2Wiki, FinanceBench, ComplexTR)에서는 최대 성능에 아주 근소하게 미치지 못했는데, 각 데이터셋의 최고 성능 베이스라인(A-RAG)과 평균적으로 단 1.63% 차이만을 보였습니다. 이 절반의 데이터셋에서 나타난 미세한 차이에도 불구하고, 이 시스템은 모든 6개 데이터셋에 걸친 평균 정확도가 그다음으로 경쟁력 있는 베이스라인보다 약 7.36% 더 높았습니다. 이는 많은 유형의 질문에 대해, 비싼 비용을 들여 데이터베이스를 미리 구축하는 단계가 실제로 불필요할 수 있음을 시사하기 때문에 매우 중요한 성과입니다.
더 까다로운 질문들을 위해 시스템을 더욱 개선하고자, 그들은 "제한적-수집" 버전도 구축했습니다. 이것은 탐정에게 가장 흔한 유형의 단서들에 대한 작은 사전 제작 인덱스를 제공하되, 여로 핵심적인 작업은 여전히 즉석에서 수행하도록 하는 것과 같습니다. 이 버전은 약간의 사전 처리(패턴을 찾기 위한 문서 샘사의 활용)와 작은 벡터 데이터베이스(단순히 정확한 단어가 아닌 유사한 아이디어를 찾는 도구)를 사용합니다. 이 하이브리드 접근 방식은 특히 호텔 설명에서 특정 시설을 찾거나 법률 계약서에서 특정 조항을 찾는 것과 같이, 정보가 복잡한 구조 속에 숨겨져 있는 데이터셋에서 정확도를 더욱 높였습니다.
이 논문은 복잡한 다단계 질문에 답하기 위해 반드시 거대한 사전 처리된 지식 그래프나 전체 SQL 데이터베이스를 구축해야 한다는 생각에 명시적으로 반박합니다. 그들은 사용자가 질문을 던지기도 전에 LLM이 모든 문서를 읽고 데이터를 추출해야 하는 "수집 집약적(ingestion-heavy)" 방식이 종종 과잉 대응(overkill)임을 보여줍니다. 그러한 방식들이 데이터를 그룹화하는 데는 유용할지 모르지만, ScalableRAG는 에이전트가 대화 중에 즉각적으로 동일한 그룹화와 수학 계산을 수행할 수 있음을 입증합니다. 저자들은 별도의 AI가 판사 역할을 하여 답변을 채점하는 엄격한 테스트 방법을 통해 결과를 측정함으로써 이 결과에 대해 매우 확신하고 있습니다. 그들은 자신들의 시스템이 돈과 시간을 절약할 뿐만 아니라, 값비싼 대안들보다 정답을 더 자주 맞히거나, 훨씬 적은 노력으로 그에 근접한 결과를 낸다는 것을 발견했습니다.
요약하자면, ScalableRAG는 건초더미 속에서 바늘을 찾기 위해 거대한 조직화된 지식 창고를 지을 필요가 없다는 것을 보여줌으로써 판도를 바꾸고 있습니다. 대신, 당신은 건초더미 속에서 바늘을 잡고, 분류하고, 셀 수 있는 마법 같은 도구를 갖춘 똑똑한 에이전트를 그곳으로 보낼 수 있습니다. 설정 비용이 전혀 들지 않는 "제로-수집" 방식이든, 추가적인 정밀도를 위해 약간의 사전 작업을 더하는 "제한적-수집" 방식이든, 이 연구는 AI 질의응답의 미래가 우리가 생각했던 것보다 훨씬 더 단순하고, 빠르며, 저렴할 수 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.