← 최신 논문
💬 NLP

LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum

이 논문은 MTEB 벤치마크에서 최첨단 검색 성능을 달성하는 동시에 메모리 사용량을 크게 줄이고 일반적인 CPU 하드웨어에서의 효율적인 배포를 가능하게 하는, Llama3 기반의 2단계 학습 커리큘럼을 채택한 학습된 희소 검색기(learned sparse retriever) 제품군인 LACONIC을 소개한다.

원저자: Zhichao Xu, Shengyao Zhuang, Crystina Zhang, Xueguang Ma, Yijun Tian, Maitrey Mehta, Jimmy Lin, Vivek Srikumar

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhichao Xu, Shengyao Zhuang, Crystina Zhang, Xueguang Ma, Yijun Tian, Maitrey Mehta, Jimmy Lin, Vivek Srikumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 세계의 거대한 디지털 도서관에서 수십억 개의 문서 중 특정 정보를 찾는 일은 단순히 키워드를 맞추는 것 이상의 작업이 필요합니다. 수년 동안 이 작업을 수행해 온 가장 강력한 도구들은 "밀집형(dense)" 검색에 의존해 왔습니다. 이 도구들을 모든 질문과 문서를 길고 복잡한 숫자 목록으로 변환하여 단어 뒤에 숨겨진 미묘한 의미와 맥락을 포착하는 번역기라고 상상해 보십시오. 이러한 시스템은 매우 정확하지만, 또한 매우 무겁습니다. 이들은 이 숫자 목록을 저장하기 위해 방대한 양의 컴퓨터 메모리를 요구하며, 이를 빠르게 검색하기 위해 특수하고 값비싼 하드웨어를 필요로 합니다. 이는 병목 현상을 일으킵니다. 즉, 최고의 검색 결과는 종종 높은 에너지 사용과 비싼 인프라라는 대가를 치러야 하며, 이는 이러한 강력한 도구들이 사용될 수 있는 범위를 제한합니다.

연구자들은 오랫동안 이러한 복잡한 시스템의 똑똑한 이해력은 유지하면서도 무거운 짐은 덜어낼 수 있는 절충안을 찾아왔습니다. 여기서 "희소형(sparse)" 검색이 등장합니다. 모든 문서에 대해 긴 밀집 숫자 목록을 만드는 대신, 희소형 시스템은 가장 중요한 단어들만을 강조하여 대부분이 비어 있는 표현을 만듭니다. 이를 통해 전통적인 도서관 카탈로그처럼 일반적인 컴퓨터 프로세서에서도 실행될 수 있는 단순하고 효율적인 구조를 사용할 수 있습니다. 그러나 지금까지 이러한 효율적인 시스템은 일반적으로 무거운 밀집형 시스템보다 정확도가 떨어졌습니다. 과제는 효율적인 시스템을 강력한 시스템과 경쟁할 수 있을 만큼 똑똑하게 만드는 것이었습니다.

한 연구팀이 이제 이 간극을 성공적으로 메우는 LACONIC이라는 새로운 접근 방식을 선보였습니다. 특정 유형의 대규모 언어 모델과 정교하게 설계된 2단계 학습 과정을 결합함으로써, 그들은 매우 정확하면서도 놀라울 정도로 효율적인 검색 시스템을 만들어냈습니다. 그들의 연구는 선도적인 시스템이 요구하는 것보다 훨씬 적은 메모리를 사용하여 표준 컴퓨터 하드웨어에서 최상위 수준의 검색 성능을 달야내는 것이 가능하다는 것을 입증했습니다.

이 성과의 핵심은 연구진이 시스템에게 생각하는 법을 가르친 방식에 있습니다. 그들은 먼저 문장에서 다음 단어를 예측하도록 설계된 일종의 인공지능인 강력한 언어 모델로 시작했습니다. 이러한 모델은 본래 텍고를 처음부터 끝까지 한 방향으로 읽도록 구축되어 있습니다. 하지만 검색 쿼리와 문서 사이의 관계를 이해하려면 시스템은 전체적인 그림을 한꺼번에 보아야 합니다. 연구진은 먼저 이 단방향 모델을 양방향으로 문맥을 이해하도록 적응시켜, 단어들이 문장 전체에서 서로 어떻게 연관되는지 볼 수 있게 했습니다. 그 후, 모델이 희소한 표현, 즉 가장 관련 있는 용어들에만 집중하는 목록을 생성하도록 훈련시켜, 모델이 간결하고 정확해지도록 가르쳤습니다.

시스템이 효과적으로 학습할 수 있도록 팀은 2단계 학습 커리큘럼을 채택했습니다. 첫 번째 단계에서 그들은 모델을 방대한 양의 일반적이고 노이즈가 섞인 데이터에 노출시켰습니다. 이 단계는 완벽한 답을 찾는 것이 아니라, 모델이 언어의 기본 구조를 이해하고 광범위한 의미에서 관련성을 식별하는 법을 돕는 과정이었습니다. 이는 모델이 특정 검색 작업을 처리할 수 있도록 준비시키는 적응 과정이었습니다. 두 번째 단계에서 훈련은 훨씬 더 엄격해졌습니다. 연구진은 모델에게 어려운 예시들을 제공했는데, 특히 쿼리와 비슷해 보이지만 실제로는 정답이 아닌 문서들을 쌍으로 보여주었습니다. 이는 모델이 진정으로 관련 있는 문서와 혼란을 주는 문서를 구별하는 미묘한 차이를 배우도록 강제했습니다. 이러한 광범적인 적응에 이은 고도의 정교화의 결합을 통해 시스템은 희소 검색의 기술을 숙달할 수 있었습니다.

이러한 접근 방식의 결과는 놀랍습니다. 80억 개의 파라미터를 사용하는 가장 큰 버전의 시스템은 검색 효과성에 대한 표준 벤치마크에서 60.2점을 기록했습니다. 이 성능은 특수 하드웨어를 필요로 하는 가장 강력한 밀집 모델들과 경쟁할 수 있는 최고 수준의 시스템 중 하나로 자리매김하게 합니다. 특히 주목할 점은 효율성 측면의 이득입니다. 유사한 밀집 모델이 인덱스를 저장하는 데 거의 135GB의 메모리를 필요로 하는 반면, 새로운 희소 시스템은 약 35GB만을 필요로 합니다. 이는 메모리 사용량이 약 74% 감소했음을 나타냅니다. 결과적으로, 이 시스템은 고성능 검색에 통상적으로 필요한 그래픽 카드가 없어도 일반적인 컴퓨터 프로세서에서 실행될 수 있습니다.

연구진은 또한 시스템이 데이터를 검색하는 속도를 조사했습니다. 그들은 이 새로운 방법이 기존 옵션들과 비교했을 때 속도와 정확도 사이에서 우수한 균�형을 제공한다는 것을 발견했습니다. 이 시스템은 표준 하드웨어를 사용하여 대규모 문서 컬렉션을 빠르게 검색할 수 있으며, 특수 장비에서 복잡한 계산을 실행하는 데 따르는 지연과 비용을 피할 수 있습니다. 시스템이 사용자의 질문을 이해할 수 있는 형식으로 변환하는 데는 약간의 시간이 걸리지만, 실제 검색 과정은 빠르고 효율적입니다. 연구팀은 다른 시스템들이 광범위하게 훈련된 특정 좁은 데이터셋에서는 자신들의 모델이 약간 덜 효과적이었지만, 다양한 일반 검색 작업에서는 기존의 많은 체계들을 능가했다는 점을 언급했습니다. 이는 이 접근 방식이 새로운 유형의 정보에 일반화하는 데 특히 강점이 있음을 시사합니다.

이 연구는 높은 성능을 내려면 반드시 높은 자원 비용이 수반되어야 한다는 지배적인 가설에 도전합니다. 희소 시스템이 훨씬 적은 메모리와 컴퓨팅 파워를 사용하면서도 밀집 시스템의 효과성에 필적할 수 있음을 보여줌으로써, 연구진은 검색 기술의 새로운 길을 열었습니다. 최소한의 단어로 최대의 충격을 전달한다는 의미를 담아 명명된 LACONIC 시스템은 효율성과 규모가 반드시 서로 상충하는 힘은 아니라는 것을 증명합니다. 이는 강력하고 지능적인 검색 도구가 일상적인 하드웨어에서도 배포될 수 있는 미래를 암시하며, 고품질의 정보 접근을 더 확장 가능하고 접근 가능하게 만들 수 있음을 보여줍니다. 연구진은 자신들의 코드와 훈련된 모델을 공개하여, 다른 이들이 이 토대 위에서 구축하고 효율적인 대규모 검색의 잠재력을 더욱 탐구할 수 있도록 초대했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →