Giga-Embeddings: Mixture-of-Experts Encoders for High-Throughput Text Embeddings
이 논문은 여러 언어에 걸쳐 최첨단 검색 품질과 높은 처리량을 달성하는 희소(sparse) 10B 파라미터 혼합 전문가(Mixture-of-Experts) 인코더를 특징으로 하는 텍el 임베딩 모델 제품군인 Giga-Embeddings를 소개하며, 이와 함께 자원이 제한된 환경에 최적화된 더 작은 밀집(dense) 및 증류(distilled) 변형 모델들도 함께 선보인다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 세상에서 컴퓨터는 인간처럼 단어를 이해하지 못합니다. 기계에게 문장은 그저 긴 기호의 나열일 뿐입니다. 텍스트를 이해하기 위해 연구자들은 단어를 숫자의 목록으로 변환하는 방법인 '임베딩(embeddings)'을 개발했습니다. 이 숫자 목록을 모든 텍스트에 부여된 고유한 주소라고 생각하면 됩니다. 이는 유사한 아이디어는 서로 가깝게 위치하고 서로 다른 아이디어는 멀리 떨어져 있는 거대한 다차원 공간 속에 텍고를 배치합니다. 이 시스템은 적절한 문서를 찾아내는 검색 엔진부터 텍스트 라이브러리를 기반으로 질문에 답하는 인공지능에 이르기까지 우리가 매일 사용하는 도구들의 동력이 됩니다. 그러나 이 분야에는 지속적인 긴장 상태가 존재합니다. 시스템이 더 복잡할수록 언어를 더 잘 이해하게 되지만, 실행하는 데 더 많은 컴퓨터 전력과 메모리가 필요하다는 점입니다. 이러한 시스템을 지능을 잃지 않으면서도 더 빠르고 저렴하게 만드는 것은 과학자들에게 주요한 과제였습니다.
한 연구팀은 높은 품질과 높은 속도의 균те를 맞춤으로써 이 문제를 해결하기 위해 설계된 '기가-임베딩(Giga-Embeddings)'이라는 새로운 텍스트 임베딩 모델 제품군을 선보였습니다. 이들의 가장 야심 찬 창조물은 내부 복잡성을 나타내는 척도인 100억 개의 파라미터를 가진 거대 모델입니다. 이 모델은 모든 단어를 처리하기 위해 100억 개의 파라미터를 모두 사용하는 대신, '전문가 혼합(mixture of experts)'이라고 불리는 기술을 사용합니다. 거대한 도서관에서 이용자가 책을 요청할 때마다 특정 소규모 사서 팀만이 호출되고 나머지 직원들은 대기 상태로 남아 있는 모습을 상상해 보십시오. 이 컴퓨터 모델에서는 각 단어에 대해 약 18억 개의 파라미터만 활성화되는 반면, 전체 100억 개는 메모리에 상주해 있습니다. 이를 통해 시스템은 거대한 뇌의 지식을 보유하면서도, 매 순간에는 더 작은 뇌의 작업량만을 수행할 수 있습니다.
연구진은 이 거대 모델을 30억 개의 파라미터를 가진 표준 밀집(dense) 모델과 4억 8천만 개의 파라미터를 가진 더 작은 증류(distilled) 버전 등 여러 모델과 비교 테스트했습니다. 그들은 영어, 러시아어, 다국어 텍스트 및 컴퓨터 코드를 포함한 광범위한 작업들을 통해 시스템을 평가했습니다. 결과에 따르면, 이 거대 희소(sparse) 모델은 이 모든 범주에서 가장 높은 종합 성능을 달 나타냈습니다. 이 모델은 더 작은 모델들보다 텍스트를 더 잘 이해했을 뿐만 아니라 정보 처리 속도도 더 빨랐습니다. 시스템이 초당 처리할 수 있는 단어 수를 측정했을 때, 100억 개의 파라미터 모델은 30억 개의 파라미터 모델보다 25% 더 빨랐으며, 동일한 환경에서 테스트된 다른 고급 시스템들보다 현저히 빨랐습니다. 이는 엄청난 용량을 가지면서도 운영 측면에서 매우 효율적인 시스템을 구축하는 것이 가능하다는 것을 입증합니다.
컴퓨팅 능력이 낮은 기기에서도 이러한 강력한 도구들을 사용할 수 있도록, 연구팀은 훨씬 작은 버전의 모델도 제작했습니다. 그들은 '유사도 분포 증류(similarity-distribution distillation)'라는 방법을 사용하여 이 소형 모델을 학습시켰습니다. 이 소형 모델은 거대한 스승 모델의 내부 수치를 똑같이 복제하려고 노력하는 대신, 서로 다른 텍스트 조각들이 얼마나 유사한지에 대한 거대 모델의 최종 판단을 모방하도록 학습되었습니다. 이를 통해 단 4억 8천만 개의 파라미터만을 가진 이 소형 모델은 훨씬 더 큰 30억 개의 파라미터 모델과 거의 대등한 성능을 발휘할 수 있었습니다. 러시아어 텍스트 테스트에서 이 소형 모델은 자신보다 거의 두 배나 큰 유명 경쟁 모델보다 약간 더 높은 점수를 기록하며, 올바른 방식으로 가르친다면 더 작은 시스템도 매우 효과적일 수 있음을 보여주었습니다.
연구팀은 이 세 가지 버전의 모델을 모두 공개하여 다른 사람들이 다양한 용도로 사용할 수 있도록 했습니다. 그들은 거대 희소 모델이 긴 텍스트를 처리하는 데 특히 효과적이며, 입력값이 길어져도 속도를 유지한다는 것을 발견했습니다. 소형 모델들은 저장하는 데 필요한 메모리는 적었지만, 거대 모델은 중량급 작업에 대해 속도와 정확성의 최적의 조합을 제공했습니다. 연구진은 자신들의 측정치가 특정 테스트 환경에서 이루어졌으므로, 실제 환경에서는 하드웨어에 따라 성능이 약간 달라질 수 있다고 언급했습니다. 그럼에도 불구하고, 이 연구는 스마트한 구조적 선택과 세심한 학습 방법을 사용함으로써, 복잡한 작업을 처리할 만큼 강력하면서도 현대의 컴퓨터에서 빠르게 실행될 수 있을 만큼 효율적인 텍스트 이해 시스템을 만들 수 있다는 명확한 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.