← 최신 논문
💻 computer science

The Embedder's Dilemma: LLMs Are Better, but at What Cost?

이 논문은 거대 언어 모델과 특화된 임베딩 모델이 37개 태스크에 걸쳐 유사한 총체적 성능을 달ama는 반면, 임베딩 모델이 비용과 속도 측면에서 압도적으로 우수하다는 점을 입증하며, 임베딩 모델은 유사도 및 분류 태스크를 담당하고 LLM은 추론 집약적인 검색 작업에 남겨두는 분업 체계를 제안한다.

원저자: Adnan El Assadi, Niklas Muennighoff, Jinhyuk Lee

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Adnan El Assadi, Niklas Muennighoff, Jinhyuk Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 건초더미 속에서 특정한 바늘 하나를 찾으려고 노력하고 있다고 상상해 보십시오. 인공지능의 세계에서 이 '바늘'은 정보의 한 조각이며, '건초더미'는 거대한 텍스트 데이터베이스입니다. 수년 동안 이를 수행하는 표준적인 방법은 **임베딩 모델(embedding model)**이라는 특화된 도구를 사용하는 것이었습니다. 이 모델들을 책을 직접 읽지는 않지만, 모든 문서에 그 전반적인 분위기에 기반한 고유한 '색상 코드'(벡터)를 즉각적으로 부여하는 매우 빠른 사서라고 생각하십시오. 여러분이 질문을 던지면, 이들은 일치하는 색상 코드를 가진 문서들을 찾아냅니다. 이는 믿을 수 없을 정도로 빠르고 저렴하지만, 책의 표지만 보고 판단하는 것과 같아서 내부의 깊고 복적인 의미를 놓칠 수도 있습니다.

최근에는 **대규모 언어 모델(LLM)**이라는 새로운 종류의 AI 도구가 엄청난 인기를 끌고 있습니다. 이들은 이야기를 쓰거나, 수학 문제를 풀거나, 대화를 나눌 수 있는 '천재적인' 모델들입니다. 이들이 매우 똑똑하기 때문에 사람들은 다음과 같은 의문을 갖기 시작했습니다. "우리는 왜 단순히 전체 건초더미를 실제로 '읽고' 이야기를 이해할 수 있는 천재를 두고, 빠르고 단순한 사서를 사용해야 하는가?" 큰 질문은 이것이었습니다. "우리는 더 나은 결과를 얻기 위해 우리의 빠르고 저렴한 사서를 이 비싸고 느린 천재들로 교체할 수 있을까?" 이 논문은 바로 이 딜레마를 파고들며, 이 '천재적'인 접근 방식이 과연 그 막대한 비용을 지불할 만큼 가치가 있는지, 아니면 여전히 '사서'가 대부분의 작업에 더 적합한 선택인지 테스트합니다.

연구진은 현존하는 가장 똑똑한 10개의 LLM과 26개의 가장 우수한 특화 임베딩 모델 간의 거대한 맞대결을 설정했습니다. 그들은 이들을 이메일 주제 분류부터 수많은 문서 속에서 정답 찾기까지 37가지의 서로 다른 도전 과제에 투입했습니다. 결과는 다소 충격적이었습니다. 총합 결과, 두 유형의 AI는 사실상 동등했습니다. 가장 똑똑한 LLM(Gemini 3.1 Pro)은 77.6점을 기록했고, 가장 우수한 임베딩 모델(Octen-8B)은 77.2점을 기록했습니다. 이 0.4점이라는 미세한 차이는 통계적 노이즈라고 할 수 있을 만큼 매우 작습니다.

하지만 이 무승부는 커다란 비밀을 숨기고 있습니다: 바로 비용입니다. 그 미세한 0.4점의 우위를 점하기 위해, LLM을 테스트하는 데 154달러가 들었던 반면, 임베딩 모델은 단 0.11달러밖에 들지 않았습니다. 이는 LLM을 동일한 작업에 사용하는 데 임베딩 모델보다 1,431배 더 많은 비용이 들었다는 것을 의미합니다. 이는 마치 우편물을 분류하기 위해 노벨상 수상자 팀을 고용하는 것과 같습니다. 단돈 1페니로 일을 처리할 수 있는 분류 기계를 가진 인턴 한 명을 쓰는 대신 말입니다. 논문은 또한 LLM이 훨씬 더 느리며, 동일한 컴퓨터 하드웨어에서 임베딩 모델보다 텍나 텍스트를 처리하는 속도가 2.5배에서 최대 736배까지 느리다는 것을 발견했습니다.

또한 연구진은 '천재적'인 LLM들이 항상 천재인 것은 아니며, 특정 작업에만 능숙하다는 사실을 발견했습니다. 복잡한 법률 계약을 이해하거나 서로 다른 문서들 사이의 점들을 연결하여 답을 찾아야 하는 것과 같이 깊은 추론이 필요한 작업에서는 LLM이 앞서 나갔습니다. 하지만 이메일을 분류하거나, 유사한 주제를 그룹화하거나, 두 문장이 같은 의미인지 확인하는 것과 같은 작업에서는 특화된 임베딩 모델이 실제로 더 낫거나 비슷했습니다. 사실, 논문은 LLM이 종종 '과하게 생각(overthinking)'하고 있다는 것을 발견했습니다. 연구진이 LLM에게 문제를 해결하기 위해 많은 양의 추가 텍스트를 생성하는 '생각(thinking)' 모드를 사용하지 말라고 지시했을 때, 모델들은 실제로 일부 작업에서 더 나은 성능을 보였으며 엄청난 양의 비용을 절감했습니다. 이는 추가적인 추론이 항상 필요한 것은 아님을 증명합니다.

그렇다면 최종 판결은 무엇일까요? 논문은 우리가 단지 가장 화려한 최신 도구로 바꾸기만 해서는 안 된다고 제안합니다. 대신, 하이브리드 접근 방식을 사용해야 합니다. 먼저 빠르고 저렴한 임베딩 모델을 사용하여 건초더미를 빠르게 좁히고 가장 유력한 후보들을 찾아내십시오. 그러고 나서, 질문이 정말 어렵고 깊은 사고를 필요로 한다면, 그때 비로소 비싼 LLM을 불러와 그 상위 몇 개의 후보들을 읽게 하여 최종 답변을 내놓게 하는 것입니다. 이렇게 하면 여러분은 두 가지 장점을 모두 얻을 수 있습니다. 즉, 사서의 속도와 저렴한 비용, 그리고 정말 필요할 때만 사용하는 천재의 깊은 추론 능력을 모두 갖추게 됩니다. 논문은 결론적으로 대부분의 일상적인 작업에는 특화된 임베딩 모델이 여전히 챔피언이며, 값비싼 LLM은 우리가 가장 어려운 퍼즐을 풀 때만 사용해야 할 사치품이라고 밝히고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →