← 최신 논문
💬 NLP

Scaling Embeddings Outperforms Scaling Experts in Language Models

이 논문은 Mixture-of-Experts(MoE) 방식의 전문가 확장보다 임베딩(Embedding) 규모를 키우는 것이 효율성 측면에서 더 우수할 수 있음을 입증하며, 이를 통해 성능과 추론 속도를 모두 잡은 68.5B 규모의 모델인 'LongCat-Flash-Lite'를 제안합니다.

원저자: Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong Si, Yerui Sun, Rumei Li, Peng Pei, Yuchen Xie, Xunliang Cai

게시일 2026-02-12
📖 2 분 읽기☕ 가벼운 읽기

원저자: Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu, Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong Si, Yerui Sun, Rumei Li, Peng Pei, Yuchen Xie, Xunliang Cai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 핵심 요약: "전문가를 늘릴 것인가, 사전(Dictionary)을 키울 것인가?"

지금까지 인공지능을 똑똑하게 만드는 가장 유행하는 방법은 **'전문가(Experts) 늘리기'**였습니다. 인공지능 안에 수많은 분야의 전문가(MoE 방식)를 넣어두고, 질문이 들어오면 관련 있는 전문가만 불러서 답하게 하는 방식이죠.

하지만 이 논문은 새로운 제안을 합니다. **"전문가를 계속 늘리는 건 효율이 떨어진다. 차라리 단어의 뜻과 맥락을 담은 '거대한 사전(Embedding)'을 키우는 게 훨씬 이득이다!"**라는 것입니다.


🎨 비유로 이해하기: "천재 요리사 vs. 끝판왕 레시피 북"

인공지능을 **'요리사'**라고 상상해 봅시다.

1. 기존 방식: 전문가(Experts) 늘리기 (MoE)

요리 실력을 키우기 위해 주방에 **'한식 전문가', '중식 전문가', '양식 전문가'**를 계속 고용하는 방식입니다.

  • 문제점: 요리사가 너무 많아지면 주방이 북적거리고(메모리 문제), 요리사들끼리 서로 부딪히며 소통하는 데 시간이 너무 오래 걸립니다(시스템 병목 현상). 게다가 요리사를 무한정 늘린다고 해서 요리 실력이 비례해서 늘지도 않습니다.

2. 이 논문의 방식: 거대한 사전(N-gram Embedding) 키우기

요리사를 무작정 늘리는 대신, **'세상의 모든 식재료와 조리법이 적힌 엄청나게 두꺼운 마법 레시피 북'**을 주는 방식입니다.

  • 장점: 이 책은 단순히 '소금'이라고만 적힌 게 아니라, "소금 + 후추 + 고기"가 만났을 때 어떤 맛이 나는지(N-gram 맥락)를 아주 상세하게 적어놓았습니다. 요리사는 요리사를 새로 고용할 필요 없이, 이 책만 빠르게 훑어봐도 엄청난 요리를 만들어낼 수 있습니다. 주방은 여전히 넓고 쾌적하면서도(효율성), 요리의 깊이는 훨씬 깊어집니다(성능).

🛠️ 이 논문이 발견한 '꿀팁' (연구 결과)

연구팀은 이 '마법 레시피 북(Embedding)'을 만들 때 주의할 점들을 찾아냈습니다.

  1. 적당한 비율이 중요하다: 레시피 북이 너무 두꺼워져서 요리사(전문가)를 아예 없애버리면 안 됩니다. 전체 예산의 50% 정도를 레시피 북에 쓰는 게 가장 효율적입니다.
  2. 단어의 조합(N-gram)을 읽어라: 단어 하나하나만 보지 말고, "사과"와 "먹다"가 붙었을 때의 맥락을 통째로 저장해야 합니다.
  3. 충돌을 피하라: 책의 페이지 번호를 매길 때, 비슷한 단어들이 같은 페이지에 몰려 있으면 헷갈리겠죠? 이를 방지하기 위해 번호를 아주 똑똑하게 매기는 법을 찾아냈습니다.
  4. 목소리를 키워라(Amplification): 레시피 북의 정보가 너무 작으면 요리사가 무시할 수 있습니다. 그래서 레시피의 내용을 요리사 귀에 꽂히도록 **'강조(Scaling)'**해주는 기술을 썼습니다.

🚀 결과: "LongCat-Flash-Lite"의 탄생

이 원리를 적용해 만든 모델이 바로 **'LongCat-Flash-Lite'**입니다.

  • 성능: 기존 방식(전문가만 늘린 모델)보다 훨씬 똑똑합니다. 특히 **코딩(Coding)**이나 복잡한 업무 수행(Agentic tasks) 능력이 압도적으로 좋아졌습니다.
  • 속도: 전문가를 불러오는 복잡한 과정이 줄어들었기 때문에, 인공지능이 대답하는 속도가 매우 빠르고 효율적입니다.

💡 한 줄 결론

"인공지능을 똑똑하게 만들 때, 머릿수(전문가)만 늘리지 말고, 맥락을 담은 지식의 기초(임베딩)를 탄탄하고 거대하게 쌓는 것이 훨씬 효율적이다!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →