← 최신 논문
🤖 AI

EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs

EntropyMoE는 고정된 토크나이저에 의존하지 않고 엔트로피와 길이에 따라 바이트 수준의 패치를 전문화된 전문가에게 동적으로 라우팅함으로써, 우수한 압축 효율성과 대등한 정확도를 달양하는 토크나이저 프리 대규모 언어 모델을 위한 엔트로피 인식 혼합 전문가 아키텍처를 도입한다.

원저자: Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang

게시일 2026-08-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 글을 읽는 법을 가르치려 한다고 상상해 보세요. 오랫동안 이를 위한 가장 좋은 방법은 모든 문장을 미리 정해진 '덩어리'인 토큰으로 나누는 것이었습니다. 마치 피자를 서빙하기 전에 고정된 조각으로 미리 잘라두는 것과 같습니다. 하지만 만약 로봇이 원재료, 즉 개별 글자나 바이트를 직접 읽을 수 있다면 어떨까요? 이것이 바로 '토oken-free(토크나이저가 없는)' 모델의 세계입니다. 이들은 미리 잘려 있는 재료를 사용하는 요리사가 아니라, 식재료 전체를 다루며 질감이 얼마나 까다로운지에 따라 매 순간 조각의 크기를 결정하는 요리사와 같습니다. 채소가 질기면(불확실하면) 아주 작은 조각을 가져가고, 부드러우면(예측 가능하면) 큰 조각을 가져가는 식이죠. 이는 읽기 과정을 훨씬 더 유연하게 만듭니다.

하지만 함정이 있습니다. 비록 이 로봇들이 텍-스트를 가변적인 크기의 조각으로 나눌 만큼 똑똑할지라도, 일단 도마 위에 올라온 조각은 모두 똑같이 취급한다는 점입니다. 그들은 단순하고 지루한 단어를 처리할 때나 복잡하고 혼란스러운 단어를 처리할 때나 똑같은 양의 뇌 에너지를 사용합니다. 이는 마치 100명의 천재 팀을 고용해 수학 문제를 풀게 하면서, 문제가 "2+2"이든 "양자 물리학"이든 상관없이 100명 모두가 모든 문제에 매달리게 하는 것과 같습니다. 엄청난 에너지 낭비죠. 과학자들이 던지는 큰 질문은 이것입니다. "쉬운 문제에는 불필요한 인력을 낭비하지 않고, 적재적소에 딱 맞는 전문가만을 불러들여 로봇을 더 똑똑하게 만들 수는 없을까?"

이것이 바로 논문 "EntropyMoE"가 다루는 내용입니다. 연구진은 AI 전문가 팀을 위한 초효율적인 관리자 역할을 하는 EntropyMoE라는 새로운 시스템을 구축했습니다. 이 관리자는 텍스트 덩어리의 전체적이고 복잡한 의미를 파악하여 누구에게 일을 맡길지 결정하는 대신, 오직 하나의 단순한 숫자, 즉 **엔트로피(entropy)**만을 살펴봅니다. 일상적인 용어로 여기서 엔트로피는 '놀라움'이나 '불확실성'의 척도입니다. 텍스트 조각이 매우 예측 가능하다면(낮은 엔트로피) 관리는 그것이 쉽다는 것을 압니다. 반대로 놀라움으로 가득 차 있다면(높은 엔로피) 그것은 어렵다는 것을 알죠.

마법은 관리자가 이 "놀라움 점수"를 사용하여 8명의 전문가 팀 중 정확히 2명을 골라 각 텍스트 덩어리를 처리하게 할 때 일어납니다. 가장 멋진 점은, 관리자가 이 결정을 내리기 위해 텍스트 전체를 읽을 필요가 없으며, 오직 그 하나의 "놀라움" 숫자만 있으면 된다는 것입니다. 이는 클럽 입장을 결정할 때 손님의 인생 전체를 인터뷰하는 대신, 신분증만 확인하는 보안 요원과 같습니다. 이렇게 함으로써 시스템은 엄청난 양의 컴퓨터 메모리와 처리 능력을 절약합니다. 테스트에서 EntropyMoE 시스템은 이러한 라우팅 결정을 내리는 데 단 400개의 작은 파라미터만을 사용한 반면, 기존 방식은 동일한 작업을 수행하는 데 400,000개 이상의 파라미터를 필요로 했습니다.

결과는 인상적이었습니다. 이 새로운 시스템을 모든 사람이 모든 일에 투입되는 기존의 "밀집형(dense)" 모델 및 다른 스마트 라우팅 모델들과 비교했을 때, EntropyMoE는 다음 바이트를 예측하는 데 있어 가장 정확한 성능을 보였습니다. "바이트당 비트(bits per byte)"로 측정했을 때 가장 적은 실수를 기록했습니다. 비록 특정 퀴즈인 'HellaSwag'와 같은 특정 게임에서 경쟁 상대를 완전히 압도하지는 못했지만(거기서도 약간 더 나은 성적을 거두긴 했습니다), "놀라움"을 가이드로 사용하는 것이 승리 전략임을 증명했습니다. 논문은 이 접근 방식이 더 똑똑한 AI를 구축하는 견고하고 효율적인 방법이라고 제안하지만, 연구진은 현재 버전이 "전문가 교체"에 시간이 조금 더 걸리기 때문에 기존의 더 단순한 모델들보다 실행 속도가 다소 느리다는 점을 인정했습니다. 궁극적으로, 그들은 누가 일을 할지 결정하는 데 반드시 초복잡한 두뇌가 필요한 것은 아니며, 때로는 텍스트가 얼마나 놀라운지를 측정하는 단순한 척도만으로도 전문가 팀을 조직하기에 충분하다는 것을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →