← 최신 논문
💻 computer science

Deterministic multi-hash routing supports long-horizon training in a compact language model

이 논문은 결정론적인 토큰-아이덴티티 기반 멀티 해시 라우팅을 사용하여 전문가를 선택하는 2억 1백만 개의 파라미터를 가진 소형 언차 모델이 장기적 관점의 훈련 작업에서 경쟁력 있는 성능을 달나올 수 있음을 입증하지만, 일치하는 밀집 제어 모델(dense controls)의 부재로 인해 라우팅 메커니즘의 구체적인 기여도는 분리되어 입증되지 않은 채 남아 있다.

원저자: Boris Peyriguere

게시일 2026-08-28
📖 5 분 읽기🧠 심층 분석

원저자: Boris Peyriguere

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서, 연구자들은 언어를 이해하고 세상에 대해 추론할 수 있는 기계를 만들기 위해 끊임없이 노력하고 있습니다. 이를 위해 그들은 디지털 뇌라고 불리는 언어 모델을 만드는데, 이는 본질적으로 방대한 양의 텍스트로부터 패턴을 학습하는 거대한 숫자들의 네트워크입니다. 이러한 모델을 불가능할 정도로 크게 만들지 않으면서도 더 똑똑하게 만들기 위한 흔한 전략은 '전문가 혼합(mixture of experts)'이라 불리는 설계를 사용하는 것입니다. 도서관에서 모든 책을 한 명의 사서가 읽는 대신, 도서관의 각 구역을 서로 다른 전문가들이 담당하는 모습을 상상해 보십시오. 컴퓨터 모델에서 이는 특정 단어에 대해 시스템이 내부 프로세서, 즉 '전문가'라고 불리는 작고 특정한 그룹만을 활성화하고 나머지는 휴면 상태로 둔다는 것을 의미합니다. 보통 컴퓨터는 문장의 맥락을 살펴보고, "이 단어는 어떤 종류이며, 지금 무엇이 필요한가?"라고 스스로에게 물으며 어떤 전문가를 사용할지 결정합니다. 이 의사 결정 과정은 모델이 훈련 중에 스스로 학습하며, 이는 유연하지만 동시에 복잡하고 예측하기 어렵게 만듭니다.

보리스 페이리구에레(Boris Peyriguere)라는 연구자는 다른 길을 탐구하며 단순하지만 대담한 질문을 던졌습니다: 만약 컴퓨터가 어떤 전문가를 사용할지 결정할 필요가 없다면 어떨까? 문장마다 동적인 규칙을 학습하는 대신, 단어 자체에 기반하여 전문가의 선택이 영구적으로 고정된다면 어떨까 하는 질문입니다. 이 새로운 접근 방식에서는 단어의 정체성이 주변의 대화와 상관없이 항상 동일한 두 개의 문을 여는 영구적인 열쇠 역할을 합니다. 이 연구자는 약 2억 1백만 개의 파라미터(모델의 크기와 복잡도를 측정하는 척도)를 가진 컴팩트한 언어 모델을 구축했고, 이 경직되고 미리 결정된 시스템을 사용하여 훈련시켰습니다. 이 모델은 초기 학습 단계에서 약 1,300억 개의 단어에 노출되었고, 이후 320억 개의 단어로 더욱 정교하게 다듬어졌으며, 마지막으로 지시 사항을 따르는 법을 배웠습니다. 결과는 이 고정된 시스템이 장기간 효과적으로 학습할 수 있음을 보여주었으며, 물리적 추론과 상식 테스트에서 놀랍게도 우수한 성능을 발휘하여 다른 방식으로 훈련된 더 큰 규모의 전통적인 모델들을 능가하기도 했습니다.

이 실험의 핵심은 모델이 정보를 처리하는 방식에 있습니다. 표준적인 설정에서 컴퓨터는 최선의 도구를 선택하기 위해 현재 상황을 분석합니다. 페이리구에레의 모델에서 도구는 단어가 보이는 순간, 변하지 않는 사전 계산된 지도에 따라 선택됩니다. 모델의 어휘에 포함된 모든 단어에 대해 특정 쌍의 전문가가 할당되어 있습니다. 이 지도는 훈련이 시작되기 전에 생성되었으며 전체 과정 동안 고정된 상태로 유지되었습니다. 모델은 여전히 모든 단어를 처리하는 공유 경로를 사용하여 맥락을 이해하지만, 추가적인 '잔차(residual)' 처리 능력은 할당된 두 명의 전문가로부터 나옵니다. 이 설계는 복잡성의 한 층을 제거합니다. 모델은 더 이상 정보를 어떻게 라우팅할지 배울 필요가 없으므로 계산 노력을 절약하고 시스템을 검사하기 쉽게 만듭니다. 라우팅 테이블이 정수(integers)로 이루어진 고정된 목록이기 때문에, 누구나 컴퓨터에 문장을 실행해 보지 않고도 특정 단어에 대해 어떤 전문가가 사용될지 직접 확인할 수 있습니다.

훈련 과정은 엄격하고 투명했습니다. 모델은 웹 페이지, 교육 자료, 코드, 수학을 포함한 방대한 텍ilian 텍스트 모음을 읽는 기초 단계부터 시작했습니다. 이 초기 노출 이후, 연구자들은 훈련을 일시 중단하고 새로운 내부 설정을 사용하여 동일한 고유 단어들을 다시 방문함으로써, 정확히 같은 사건의 순서를 반복하지 않으면서도 모델의 이해도를 정교하게 다듬었습니다. 마지막으로, 모델은 질문과 답변의 예시 30만 개를 통해 명령을 따르는 법을 배우는 지시 튜닝(instruction tuning) 과정을 거쳤습니다. 이 전체 여정 동안 고정된 라우팅 시스템은 잘 버텨냈습니다. 모델은 붕괴하거나 학습에 실패하지 않았으며, 대신 문제를 해결하는 능력이 꾸준히 향상되었습니다. 훈련이 끝날 무렵, 모델은 총 1,620억 개 이상의 단어에 노출되었으며, 이는 모델의 크기에 비해 상당한 양의 데이터입니다.

추론 능력에 대한 테스트에서 모델은 견고한 결과를 보여주었습니다. 물리적 상호작용을 측정하는 PIQA 테스트에서 모델은 68.01 퍼센트의 정확도를 달랐습니다. 과학 질문 세트인 ARC-Challenge에서는 27.13 퍼센트를 기록했습니다. 아마도 가장 주목할 만한 점은, 두 가지 다른 과학 질문 세트의 점수를 결합했을 때 모델이 47.29 퍼센트의 결합 정확도에 도달했다는 것입니다. 이 성능은 3억 5천만 개에서 7억 7,400만 개의 파라미터를 가진 훨씬 더 큰 규모의 공개 모델들보다 높았습니다. 이 더 큰 모델들은 동일한 엄격한 규칙과 테스트 방법으로 평가되었음에도 불구하고, 이 더 작고 고정된 라우팅 모델의 성능에 미치지 못했습니다. 이는 고정된 라우팅 시스템의 효율성이 모델이 제한된 크기를 더 잘 활용할 수 있게 했음을 시사합니다.

그러나 연구자는 이 방법이 궁극적인 해결책이라거나 다른 모든 접근 방식보다 확실히 우월하다고 주장하는 데 주의를 기울입니다. 이 연구는 매칭된 전체 규모의 밀집 제어(dense control)나 다중 시드 복제(multi-seed replication)를 포함하지 않는다고 명시적으로 밝히고 있습니다. 이러한 통제된 실험 없이는, 고정된 라우팅이 높은 성능을 유발했는지, 아니면 특정 데이터나 훈련 일정과 같은 다른 요인이 더 큰 역할을 했는지 확실히 말할 수 없습니다. 논문은 고정된 라우팅이 현대의 대부분 시스템에서 사용되는 유연하고 학습되는 라우팅보다 더 낫다는 것을 증명하는 것이 아님을 명시적으로 밝힙니다. 대신, 이 작업은 개념 증명(proof of concept)으로서의 역할을 합니다. 즉, 고정되고 변하지 않는 경로를 가진 모델이 장기간 훈련될 수 있고, 복잡한 과업을 수행할 수 있으며, 고품질의 결과를 만들어낼 수 있음을 보여주는 것입니다.

이 작업의 의의는 단순히 수치를 넘어섭니다. 라우팅 테이블을 모델의 고정되고 감사 가능한 부분으로 만듦으로써, 연구자는 더 검사하고 검증하기 쉬운 시스템을 만들었습니다. 많은 고급 AI 시스템에서 의사 결정 과정은 모델이 학습함에 따라 변화하는 '블랙박스'이며, 이로 인해 특정 결정이 어떻게 내려졌는지 정확히 알기 어렵습니다. 이 모델에서는 경로가 명확하고 변경되지 않습니다. 특정 단어가 어떤 전문가를 활성화할지 알고 싶다면, 단순히 표에서 해당 단어를 찾아보면 됩니다. 이러한 투명성은 모델이 정확히 어떻게 작동하는지 이해해야 하는 연구자나, 시스템이 예측 가능하게 행동하도록 보장하려는 개발자들에게 가치가 있을 수 있습니다. 또한 모델은 고정된 라우팅이 대규모 애플리케이션에서 위험해 보일 수 있었던 문제, 즉 장기간의 훈련 세션 동안 불안정해지지 않고 잘 버틸 수 있음을 보여주었습니다.

궁극적으로, 이 논문은 효율적인 언어 모델을 구축하는 방법에 대한 새로운 관점을 제시합니다. 이는 컴퓨터가 끊임없이 자신의 도구를 선택하는 법을 배워야 한다는 가설에 도전하며, 대신 미리 결정된 정적인 선택이 컴팩트한 모델의 경우 효율성 측면에서 동일하게 혹은 오히려 더 잘 작동할 수 있음을 보여줍니다. 연구자가 공개한 모델은 훈련 코드 및 평가 도구와 함께 다른 사람들이 연구하고 복제할 수 있도록 공개되어 있습니다. 이러한 개방성은 과학계가 다른 데이터를 사용하여 동일한 실험을 실행하거나, 표준 모델과 직접 비교하는 등 연구 결과를 더 깊이 테스트할 수 있게 합니다. 현재로서 이 연구는 더 단순하고 경직된 라우팅 방식이 길고 생산적인 훈련 여정을 지속할 수 있으며, 체급을 뛰어넘는 역량을 가진 투명한 언어 모델을 만들어낼 수 있다는 것을 보여주는 입증 사례로 남아 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →