← 최신 논문
🤖 AI

Dynamic Multi-Byte Prediction With Hierarchical Language Models

이 논문은 가변 길이 예측 윈도우와 인과성을 보존하는 어텐션 마스킹 기법을 통해 여러 바이트를 병렬로 생성함으로써 추론 속도를 가속화하고, 파라미터 추가 없이 성능과 처리량 사이의 최적의 절충점을 달성하는 바이트 수준 계층적 언어 모델을 위한 새로운 기술인 멀티 바이트 예측(Multi-Byte Prediction, MBP)을 소개한다.

원저자: Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant, Tomasz Limisiewicz, Sachin Kumar

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant, Tomasz Limisiewicz, Sachin Kumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간의 언어를 이해하고 생성하는 컴퓨터는 글쓰기 보조 도구에서 번역 도구에 이르기까지 현대 생활의 필수적인 요소가 되었습니다. 이러한 시스템의 핵심에는 근본적인 과제가 자리 잡고 있습니다. 바로 어떻게 하면 인간의 말과 글이 가진 무한한 다양성을 기계가 처리할 수 있는 관리 가능한 조각들로 나눌 것인가 하는 점입니다. 수년 동안 표준적인 해결책은 텍-스트를 "서브워드(subword)", 즉 흔한 소리나 단어의 일부를 나타내는 작은 글자 뭉치로 자르는 것이었습니다. 이 방법은 효율적이긴 하지만, 희귀한 단어나 새로운 신조어, 또는 복잡한 문자 체계를 가진 언어를 다룰 때 어려움을 겪으며 이를 어색한 파편으로 나누어 버린다는 결함이 있습니다. 이와 대조적인 대안인 바이트 수준 모델링(byte-level modeling)은 이러한 덩어리들을 완전히 건너뛰고, 화면상의 모든 문자를 구성하는 개별 디지털 구성 단위인 가공되지 않은 바이트(raw bytes)를 직접 다룹니다. 이 방법은 매우 유연하며 어떤 언어나 기호도 사전 가정 없이 처리할 수 있습니다. 하지만 함정이 있습니다. 텍스트를 한 번에 아주 작은 조각 하나씩만 처리하기 때문에, 덩어리 기반 방식보다 현저히 느려져 긴 응답을 생성할 때 답답함을 느끼게 만드는 병목 현상을 일으킵니다.

오하이오 주립대학교, 플로리다 대학교, 그리고 워싱턴 대학교의 연구진은 원시 데이터 접근 방식의 유연성을 희생하지 않으면서도 이 바이트 단위 프로세스의 속도를 높일 수 있는 방법을 제안했습니다. 그들은 '동적 다중 바이트 예측(dynamic multi-byte prediction)'이라 불리는 기술을 도입했는데, 이는 컴퓨터가 한 번에 단 하나의 바이트가 아닌 여러 개의 바이트를 동시에 추측할 수 있게 해줍니다. 성공의 핵심은 '잠재 인과적 주의력(Latent Causal Attention)'이라고 부르는 새로운 방식의 컴퓨터 주의력 조직화에 있습니다. 더 쉽게 설명하자면, 이 시스템은 개별 글자의 나열이 아니라 마치 독자가 구절을 읽는 것처럼, 서로 연결된 자연스러운 "세그먼트(segment)"나 바이트 그룹을 인식하는 법을 배웁니다. 모든 바이트를 별개의 고립된 단계로 취급하는 대신, 모델은 이들을 학습된 세그먼트로 그룹화하고 전체 그룹을 병렬로 예측합니다. 이는 속도를 높이기 위해 각 미래 토큰마다 추가적인 별도의 예측 헤드를 더해 모델의 크기와 복잡성을 키웠던 이전 방식들과는 크게 다른 점입니다.

연구진은 계층적 구조(hierarchical architecture)를 기반으로 시스템을 구축했는데, 여기서 모델은 먼저 긴 바이트 스트림을 더 짧고 의미 있는 단위로 압축한 뒤 이를 처리합니다. 그런 다음 출력 부분을 생성하는 디코더(decoder)를 수정하여 단일하고 스마트한 예측 헤드를 사용하도록 했습니다. 이 헤드에는 이전 바이트 그룹들을 참조하여 문맥을 이해하는 동시에 현재 그룹 내의 모든 바이트를 동시에 예측할 수 있게 해주는 특수한 규칙 또는 마스크(mask)가 장착되어 있습니다. 이러한 설계는 모델이 미래의 정보에 접근하지 않도록 보장합니다. 즉, 언어의 논리적 흐ory를 유지하면서도 막대한 속도 이점을 얻는 것입니다. 연구팀은 3억 7,300만 개의 파라미터를 가진 모델을 구축하여 방대한 양의 영어 텍스트 데이터셋으로 학습시켰으며, 복잡한 지시문 수행, 질문 답변, 뉴스 기사 요약, 그리고 스페인어, 프랑스어, 영어 간의 번역이라는 네 가지 서로 다른 과제로 테스트했습니다.

결과는 이 새로운 접근 방식이 속도와 정확도 사이에서 탁월한 균형을 맞춘다는 것을 보여주었습니다. 테스트된 네 가지 과제 중 세 가지에서 이 새로운 방법은 텍스트 생성 속도와 품질 사이의 최적의 절충점을 달성하며, 속도를 높이려 시도했던 다른 방법들을 능가했습니다. 번역 과제의 경우, 가장 느리고 정밀한 방식보다는 약간 정확도가 떨어졌지만, 실질적인 사용을 위한 유의미한 개선을 제공할 만큼 훨씬 더 빨랐습니다. 중요한 발견 중 하나는 이 시스템이 한 번에 예측할 바이트 수를 변경하기 위해 재학습될 필요가 없다는 점이었습니다. 연구진은 생성 과정 중에 추측 후보의 수를 단순히 조정할 수 있었습니다. 예측 내용을 재검증하는 단계를 사용할 때, 시스템은 높은 품질을 유지하면서도 생성 속도를 거의 40% 높였습니다. 이는 이 방법이 단순히 이론적인 개선에 그치는 것이 아니라, 전체 설계를 다시 하거나 더 크고 비싼 모델을 요구하지 않고도 기존 시스템에 적용하여 속도를 높일 수 있는 실용적인 도구임을 시사합니다.

또한 연구는 시스템이 엄격하게 훈련된 것보다 더 많은 바이트를 예측하도록 요청받았을 때 어떻게 작동하는지 탐구했습니다. 연구진은 모델이 더 긴 바이트 시퀀스를 성공적으로 예측할 수 있음을 발견했으나, 이러한 긴 추측의 정확도는 특정 과제에 따라 달랐습니다. 번역과 같은 과제의 경우 모델은 한 번에 최대 7바이트를 예측할 때 가장 성능이 좋았고, 요약의 경우 6바이트가 최적의 지점이었습니다. 흥-미롭게도, 시스템은 생성의 첫 단계에서는 예측된 바이트 전체 창(window)을 받아들이는 경우가 드물었는데, 이는 맥락을 충분히 축적하여 확신 있는 추측을 할 시간이 필요하기 때문입니다. 그러나 생성이 진행됨에 따라 모델은 종종 바이트 그룹 전체를 한꺼번에 수용했는데, 이는 모델이 일관된 텍스트 세그먼트를 인식하는 법을 배웠음을 나타냅니다. 고정된 미래 토큰 수에 얽매이지 않고 텍스트의 흐름에 따라 예측 길이를 적응할 수 있는 이 능력이야말로, 시스템이 경직되지 않으면서도 효율성을 유지할 수 있게 해주는 핵심입니다.

궁극적으로, 이 연구는 고급 바이트 수준 모델에 이미 존재하는 계층적 구조를 활용하여 오랫동안 발목을 잡아온 속도 문제를 해결할 수 있음을 보여줍니다. 개별 바이트가 아닌 학습된 세그먼트를 생성 단위로 취급함으로써, 연구진은 빠르고 정확한 방법을 만들어냈습니다. 이 접근 방식은 추가적인 파라미터를 필요로 하지 않고 단일 디코더 헤드를 사용하므로, 기존 아키텍처에 가볍게 추가할 수 있습니다. 실험은 특정 모델 크기에 대해 수행되었고 주로 영어 및 영어 쌍 언어에 집중되었지만, 학습된 세그먼트를 병렬 예측의 단위로 사용하는 기본 원리는 견고해 보입니다. 연구진은 향후 작업에서 이러한 이점이 훨씬 더 큰 모델과 더 다양한 언어에서도 유지되는지 검증해야 한다고 언급했지만, 현재의 결과는 인간 의사소통의 미묘한 차이를 이해하는 능력을 저해하지 않으면서도 언어 모델을 더 빠르고 반응성 있게 만들 수 있는 명확한 경로를 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →