← 최신 논문
💬 NLP

Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference

Daedalus-150M은 어텐션 레이어의 3분의 2를 고정 폭 컨볼루션으로 대체함으로써 효율적인 CPU 추론을 위해 특별히 설계된 소형 언어 모델로, 훨씬 더 많은 토큰으로 학습된 더 크고 데이터 집약적인 모델들을 능가하면서도 긴 문맥에서 탁월한 속도와 압축률을 달성합니다.

원저자: Christos Koutsiaris

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Christos Koutsiaris

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

오늘날 인공지능을 사용하는 대부분의 사람들은 거대한 데이터 센터를 위해 설계된 강력하고 특화된 컴퓨터 칩에서 구동되는 시스템과 상호작용합니다. 이러한 시스템은 한 번에 수천 개의 요청을 처리할 수 있도록 구축되었으며, 이 과정은 막대한 계산 비용을 여러 사용자에게 분산시킬 수 있게 해줍니다. 하지만 표준적인 노트북이나 데스크톱 컴퓨터를 사용하는 개인의 경우, 효율성의 규칙은 완전히 달라집니다. 개인용 기기에서 컴퓨터는 대규모 병렬 처리에 의존할 수 없으며, 대신 메모리에서 프로세서로 데이터를 얼마나 빠르게 이동시킬 수 있는지에 의해 제한됩니다. 컴퓨터가 문장에서 새로운 단어를 생성할 때마다, 맥락을 이해하기 위해 대화의 전체 이력을 다시 읽어야 합니다. 대화가 길어질수록, 이 재독해 과정은 무거운 세금이 되어 시스템의 속도를 현저히 떨어뜨립니다. 연구자들의 과제는 언어를 잘 이해하면서도 일반적인 하드웨어에서 실행될 때 이 커지는 메모리 부담에 발목 잡히지 않는 모델을 구축하는 것입니다.

한 연구자는 표준 컴퓨터 프로세서를 사용하는 개인 사용자를 위해 특별히 설계된 Daedalus-150M이라는 새로운 종류의 언어 모델을 설계함으로써 이 문제에 접근했습니다. 그는 거대하고 복잡한 모델을 가져와 크기를 줄이려 하는 대신, 사용자의 기기가 가진 제약 사항에서 시작하여 그에 맞게 밑바닥부터 아키텍처를 구축했습니다. 그 결과는 하이브리드 엔진처럼 작동하는 시스템입니다. 이 모델은 두 가지 서로 다른 정보 처리 방식을 결합합니다. 대화 전체 이력을 기억하는 전통적인 방식과, 오직 마지막 몇 순간만을 기억하는 더 새롭고 단순한 방식입니다. 이 설계에서 모델은 18개의 처리 계층을 가집니다. 6개의 계층은 장기적인 맥락에 대한 깊은 이해를 유지하기 위해 전통적인 방식을 사용하는 반면, 나머지 12개의 계층은 바로 직전의 두 단계만을 되돌아보는 단기 기억 기술을 사용합니다. 이는 컴퓨터가 생각하는 시간의 3분의 2 동안, 대화 전체 이력을 다시 읽을 필요 없이 즉각적인 과거만을 바라본다는 것을 의미합니다.

연구자는 이 설계를 모든 18개 계층에 전통적이고 메모리를 많이 사용하는 방식을 사용하는 거의 동일한 모델과 테스트했습니다. 두 모델 모두 약 600억 단어의 동일한 양의 데이터로 훈련되었으며, 표준 컴퓨터에서 실행될 수 있도록 작은 크기로 압축되었습니다. 비교 과정은 엄격하고 사전 계획되었습니다. 연구자는 결과를 확인하기 전에 무엇이 승리로 간el될지를 정확히 결정했습니다. 하이브리드 모델은 질문에 답하고 과제를 완수하는 능력에 있어서 전통적인 모델과 대등한 수준을 보였지만, 속도 면에서는 훨씬 더 뛰어난 성능을 보였습니다. 대화가 짧을 때는 두 모델의 속도가 비슷했습니다. 그러나 대화가 길어짐에 따라, 전통적인 모델은 더 많은 이력을 다시 읽어야 했기에 속도가 상당히 느려졌습니다. 반면 하이브리드 모델은 훨씬 더 일정한 속도를 유지했습니다. 대화 길이가 2,000단어에 달했을 때, 하이브리드 모델은 전통적인 모델보다 거의 두 배 빠르게 텍스트를 생성했습니다.

이러한 속도 우위는 단순히 이론적인 계산이 아니었습니다. 이는 표준 컴퓨터 프로세서에서 직접 측정되었습니다. 연구자는 하이브리드 모델이 전체 이력을 다시 읽는 것을 피함으로써 데이터 이동량을 대폭 절감했다는 사실을 발견했는데, 이것이 바로 이러한 기기들의 주요 병목 구간입니다. 단순히 데이터 크기만 계산했을 때는 하이브리드 모델이 약간 더 빠를 것으로 예상되었으나, 실제 성능 차이는 훨씬 더 컸습니다. 이는 전통적인 방식이 전체 이력에 의존하는 복잡한 단계별 계산을 포함하며, 이것이 단일 프로세서에서 실행하기에는 느리기 때문입니다. 하이브리드 방식은 대부분의 메모리 상태를 작고 고정된 상태로 유지함으로써 이러한 느린 단계들을 완전히 회피합니다. 또한 이 모델은 파일 크기도 더 작아서 하드 드라이브 공간을 약 6% 적게 차지하며, 이는 저장 공간이 제한적인 사용자들에게 실질적인 이점이 됩니다.

이러한 성공에도 불구하고, 연구자는 무엇이 완벽하게 작동하지 않았는지 보고하는 데 신중했습니다. 그들은 모델의 단기 기억 섹션에 있는 채널 중 약 절반이 아무것도 하지 않고 사실상 유휴 상태로 머물러 있다는 것을 발견했습니다. 또한 모델이 크기에 비해 필요 이상으로 큰 단어 어휘를 사용하여 용량을 일부 낭비하고 있다는 점도 발견했습니다. 나아가, 속도를 위한 압축 데이터 형식을 특별히 처리하도록 모델을 훈련하려고 시도했을 때 프로세스가 실패했으며, 이는 모델이 훈련 후에 압축되어야 함을 의미했고 이로 인해 정확도가 약간 감소했습니다. 이는 근본적인 설계 결함이라기보다는 엔지니어링상의 문제이며, 연구자는 향후 버전에서 모델의 시작 방식과 압축 방식을 조정함으로써 이를 해결할 수 있다고 언급했습니다.

최종 결과는 장기 기억과 단기 기억을 혼합하는 이 특정 설계 선택이 목표 환경에 정확히 의도한 대로 작동한다는 것을 보여주었습니다. 이 모델은 3배에서 6배 더 많은 데이터로 훈련된 유사한 크기의 다른 모델들보다 5개의 표준 언어 테스트에서 더 높은 점수를 기록했습니다. 심지어 1조 개의 단어로 훈련된 모델보다도 더 나은 성과를 냈지만, 훨씬 더 큰 모델이 여전히 원시 지능 측면에서는 약간의 우위를 점했습니다. 핵심적인 교훈은, 표준 컴퓨터를 사용하는 단일 사용자를 위한 가장 효율적인 방법은 모델을 최대한 똑똑하게 만드는 것이 아니라, 메모리 사용을 최대한 가볍게 만드는 것이라는 점입니다. 매 단계마다 대화 전체를 다시 읽을 필요가 없다는 점을 수용함으로써, 연구자는 대화가 길어져도 반응이 빠르고 쾌적하게 느껴지는 시스템을 만들어냈으며, 이는 다른 아키텍처적 접근 방식이 일상적인 컴퓨팅의 특정 문제들을 해결할 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →