← 최신 논문
💬 NLP

TreeWY: Speculative Verification for Gated DeltaNet Hybrids

TreeWY는 Gated DeltaNet 하이브리드 모델의 추측적 디코딩 시 노드당 순환 상태 스냅샷의 필요성을 제거하는 트리 구조의 WY 변환을 도입하여, 수용 길이를 희생하지 않으면서 메모리 압박을 크게 줄이고 처리량을 개선하거나 더 넓은 초안 트리를 가능하게 합니다.

원저자: Sneha Murthy Ghantasala

게시일 2026-08-24
📖 5 분 읽기🧠 심층 분석

원저자: Sneha Murthy Ghantasala

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 세계에서 대규모 언어 모델은 한 번에 한 단어씩 텍스트를 생성하는 강력한 엔진 역할을 합니다. 이를 위해 모델은 지금까지 작성한 모든 내용을 기억하여 다음 단어가 문맥에 부합하도록 해야 합니다. 수년 동안 이 메모리를 처리하는 가장 일반적인 방법은 이전의 모든 단어와 그에 관련된 데이터를 계속 늘어나는 목록으로 유지하는 것이었습니다. 이 방식은 잘 작동하지만, 대화가 길어질수록 방대한 양의 컴퓨터 메모리를 요구한다는 단점이 있습니다. 최근에는 이러한 전통적인 방식과 더 압축적인 방식을 결합한 새로운 세대의 모델들이 등장했습니다. 이 하이브리드 모델들은 전체 이력을 하나의 고정된 크기의 스냅샷으로 요약하는 특수한 유형의 레이어를 사용하여, 늘어나는 목록 대신 전체 이력을 요약합니다. 이는 표준적인 읽기 및 쓰기 작업에서 매우 효율적이어서 더 작은 컴퓨터에서도 실행될 수 있게 해줍니다. 하지만 이러한 효율성은 '추측적 디코딩(speculative decoding)'이라 불리는 기술을 통해 속도를 높이려 할 때 새로운 문제를 야기합니다.

추측적 디코딩은 AI 모델을 더 빠르게 만들기 위해 사용되는 전략입니다. 모델이 한 번에 한 단어씩 생성하는 대신, 더 작고 저렴한 '초안(draft)' 모델이 몇 단어를 앞서 예측하고, 메인 모델은 그 예측들이 맞았는지 한꺼번에 확인합니다. 만약 메인 모델이 긴 예측 문자열을 검증할 수 있다면, 한 번의 단계로 여러 단어를 출력할 수 있어 속도가 획기적으로 빨라집니다. 문제는 앞서 언급한 하이브리드 모델에서 발생합니다. 이들의 메모리는 쉽게 자르거나 붙여넣을 수 없는 단일한 고정 스냅샷이기 때문에, 현재의 시스템은 초안 모델이 예측하는 매 단어마다 이 스냅샷의 완전한 복사본을 가져야 합니다. 만약 초안 모델이 긴 단어 목록을 예측한다면, 시스템은 각 예측마다 메모리의 복사본을 저장해야 합니다. 이는 빠르게 컴퓨터 메모리를 가득 채워, 시스템이 긴 목록을 예측하는 것을 중단하게 만들고 속도 향상을 제한합니다. 이는 이 효율적인 모델들이 이론적으로 낼 수 있는 속도만큼 빠르게 작동하는 것을 가로막는 병목 현상입니다.

스네하 머티 간탈라(Sneha Murthy Ghantasala)가 이끄는 Thomson Reuters의 연구진은 이 특정 메모리 병목 현상을 해결하기 위해 TreeWY라고 불리는 새로운 방법을 개발했습니다. 그들의 연구는 효율적으로 설계되었지만 추측적 디코딩의 메모리 요구 사항으로 인해 어려움을 겪는 Qwen3.5라는 하이브리드 모델 제품군에 초점을 맞추고 있습니다. 연구팀은 이 모델들의 메모리가 업데이트되는 방식이 재배열 가능한 특정 수학적 패턴을 따른다는 점을 깨달았습니다. 매 예측마다 메모리 상태의 전체 복사본을 저장하는 대신, 그들은 모든 예측 결과를 단 하나의 간소화된 수학적 연산을 통해 한꺼번에 계산하는 방법을 찾아냈습니다. 이 연산은 예측 시퀀스를 별개의 스냅샷 시리즈로 취급하는 것이 아니라, 필요한 정보가 공유되고 효율적으로 계산되는 구조화된 트리(tree)로 취급합니다.

그들 발견의 핵심은 더 이상 모든 초안 토큰에 대해 전체 메모리 상태를 저장할 필요가 없다는 것입니다. 기존 방식에서는 모델이 열 단어를 예측하면 메모리의 열 가지 완전한 버전을 저장해야 했으므로 엄청난 공간을 소비했습니다. TreeWY를 사용하면 시스템은 예측 단계 동안 발생한 변화에 대한 아주 작고 압축된 요약본만을 저장합니다. 시스템은 모든 예측을 동시에 검증하기 위해 단 한 번의 계산을 수행합니다. 만약 예측이 수용되면, 시스템은 그 작은 요약본으로부터 올바른 메모리 상태를 재구성합니다. 만약 예측이 거부되면, 시스템은 무거운 전체 메모리 상태를 저장할 필요 없이 단순히 그 요약본을 폐기하면 됩니다. 이 접근 방식은 이전에 긴 예측 체인을 불가능하게 만들었던 막대한 메모리 오버헤드 문제를 제거합니다.

연구진은 이 방법을 두 가지 크기의 Qwen3.5 모델(350억 파라미터 버전과 훨씬 더 큰 3,970억 파라미터 버전)에 대해 고성능 그래픽 카드에서 테스트했습니다. 그들은 자신들의 새로운 TreeWY 방식을 대중적인 AI 소프트웨어에서 사용되는 표준 방식과 비교했습니다. 결과에 따르면, 컴퓨터 메모리에 과부하가 걸린 상황에서 새로운 방식은 한 번에 훨씬 더 많은 요청을 처리할 수 있게 해주었습니다. 어떤 경우에는 텍스트 생성 속도가 거의 50% 증가했으며, 응답 생성을 시작하는 데 걸리는 시간도 극적으로 감소했습니다. 이는 확보된 메모리 공간 덕분에 시스템이 충돌하거나 느려지지 않고도 더 많은 활성 대화를 동시에 실행할 수 있었기 때문입니다.

그러나 연구는 이 혜택이 가용 메모리 양에 크게 의존한다는 점도 밝혀냈습니다. 컴퓨터에 여유 메모리가 충분할 때, 새로운 방식은 단순한 데이터 복사 방식보다 약간 느려 속도가 몇 퍼센트 정도 손실되었습니다. 이는 새로운 계산 방식이 데이터를 단순히 복사하는 것보다 수행하는 데 아주 약간 더 많은 시간이 걸리기 때문입니다. 연구진은 새로운 방식의 진정한 승리는 시스템이 메모리 제한을 받는 상황에서 온다는 점을 언급했습니다. 이러한 시나리오에서는 계산에 드는 작은 비용보다 더 많은 대화를 동시에 실행할 수 있는 능력이 훨씬 더 중요합니다.

연구팀은 또한 이 방법이 단순히 단어의 한 줄을 예측하는 것을 넘어, 모델이 여러 다른 경로를 동시에 예측하는 '트리' 구조와 같은 더 야심 찬 예측 전략을 지원할 수 있는지 탐구했습니다. 새로운 방식은 예측 트리가 얼마나 넓어지더라도 메모리 사용량을 일정하게 유지함으로써 이를 가능하게 했습니다. 이전에는 넓은 예측 트리가 너무 많은 메모리를 요구하여 실행이 불가능했습니다. 이제 시스템은 훨씬 더 많은 경로를 시도할 여유가 생겼습니다. 비록 이것이 테스트된 모델들에게 즉각적인 엄청난 속도 향상을 가져오지는 않았지만, 이 방법이 이전에 비용 문제로 불가능했던 복잡하고 넓은 예측 구조를 처리할 수 있을 만큼 유연하다는 것을 입증했습니다.

연구진은 이 솔루션이 이러한 하이브리드 모델을 지배하는 수학적 규칙에 특화되어 있다는 점을 강조했습니다. 이는 모델 설계의 구체적인 세부 사항에 의존하는 것이 아니라, 메모리가 스스로 업데이트되는 근본적인 방식에 기반한다는 것을 의미합니다. 따라서 이 접근 방식은 유사한 메모리 구조를 사용하는 다른 모델에도 잠재적으로 적용될 수 있습니다. 이 작업은 AI 모델을 실행하는 데 널리 사용되는 소프트웨어 프레임워크에 구현되었으며, 연구진은 새로운 방식이 표준 방식과 수학적으로 동일한 결과를 생성하여 텍스트의 품질이 변하지 않음을 확인했습니다.

결론적으로, 이 연구는 예측 단계에서 메모리를 처리하는 방식을 재고함으로써 효율적인 하이브리드 모델의 전체 속도 잠재력을 끌어올릴 수 있음을 보여줍니다. 이 연구는 한계가 모델 자체가 아니라 소프트웨어가 메모리를 관리하는 방식에 있었음을 보여줍니다. 전체 스냅샷을 저장하는 대신 공유된 요약본을 계산하는 방식으로 전환함으로써, 연구진은 메모리 병목 현상을 높은 성능을 위한 통로로 바꾸었습니다. 이를 통해 효율적인 모델들이 더 빠르게 실행되고 더 많은 사용자를 수용할 수 있게 되었으며, 특히 컴퓨터 메모리가 가장 엄격한 제약 조건인 상황에서 더욱 그러합니다. 이 연구 결과는 미래의 AI 속도 향상이 단순히 더 큰 모델을 만드는 것뿐만 아니라, 이미 보유한 데이터를 더 스마트하게 관리하는 방법에서 올 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →