DeltaLog: Deferred Materialization of Recurrent States for Linear Attention Decoding
DeltaLog는 전체 상태를 구체화하는 것을 유예하고 대신 제한된 로그에 압축된 업데이트를 추가한 뒤 이를 주기적으로 병합하는 방식을 통해 선형 어텐션 모델을 가속화함으로써, 메모리 트래픽을 크게 줄이고 엔드 투 엔드 서빙 속도를 향상시키는 순환 상태 디코딩 기법이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
챗봇에서 창의적 글쓰기 보조 도구에 이르기까지, 텍스트를 생성하는 현대의 인공지능 시스템은 '자기회귀 디코딩(autoregressive decoding)'이라 불리는 근본적인 과정에 의존합니다. 이 과정에서 컴퓨터는 이미 생성된 단어들을 활용해 다음 단어를 예측하며 문장의 다음 단어를 한 번에 하나씩 예측합니다. 수년 동안 가장 강력한 모델들은 현재의 예측에 어떤 이전 단어가 가장 중요한지를 결정하기 위해 '어텐션(attention)'이라고 알려진 메커니즘을 사용해 왔습니다. 이 방식은 매우 효과적이지만, 하나의 병목 현상을 만들어냅니다. 대화가 길어질수록 시스템은 지금까지 본 모든 단어의 계속해서 확장되는 목록을 끊임없이 저장하고 불러와야 하며, 이는 막대한 양의 컴퓨터 메모리를 소비하고 응답 시간을 늦춥니다. 이를 해결하기 위해 연구자들은 확장되는 목록 대신, 새로운 단어가 추가될 때마다 업데이트되는 고정된 크기의 요약본, 즉 '상태(state)'를 사용하는 새로운 부류의 모델들을 개발했습니다. 이러한 변화는 모든 과거 토큰을 기억할 필요를 없애주지만, 대신 시스템이 새로운 단어가 추가될 때마다 이 전체 요약본을 끊임없이 다시 써야 한다는 다른 문제를 야기하며, 이는 컴퓨터 메모리에 심각한 교통 체증을 유발합니다.
중국과학기술대학교의 연구팀은 이러한 지속적인 재작성 과정을 주요한 비효율성으로 식별하고, '델타로그(DeltaLog)'라고 부르는 해결책을 고안해 냈습니다. 델타로그는 컴퓨터가 매 단어마다 대화의 전체 요약본을 다시 쓰도록 강요하는 대신, 시스템이 완전하고 안정적인 버전의 요약본을 유지하면서 가장 최근의 변화만을 설명하는 작고 압축된 노트를 첨부할 수 있도록 합니다. 시스템은 이 작은 노트들이 일정량 쌓인 후에만 전체 요약본을 다시 작성합니다. 이 방식은 마치 마스터 장부와 포스트잇 뭉치를 관리하는 것과 같습니다. 새로운 거래가 발생할 때마다 장부 전체를 다시 쓰는 대신, 거래 내용을 포스트잇에 적어 붙이고 포스트잇 뭉치가 너무 높아졌을 때만 장부를 업데이트하는 것과 같습니다. 이 방식을 통해 연구자들은 컴퓨터가 이동시켜야 하는 데이터의 양을 획기적으로 줄일 수 있었으며, 데이터 이동은 종종 프로세스에서 가장 느린 부분입니다.
연구진은 이 방법을 Gated DeltaNet, Kimi Delta Attention, RWKV6를 포함한 여러 유형의 현대적 언어 모델에 테스트했습니다. 실험에서 그들은 컴퓨터가 단어 하나를 생성하는 데 걸리는 시간과 얼마나 많은 메모리 트래픽이 발생하는지를 측정했습니다. 그들은 요약본의 전체 재작성을 미룸으로써, 고성능 그래픽 카드에서 모델의 메모리를 업데이트하는 핵심 계산 속도를 최대 1.86배까지 높일 수 있다는 것을 발견했습니다. 더 중요한 것은, 컴퓨터의 고속 메모리로 쓰여지는 데이터의 양이 최대 7.83배까지 감소했다는 점을 관찰했다는 것입니다. 이러한 트래픽 감소는 중요한데, 이러한 유형의 모델에서는 속도가 컴퓨터가 얼마나 빨리 계산할 수 있느냐가 아니라, 데이터를 메모리에 얼마나 빨리 넣고 뺄 수 있느냐에 의해 제한되는 경우가 많기 때문입니다.
연구진이 이 방법을 동시에 여러 사용자를 지원하도록 설계된 전체 시스템에 통합했을 때, 그 이점은 최종 사용자에게 더 빠른 응답 시간으로 나타났습니다. 수백억 개의 파라미터를 가진 대규모 모델을 대상으로 한 테스트에서, 시스템은 이전보다 5%에서 20% 더 빠르게 단어를 생성했습니다. 이러한 개선은 시스템이 동시에 많은 요청을 처리할 때 가장 두드러졌는데, 이는 실제 응실 환경에서 흔히 발생하는 시나리오입니다. 연구진은 이 방법이 정확도를 희생하지 않는다는 점을 확인했습니다. 수정된 시스템이 생성한 텍스트는 원래의 모델과 수학적으로 동일하게 유지되었으며, 이는 출력의 품질은 보존하면서 전달 효율성만 높였음을 의미합니다.
이 연구의 핵심 통찰은 컴퓨터가 정보를 물리적으로 저장하고 업데이트하는 방식이 반드시 모델이 수행하는 논리적 단계와 일치할 필요는 없다는 것입니다. 모델은 논리적으로 매 단어마다 상태를 업데이트하지만, 물리적 하드웨어는 그 변화를 반영하기 위해 즉시 전체 상태를 다시 쓸 필요가 없습니다. 안정적인 이력과 최근의 변화를 분리하고 주기적으로 병합함으로써, 델타로그는 과도한 메모리 트래픽을 유발하는 '상태 업데이트 세금(state-update tax)'을 줄여줍니다. 이 전략은 기본 모델이나 가중치를 변경하지 않으며, 단지 컴퓨터가 데이터를 처리하는 일정(schedule)을 변경할 뿐입니다. 연구 결과는 대규모 언어 모델에 있어 데이터의 물리적 이동을 최적화하는 것이 수학적 알고리즘 자체를 개선하는 것만큼 중요하다는 것을 시사하며, 더 빠르고 효율적인 인공지능을 위한 명확한 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.