LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding
LiLiCorr는 드래프터의 위치별 주변 분포를 효율적으로 상관시켜 토큰 간의 결합 일관성을 포착함으로써, 최소한의 지연 시간 오버헤드로 수락 길이와 전체 처리량을 크게 향상시키는 경량화된 스펙큘레이티브 디코딩 방식입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
책을 읽는 것이 즉각적으로 이루어지는 세상을 상상해 보십시오. 이는 단어들이 더 빨리 나타나기 때문이 아니라, 페이지를 넘기기도 전에 당신의 정신이 문단 전체를 예측할 수 있기 때문입니다. 이것이 바로 '추측적 디코딩(speculative decoding)'이라 불리는 기술의 약속이며, 인공지능이 전례 없는 속도로 말하고 글을 쓰도록 설계된 방법입니다. 이 과정의 핵심은 단순한 분업에 의존합니다. 작고 빠른 모델이 다음에 올 내용을 추측하는 초안 작성자 역할을 하고, 더 크고 강력한 모델이 그 추측을 검증하는 심판 역할을 하는 것입니다. 만약 심판이 초안 작성자의 예측에 동의하면, 시스템은 그 추측을 수용하고 모든 단어를 처음부터 하나씩 생성하는 느린 단계를 건너뛰어 앞으로 나아갑니다. 초안 작성자가 긴 단어의 줄을 정확하게 맞출 것이라고 신뢰할 수 있는 정도가 빠를수록, 전체 대화의 흐름은 더 빨라집니다. 그러나 한 가지 지속적인 문제가 이 기술의 발목을 잡아왔습니다. 초안 작성자가 개별 단어는 제대로 맞히더라도, 그것들을 일관된 문장으로 결합하는 데는 실패한다는 점입니다. 이는 마치 모든 음표를 개별적으로는 완벽하게 연주하지만, 음표들이 순서대로 연주될 때는 부조화스럽고 터무니없는 멜로디를 만들어내는 음악가와 같습니다.
NVIDIA의 연구진은 속도를 희생하지 않으면서 이러한 일관성의 문제를 해결하기 위해 'LiLiCorr'라는 새로운 방법을 도입했습니다. 이 시스템은 한 번의 빠른 폭발적인 동작으로 미래의 단어 블록 전체를 예측할 수 있는 'DFlash'라는 초안 모델을 기반으로 구축되었습니다. DFlash는 믿을 수 없을 정도로 빠르지만, 각 단어 위치를 독립적인 사건으로 취급합니다. 즉, 첫 번째 슬롯에는 "The dog"를 제안하고 두 번째에는 "meows"를 제안할 수는 있지만, 문장 전체의 맥락에는 "The cat"이 더 적합했을 것이라는 사실을 깨닫지 못할 수 있습니다. 이 새로운 접근 방식은 초안 작성자를 완벽하도록 재학습시키려 하는 대신, 빠른 편집자 역할을 하는 가벼운 논리 계층을 추가합니다. 이 편집자는 초안 작성자가 각 위치에 대해 제안한 상위 몇 개의 후보를 살펴보고, 그것들이 얼마나 잘 연결되는지 확인합니다. 이 편집자는 각 후보 단어에 두 개의 방향성 신호를 할당하는데, 하나는 앞 단어와 얼마나 잘 어울리는지를 나타내고, 다른 하나는 뒷 단어를 위해 얼마나 잘 준비되어 있는지를 나타냅니다. 이러한 신호들을 비교함으로써, 시스템은 어떤 단어의 시퀀스가 매끄럽고 논리적인 경로를 형성하는지 즉각적으로 식별하여, 큰 모델이 거부했을 법한 부조화스러운 조합들을 폐기합니다.
이 설계의 탁월함은 효율성에 있습니다. 시스템은 단어를 하나씩 느린 순차적 체인으로 확인하는 대신, 후보 단어들 사이의 모든 가능한 연결을 단 하나의 거대한 계산을 통해 병렬적으로 동시에 평가합니다. 이를 통해 시스템은 가장 일관된 시퀀스를 거의 즉각적으로 찾아내며, 선택을 확정 짓는 간단한 최종 단계만을 남겨둡니다. 연구진은 이 편집자가 초안 작성자와 손을 맞추어 작동하도록 훈련함으로써, 두 모델이 서로 협력하는 법을 배웠으며, 결과적으로 초안 작성자가 편집자가 긴 문장으로 연결하기 더 쉬운 후보들을 제안하게 된다는 것을 발견했습니다. 수학 문제 풀이부터 코드 작성, 대화에 이르기까지 9가지의 다양한 벤치마크 테스트에서 이 새로운 방법은 기존의 방식들을 지속적으로 능가했습니다. 이 방식은 편집되지 않은 초안 작성자에 비해 수용된 단어의 수를 9%에서 19% 사이로 증가시켰으며, 72개의 테스트 시나리오 중 70개에서 가장 높은 전체 속도를 기록했습니다. 심지 even 훈련 데이터보다 10배 더 긴 입력을 처리하도록 요청받았을 때도 선두를 유지하며, 이 후보 연결 방식이 견고하고 확장 가능하다는 것을 증명했습니다.
이 결과는 AI의 속도를 높이는 데 있어 병목 현상이 단순히 초안 작성자를 더 빠르게 만드는 것뿐만 아니라, 초안 작성자의 추측을 검증하기 더 쉽게 만드는 것에 있다는 점을 시사합니다. 추측의 일관성을 심판에게 보내기 전에 미리 수정함으로써, 시스템은 거절과 재생성으로 인한 낭비되는 시간을 방지합니다. 이 접근 방식은 상관관계를 파악하기 위해 메인 모델의 막대한 계산 능력을 필요로 하지 않습니다. 대신, 텍_블록당 전체 시간의 약 2.8%만을 차지하는 아주 작은 특화 네트워크를 사용합니다. 연구진은 이 작은 추가가 엄청난 수익을 가져온다는 것을 입증했으며, 이를 통해 시스템이 이전보다 훨씬 빠르게 정보를 처리할 수 있게 했습니다. 다른 방법들은 모든 단어에 대해 복잡한 검사를 수행하거나 메인 모델이 추가적인 작업을 수행하도록 함으로써 이를 해결하려 했지만, LiLiCorr는 초안 작성자가 이미 제공하는 정보를 탐색하기 쉬운 구조로 조직함으로써 성과를 달ей했습니다. 이 연구 결과는 고속 AI의 미래를 위한 열쇠가 더 큰 모델을 만드는 것이 아니라, 생성된 단어들 사이의 점들을 연결하는 더 스마트하고 효율적인 방법을 구축하는 데 있을 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.