← 최신 논문
💬 NLP

X-CoSD: Communication-Efficient Cross-Vocabulary Collaborative Speculative Decoding

본 논문은 하이브리드 리샘플링과 서버 리샘플링 및 디바이스 검증 변형 방식을 도입하여 출력 품질을 저하시키지 않으면서 토큰 생성을 크게 가속화함으로써, 이기종 어휘를 가진 디바이스와 서버 간의 분산된 LLM 추론을 가능하게 하는 통신 효율적이고 손실 없는 협력적 투기적 디코딩 프레임워크인 X-CoSD를 제안한다.

원저자: Jaeduk Lee, Wan Choi

게시일 2026-09-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jaeduk Lee, Wan Choi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 세계에서 가장 강력한 도구는 거대 언어 모델로, 코드를 작성하고, 이야기를 짓고, 복잡한 문제를 해결할 수 있는 방대한 디지털 두뇌입니다. 하지만 이러한 모델들은 무겁고 실행 속도가 느려, 종종 사용자로부터 멀리 떨어진 곳에 있는 거대한 서버를 필요로 합니다. 이를 더 빠르게 만들기 위해 연구자들은 '추측적 디코딩(speculative decoding)'이라 불리는 기술을 개발했습니다. 가볍고 빠른 보조원이 몇 문장을 초안으로 작성하면, 숙련된 전문가가 이를 즉시 검토하는 팀을 상상해 보십시오. 만약 보조원이 맞다면 팀은 빠르게 앞으로 나아가고, 보조원이 틀렸다면 전문가가 실수를 바로잡습니다. 이러한 협업을 통해 시스템은 전문가가 혼자 작업할 때보다 훨씬 빠르게 텍스트를 생성할 수 있습니다. 그러나 이 팀워크가 휴대폰과 멀리 떨어진 서버 사이에서 이루어지려면, 그들이 인식하는 특정 단어와 기호의 목록까지 포함하여 정확히 동일한 언어를 사용해야 합니다. 현실 세계에서는 서로 다른 기기들이 각기 다른 사전을 사용하는 경우가 많으며, 이는 이 빠른 협업이 원활하게 작동하는 것을 막는 장벽이 되어 왔습니다.

서울대학교의 연구진은 'X-CoSD'라고 명명한 새로운 프레임워크를 통해 이 장벽을 해결했습니다. 그들의 연구는 특정 병목 현상을 다룹니다. 즉, 휴대폰과 서버가 동일한 어휘를 공유하지 않을 때, 서버가 실수가 발생할 때마다 휴대폰으로 방대한 양의 데이터를 다시 보내야 하며, 이로 인해 전체 과정이 매우 느려진다는 점입니다. 연구진은 휴대폰과 서버의 사전이 일치하지 않더라도 텍-의 품질이나 응답 속도를 희생하지 않고 서로 협업할 수 있는 시스템을 설계했습니다. 그들은 이 방식이 강력한 서버 모델의 지능을 그대로 유지하면서도 인터넷을 통해 이동해야 하는 데이터 양을 획기적으로 줄인다는 것을 입증했습니다.

문제의 핵심은 이러한 모델이 오류를 처리하는 방식에 있습니다. 서버가 휴대폰의 초안을 검토하고 토큰을 거부할 때, 서버는 새로운 올바른 옵션을 제공해야 합니다. 어휘 불일치를 해결하려는 이전의 시도들에서, 서버는 자신의 전체 확률 지도(probability map)—즉, 다음에 선택할 수 있는 모든 가능한 단어의 목록—를 휴대폰에 다시 보냈습니다. 이것은 마치 교사가 학생이 철자 하나를 틀릴 때마다 학생에게 교과서 전체를 보내는 것과 같습니다. 이는 특히 무선 네트워크 환경에서 데이터를 전송하는 데 시간과 전력이 많이 소모되므로 매우 비효요적입니다. 연구진은 휴대폰이 자신과 서버가 모두 동의하는 단어들과, 서버만이 알고 있는 단어를 처리하기 위한 아주 적은 양의 추가 정보만을 보면 된다는 사실을 깨달았습니다.

이를 해결하기 위해 연구진은 '하이브리드 리샘플링(hybrid resampling)'이라는 방법을 도입했습니다. 서버는 전체 사전의 가능성을 보내는 대신, 휴대폰과 서버의 어휘에 공통으로 등장하는 단어들에 대한 확률만을 보냅니다. 또한 서버 고유의 단어들이 얼마나 많은 비중을 차지하는지를 나타내는 단 하나의 숫자도 함께 보냅니다. 이 제한된 정보를 가지고, 휴대폰은 공유된 목록에서 단어를 선택할지 아니면 서버에 고유한 목록에서 단어를 골라달라고 요청할지를 수학적으로 결정할 수 있습니다. 만약 휴대폰이 공유 목록에서 단어를 선택한다면, 그 과정은 즉각적으로 이루어집니다. 만약 서버가 고유한 단어를 골라야 한다면, 서버는 전체 목록을 보내는 대신 단 하나의 단어만을 다시 보냅니다. 이 접근 방식은 최종 출력이 강력한 서버가 스스로 생성했을 때와 완벽하게 일치하도록 보장하면서도, 시스템을 느리게 만들었던 과도한 데이터 전송을 피하게 해줍니다.

연구진은 효율성을 한 단계 더 높인 'X-CoSD-E'라는 향상된 버전을 선보였습니다. 이 설정에서는 실수가 발생했을 때, 서버가 먼저 소수의 대체 후보군을 휴대폰에 보냅니다. 휴대폰은 이 몇 가지 옵션을 즉시 확인합니다. 만약 그중 하나가 충분히 괜찮다면, 프로세스는 거기서 멈추고 더 이상의 데이터는 전송되지 않습니다. 서버는 휴대폰이 초기 후보군을 모두 거부했을 때만 더 큰 규모의 확률 목록을 보냅니다. 이 "먼저 몇 개를 시도해 보기" 전략 덕분에, 대부분의 경우 시스템은 과도한 데이터 전송을 완전히 피할 수 있습니다. 연구진은 기계 번역, 뉴스 기사 요약, 수학 문제 풀이 등 다양한 작업에 대해 서로 다른 모델을 사용하여 휴대폰과 서버를 대상으로 테스트를 진행했습니다.

결과는 이 새로운 방식이 강력한 서버 모델이 단독으로 작동할 때와 마찬가지로 텍- 생성의 높은 품질을 유지하면서도 잘 작동한다는 것을 보여주었습니다. 동시에, 이 방식은 주고받는 데이터의 양을 크게 줄였습니다. 실험에서 이 새로운 시스템은 특히 인터넷 연결이 느리거나 데이터 전송이 제한적인 상황에서, 서로 다른 어휘를 처리하려고 했던 이전 방식들보다 훨씬 빠르게 토큰을 생성했습니다. 연구진은 어떤 정보를 언제 보낼지를 세심하게 관리함으로써 협업을 원활하게 유지할 수 있음을 발견했습니다. 이 연구는 참여하는 기기들이 정확히 같은 언어를 사용하지 않더라도 고속의 협력형 인공지능이 가능하다는 것을 보여주며, 일상적인 기기에서 더 효율적이고 접근하기 쉬운 AI 도구를 사용할 수 있는 길을 열어주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →