← 최신 논문
💻 computer science

Decoupled Contrastive Decoding via Expert-Aligned Drafting

이 논문은 제안을 위해 전문가에 정렬된 드래프터를 사용하고 아마추어 모델은 검증을 위해 남겨둠으로써, 드래프터를 대조 신호에 정렬할 때 발생하는 성능 저하를 방지하며 대조 디코딩(Contrastive Decoding)을 가속화하는 방법인 분리된 대조 디코딩(Decoupled Contrastive Decoding, DCD)을 소개한다.

원저자: Zhixuan Liu, Zhichen Dong, Yuanfu Wang, Chao Yang

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhixuan Liu, Zhichen Dong, Yuanfu Wang, Chao Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 완벽한 이야기를 쓰려고 노력하고 있다고 상상해 보세요. 하지만 당신에게는 매우 똑똑하지만 말하는 속도는 아주 느린 엄격한 편집자가 있습니다. 당신이 새로운 단어를 쓸 때마다, 편집자가 그 단어를 생각하고, 검토하고, 소리 내어 말할 때까지 기다려야 합니다. 이것이 현재 거대 언어 모델(LLM)이라고 불리는 강력한 컴퓨터 두뇌가 작동하는 방식입니다. 이들은 글을 쓰는 데는 탁월하지만, 단어 하나하나를 일일이 확인해야 하기 때문에 속도가 느립니다.

속도를 높이기 위해, 과학자들은 "추측 디코딩(Speculative Decoding)"이라는 기술을 발명했습니다. 이것은 마치 당신의 이야기에 담길 다음 몇 단어를 느린 편집자가 확인하기도 전에 미리 추측하는, 빠르고 에너지가 넘치는 조수를 두는 것과 같습니다. 조수는 문장 전체를 빠르게 작성하고, 그러면 느린 편집자는 그 추측들이 맞았는지 확인만 하면 됩니다. 만약 추측이 맞았다면, 아주 잘된 일입니다! 시간을 절약한 것이니까요. 만약 틀렸다면, 편집자가 실수를 바로잡습니다. 이 방식은 일반적인 글쓰기에서 놀라운 효과를 발휘합니다.

하지만 여기에는 함정이 있습니다. 때때로 컴퓨터 두뇌는 사실이 아닌 것을 지어내거나 "환각(hallucinate)" 현상을 일으킵니다. 이를 해결하기 위해 연구자들은 "대조 디코딩(Contrastive Decoding)"이라는 기법을 사용합니다. 이것은 실수를 저지르기 쉬운 "아마추어"라는 이름의 덜 똑똑한 두 번째 조수를 두는 것과 같습니다. 시스템은 똑똑한 편집자의 추측과 아마추어의 추측을 비교합니다. 만약 똑똑한 편집자는 "예"라고 하고 아마추어는 "아니오"라고 한다면, 시스템은 똑똑한 편집자를 더욱 신뢰하게 됩니다. 이것은 정확성을 높여주는 안전망 역할을 합니다. 하지만 이 안전망은 매 단어마다 똑똑한 편집자와 서툰 아마추어를 모두 실행해야 하므로 비용이 많이 듭니다. 즉, 다시 속도를 늦추게 됩니다. 여기서 큰 질문이 생깁요. "안전망은 유지하면서도 빠르게 만들 수 있을까?"

"전문가 정렬 초안 작성을 통한 분리된 대조 디코딩(Decoupled Contrastive Decoding via Expert-Aligned Drafting)"이라는 제목의 이 논문은 바로 그 문제를 다룹니다. 상하이 교통 대학교와 상하이 인공지능 연구소의 연구진인 저자들은, 빠른 조수에게 추측하는 동안 "아마추어"의 안전 규칙을 사용하도록 가르쳐서 더 똑똑하게 만들 수 있는지 알아보고 싶었습니다. 그들은 다음과 같이 물었습니다. "빠른 조수가 글을 쓰는 동안 복잡한 안전 규칙을 모방하도록 가르쳐야 할까요, 아니면 그냥 최대한 빨리 쓰고 나중에 안전 점검을 받게 해야 할까요?"

연구진은 이 아이디어를 테스트하기 위해 일련의 영리한 실험들을 진행했습니다. 그들은 빠른 조수가 스스로 실수를 피하는 '슈퍼 추측가'가 될 수 있도록 "아마추어"의 신호를 직접 이해하도록 훈련시켜 보았습니다. 하지만 그들은 놀라운 사실을 발견했습니다. 빠른 조수에게 안전 규칙을 가르치려고 하는 것이 오히려 성능을 악화시킨다는 것이었습니다. 그것은 마치 레이싱 카 드라이버에게 수학 문제를 풀면서 동시에 운전을 하라고 가르치는 것과 같았습니다. 드라이버는 혼란에 빠졌고 더 많은 실수를 저질렀습니다. "아마추어"의 신호는 조수의 자연스러운 실수를 고치기에는 너무 약했고, 이 둘을 결합하려고 시도하는 것은 오히려 오류를 키우기만 했습니다.

그래서 저자들은 **분리된 대조 디코딩(Decoupled Contrastive Decoding, DCD)**이라는 새로운 해결책을 제안했습니다. 빠른 조수에게 안전 규칙을 배우라고 강요하는 대신, 조수가 가장 잘하는 일을 하게 두는 것입니다. 즉, 똑똑한 편집자의 스타일을 사용하여 다음 단어들을 추측하는 것에 집중하게 했습니다. 그들은 추측 단계에서 서툰 아마추어를 완전히 제거했습니다. 안전 점검(대조 디코딩)은 조수가 추측을 마친 후, 즉 검증 단계에서만 이루어지도록 했습니다.

결과는 인상적이었습니다. 빠른 조수를 단순하고 집중력 있게 유지하고, 복잡한 안전 점검을 맨 마지막에만 수행함으로써, 그들은 속도를 크게 높일 수 있었습니다. 테스트 결과, 이 새로운 방식은 기존의 느린 방식보다 1.65배에서 1.95배 더 빠르게 작동했습니다. 또한, 아마추어를 추측 단계에 포함하려 했던 방식들과 비교했을 때, "추측" 과정에 소요되는 시간을 5배에서 12배까지 단축했습니다.

논문은 속도와 정확성을 모두 갖추는 최선의 방법은 역할을 분리하는 것이라고 결론짓습니다. 즉, 빠른 조수는 순수하게 전문가의 스타일에 정렬된 추측가로 남겨두고, 안전 점검은 검증할 때만 수행하는 것입니다. 이러한 "분리된(decoupled)" 접근 방식은 컴퓨터 두뇌가 진실을 말하는 능력을 잃지 않으면서도 빠르게 유지될 수 있도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →