← 최신 논문
💬 NLP

DIVERSED: Relaxed Speculative Decoding via Dynamic Ensemble Verification

이 논문은 타겟 모델의 분포를 엄격하게 일치시키는 기존 검증 방식의 한계를 극복하고, 작업 및 컨텍스트에 따라 동적으로 가중치를 조정하는 앙상블 검증기를 통해 추론 속도를 크게 향상시키면서도 생성 품질을 유지하는 'DIVERSED'라는 새로운 완화된 스펙큘레이티브 디코딩 프레임워크를 제안합니다.

원저자: Ziyi Wang, Siva Rajesh Kasa, Ankith M S, Santhosh Kumar Kasa, Jiaru Zou, Sumit Negi, Ruqi Zhang, Nan Jiang, Qifan Song

게시일 2026-04-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziyi Wang, Siva Rajesh Kasa, Ankith M S, Santhosh Kumar Kasa, Jiaru Zou, Sumit Negi, Ruqi Zhang, Nan Jiang, Qifan Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🚗 비유: "스피드 레이서와 정밀한 감시관"

인공지능이 글을 쓸 때는 보통 한 글자씩 천천히 써나갑니다 (이걸 '자기 autoregressive' 방식이라고 합니다). 마치 한 걸음 한 걸음 신중하게 걷는 것과 같습니다.

기존의 'Speculative Decoding(추측적 디코딩)' 방식은 다음과 같이 작동합니다:

  1. **작은 보조 레이서 (Draft Model)**가 먼저 "아마도 이 단어가 올 거야!"라고 여러 단어를 미리 추측해서 써봅니다.
  2. **큰 메인 레이서 (Target Model)**가 그 추측을 엄격하게 검사합니다.
    • "맞아!" → 그대로 채택.
    • "아니야, 틀렸어!" → 모두 버리고, 다시 처음부터 다시 검사해야 합니다.

문제점: 메인 레이서가 너무 엄격해서 ("완벽하게 맞아야 해!") 많은 추측을 거절합니다. 이거 때문에 시간이 많이 걸립니다. 마치 "이 단어 100% 정확해야 해, 틀리면 다 다시 써!"라고 하는 꼴입니다.


💡 DIVERSED 의 해결책: "현명한 팀장"

이 논문에서 제안한 DIVERSED는 이 엄격한 검사를 조금 유연하게 바꾸는 방법입니다.

1. 고정된 규칙 vs. 상황에 맞는 판단

  • 기존 방식 (Static Ensemble): "무조건 보조 레이서의 말을 30% 믿고, 메인 레이서의 말을 70% 믿자"라고 고정된 규칙을 적용합니다.
    • 비유: 모든 상황에 똑같은 안경을 끼고 보는 것과 같습니다. 때로는 너무 어둡고, 때로는 너무 밝아서 잘 안 보일 수 있습니다.
  • DIVERSED 방식 (Dynamic Ensemble): **"지금 이 문맥에서는 뭐가 중요할까?"**를 실시간으로 판단합니다.
    • 비유: 현명한 팀장이 상황을 보고 안경을 바꿔 끼는 것입니다.
      • 수학 문제의 계산 부분이나 중요한 결론이 나올 때는: "엄격하게! 메인 레이서의 말을 99% 믿어!" (오류 방지)
      • 연결되는 접속사사소한 설명 부분에서는: "어차피 비슷하니까, 보조 레이서의 말을 80% 믿고 넘어가자!" (속도 향상)

2. 왜 이렇게 하는 걸까요?

논문은 "모든 틀린 추측이 나쁜 건 아니다"라고 말합니다.

  • 예시: "오늘 날씨가 [맑음] 입니다." vs "오늘 날씨가 [맑다] 입니다."
    • 문법적으로 미묘하게 다를 수 있지만, 의미는 같습니다. 기존 방식은 이를 '틀린 것'으로 치고 다시 쓰게 하지만, DIVERSED 는 "아, 의미는 통하니까 그냥 넘어가자"라고 판단하여 시간을 아낍니다.
  • 하지만 "3 + 4 = [7]"을 "3 + 4 = [8]"으로 바꾸면 안 되죠. DIVERSED 는 이런 중요한 순간에는 자동으로 엄격해집니다.

🏆 결과: 어떻게 변했나요?

  1. 더 많은 추측을 받아들임: DIVERSED 는 보조 레이서가 제안한 단어 중 거의 20~30% 더 많이 받아들입니다. (기존 방식은 너무 많이 거절했습니다.)
  2. 정확도는 그대로: 속도는 빨라졌지만, 답이 틀리는 일은 없습니다. 수학 문제나 코딩에서도 똑같이 정확한 답을 냅니다.
  3. 최적의 균형 (Pareto Frontier): 속도와 정확도 사이에는 보통 ' trade-off(상충 관계)'가 있습니다. "더 빨리 하면 정확도가 떨어지고, 더 정확하면 느려진다"는 법칙이 있는데, DIVERSED 는 이 법칙을 뛰어넘었습니다. (그림 1, 2 참조)

📝 한 줄 요약

"DIVERSED 는 인공지능이 글을 쓸 때, '중요한 순간에는 엄격하게, 사소한 순간에는 유연하게' 판단하도록 도와주는 똑똑한 팀장입니다. 덕분에 인공지능은 더 빠르면서도 똑똑하게 답변할 수 있게 되었습니다."

이 기술은 앞으로 우리가 AI 와 대화할 때, 기다리는 시간을 획기적으로 줄여주면서도 여전히 똑똑한 답변을 받을 수 있게 해줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →