← 최신 논문
💻 computer science

Continuous Speculative Decoding for Autoregressive Image Generation

이 논문은 디노이징 궤적 정렬(denoising trajectory alignment)과 수락-거절 샘플링(acceptance-rejection sampling)을 통해 분포 불일치와 복잡한 적분 문제를 극복함으로써, 이미지 생성 품질을 유지하면서도 2배 이상의 추론 속도 향상을 달성하는 연속적 시각적 자기회귀 모델을 위한 새로운 가속 프레임워크인 연속적 투기적 디코딩(Continuous Speculative Decoding, CSpD)을 소개한다.

원저자: Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

게시일 2026-07-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 걸작을 그리려 한다고 상상해 보세요. 하지만 한 번에 아주 작은 붓터치 하나씩만 할 수 있고, 다음 동작을 하기 전에 반드시 페인트가 마를 때까지 기다려야 합니다. 이것이 자기회귀(Autoregressive, AR) 이미지 생성이 작동하는 방식입니다. 컴퓨터는 이미지의 한 부분을 예측한 다음, 그 예측을 바탕으로 다음 부분을 추측하고, 이를 계속 반복합니다. 이는 매우 높은 품질을 보여주지만, 두 가지 일을 동시에 할 수 없기 때문에 고통스러울 정도로 느립니다.

이 논문의 저자들은 그림을 망치지 않으면서도 이 속도를 높이고 싶어 했습니다. 그들은 텍스트 생성 분야에서 사용되는 **추측적 디코딩(Speculative Decoding)**이라는 기술을 빌려왔지만, 이미지는 "이산적(discrete)"(레고 블록처럼 뚜렷한 단위)이지 않고 "연속적(continuous)"(색상의 부드러운 그라데이션)이기 때문에 이를 처음부터 다시 만들어내야 했습니다.

다음은 이 과정을 쉬운 비유를 통해 설명한 것입니다.

1. 문제점: "빠른 견습생" vs "느린 거장"

속도를 높이기 위해 연구진은 **드래프트 모델(Draft Model, 작고 빠른 견습생)**과 **타겟 모델(Target Model, 느리지만 강력한 거장)**을 도입했습니다.

  • 기존 방식 (이산적): 텍스트 생성에서 견습생은 다음 단어 5개를 미리 추측합니다. 거장은 이 단어들을 한꺼번에 검사합니다. 만약 거장이 동의하면 성공입니다! 동의하지 않는다면, 거장이 단어를 수정합니다.
  • 새로운 도전 (연속적): 이미지 생성에서 "단어"는 사실 연속적인 값(예: 특정 파란색의 농도)입니다. 견습생의 추측이 맞는지 확인하기 위한 수학적 계산은 훨씬 더 어렵습니다.
    • 문제 A: 견습생과 거장이 생각하는 "정답" 색상이 완전히 다른 곳에 있는 경우가 많습니다. 견습생은 파란색의 한 색조를 추측하지만, 거장은 그것이 형편없다고 생각합니다. 이로 인해 "수용률(acceptance rate)"이 매우 낮아집니다(거장이 거의 모든 것을 거절하게 됩니다).
    • 문제 B: 거장이 추측을 거절했을 때, 즉시 새로운 올바른 추측을 생성해야 합니다. 연속적인 수학의 세계에서 이 "새로운 올바른 추측"을 위한 공식은 너무 복잡해서, 마치 깔끔한 답이 없는 적분 방정식을 푸는 것과 같습니다. 단순히 식을 써 내려가는 것이 아니라, 거대한 시뮬레이션을 실행해야만 답을 구할 수 있는데, 이는 속도를 높이려는 목적 자체를 무색하게 만듭니다.

2. 해결책: "연속적 추측적 디코딩"

연구진은 이 두 가지 문제를 해결하기 위해 새로운 시스템을 구축했습니다.

문제 A 해결: "같은 길을 걷기" (디노이징 궤적 정렬)

견습생과 거장이 모두 안개 낀 언덕(노이즈)에서 출발하여 맑은 계곡(최종 이미지)으로 내려가는 길을 걷고 있다고 상상해 보세요.

  • 정렬이 없을 때: 견습생은 자신만의 지도에 따라 길을 가고, 거장은 자신의 지도에 따라 길을 갑니다. 결국 서로 다른 계곡에 도착하게 됩니다. 거장은 "그건 내 계곡이 아니야!"라고 말하며 추측을 거절합니다.
  • 정렬이 있을 때: 연구진은 견습생과 거장이 언덕을 내려오는 동안 동일한 무작위 단계(동일한 "노이즈")를 사용하도록 강제했습니다. 설령 서로 다른 지도를 가지고 있더라도, 같은 시간에 똑같은 발걸음을 맞추어 움직임으로써 훨씬 더 가까운 위치에 도달하게 됩니다.
  • 결과: 같은 길을 걷기 때문에, 견습생의 추측은 거장이 기대하는 바와 훨씬 더 가까워집니다. 덕분에 거장은 견습생의 추측을 더 자주 수용하게 됩니다.

문제 B 해결: "마법의 필터" (수용-거절 샘플링)

거장이 실제로 추측을 거절했을 때, 느리고 복잡한 계산을 수행하지 않고도 새로운 이미지 부분을 생성할 수 있는 백업 플랜이 필요합니다.

  • 기술: 완벽한 새로운 추측을 위한 불가능한 수학 방정식을 풀려고 노력하는 대신, 그들은 재샘플링(Rejection Sampling) 기법을 사용합니다.
  • 비유: 거장에게는 "마법의 필터"(수학적 상한선)가 있다고 상상해 보세요. 후보를 하나 생성합니다. 만약 후보가 필터를 통과하면 유지합니다. 만약 필터에 걸리면, 그것을 버리고 다시 시도합니다.
  • 혁신: 보통 이 필터를 계산하는 것은 매우 어렵습니다. 하지만 앞서 "같은 길을 걷기" 기술을 사용했기 때문에, 연구진은 무거운 시뮬레이션을 실행할 필요 없이 (단순히 경로의 시작과 끝을 확인하는 것만으로) 이 필터를 계산할 수 있는 방법을 찾아냈습니다. 이를 통해 유효한 대체 이미지 부분을 빠르게 생성할 수 있게 되었습니다.

시작 단계 해결: "캔버스 밑그림 채우기"

연구진은 이미지 생성 과정의 맨 처음에 견습생이 매우 혼란스러워하며 잘못된 추측을 한다는 점을 발견했습니다.

  • 해결책: 견습생이 어둠 속에서 추측하지 않도록, 견습생이 업무를 넘겨받기 전 약 5% 정도의 초기 획을 거장이 완벽하게 그려두게 했습니다. 이는 기초를 탄탄히 하여 견습생이 안정적으로 작업을 이어갈 수 있게 합니다.

결과: 품질의 희생 없는 속도 향상

이 기술들을 결 조합함으로써, 시스템은 이미지를 2배 이상 빠르게(설정에 따라 최대 2.7배까지) 생성할 수 있습니다.

  • 비유: 이것은 마치 빠른 견습생이 5단계 앞을 미리 스케치할 수 있는 것과 같습니다. 거장과 견습생이 이제 "같은 길을 걷고" 있고, 거장에게는 실수를 빠르게 바로잡을 방법이 있기 때문에, 견습생의 스케치는 대부분 수용됩니다. 거장은 오직 가끔씩 선을 교정하거나 아주 첫 몇 획을 그릴 때만 개입하면 됩니다.
  • 품질: 결정적으로, 이 논문은 최종 이미지가 느린 거장 단독 방식(master-only method)을 사용했을 때와 완전히 동일하게 보인다고 주장합니다. 품질의 저하는 없으며, 오직 엄청난 속도의 이득만 있습니다.

요약하자면: 이 논문은 느린 단계별 이미지 생성기를 가져와서, 빠른 견습생이 앞서서 추측하게 하고, 견셉생과 거장이 더 자주 일치하도록 "같은 춤 동작"을 따르게 하며, 복잡한 계산 없이도 실수를 즉시 바로잡을 수 있는 영리한 수학적 트릭을 사용하여 속도를 두 배로 높였습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →