← 최신 논문
💻 computer science

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

이 논문은 이미지의 내재적인 2D 공간 상관관계를 활용하여 여러 토큰을 동시에 예측함으로써, 높은 충실도를 유지하면서도 자기회귀적 이미지 생성을 최대 13.3배까지 가속화하는 프레임워크인 Spatially Speculative Decoding (SSD)를 소개한다.

원저자: Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 고해resolution의 벽화를 그리려고 노력 중이라고 상상해 보세요. 하지만 당신은 매우 엄격하고 구식인 규칙을 따라야만 합니다: 한 번에 단 하나의 점(dot)만을 그려야 하며, 반드시 완벽한 "뱀(snake)" 패턴으로 움직여야 합니다. 첫 번째 줄을 왼쪽에서 오른쪽으로 다 그리면, 두 번째 줄의 맨 끝으로 점프하여 오른쪽에서 왼쪽으로 가고, 다시 세 번째 줄의 끝으로 점프하는 방식입니다.

이것이 현재의 AI 이미지 생성기(이를 "자기회귀 모델(autoregressive models)"이라 부릅니다)가 작동하는 방식입니다. 이들은 이미지를 마치 긴 1차원 단어 목록처럼 취급합니다. 비록 이미지는 본래 2D 격자(상/하, 좌/우) 형태이지만, AI는 이를 1D 선 형태로 펼쳐버립니다. 이 때문에 과정이 믿기지 않을 정도로 느려집니다. 왜냐하면 AI는 다음 단 하나의 점의 색상을 결정하기 위해 자신의 전체 "두뇌"(수십억 개의 파라미터)를 매번 불러와야 하기 때문입니다. 이는 마치 사과 한 알을 사기 위해 식료품점에 갔다가 돌아오고, 그다음 사과 한 알을 위해 다시 집으로 돌아오는 과정을 반복하는 것과 같습니다.

문제점: "메모리 벽 (The Memory Wall)"

논문은 이를 **"메모리 벽"**이라고 부릅니다. AI는 실제로 생각하기보다는, 아주 작은 결정을 내리기 위해 자신의 두뇌를 메모리로 로드하는 데 대부분의 시간을 소비합니다. 이미지를 하나 만들기 위해 이 과정을 수천 번 반복해야 하므로, 이미지 생성에 오랜 시간이 걸립니다.

해결책: SSD (Spatially Speculative Decoding)

저자들은 SSD라는 새로운 방법을 소개합니다. 그들은 이미지가 사실 1D 목록이 아니라 2D 격자라는 점을 깨달았습니다. 만약 어떤 점이 어떻게 생겼는지 안다면, 그 점의 바로 '오른쪽'에 올 점을 예측하는 것만큼이나 바로 '아래'에 올 점이 어떻게 생겼을지도 쉽게 예측할 수 있습니다.

SSD가 게임의 판도를 어떻게 바꾸는지 몇 가지 비유를 통해 설명하겠습니다.

1. "추측 게임" 비유

  • 기존 방식 (1D): AI가 다음 점을 추측하고, 그것이 맞는지 확인한 뒤, 그다음 점을 추측합니다. 이는 느리고 단계적인 릴레이 경주와 같습니다.
  • SSD 방식 (2D): AI는 추측 팀처럼 행동합니다. 한 사람이 오른쪽의 다음 점을 추측하는 동안, 다른 사람은 동시에 바로 아래의 점을 추측합니다. 그들은 첫 번째 추측이 끝날 때까지 기다리지 않고, 한 번에 한 블록의 점들을 통째로 추측합니다.

2. "초안 작성" 비유
AI를 작가라고 생각해 보세요.

  • 표준 AI: 단어 하나를 쓰고, 멈추고, 사전을 찾아본 뒤, 다음 단어를 씁니다.
  • SSD: 한 번에 문장(또는 단락) 전체를 "초안"으로 써 내려갑니다. 그런 다음, 그 초안을 빠르게 읽으며 말이 되는지 확인합니다. 만약 단어 하나가 약간 틀렸다면, 전체 단락을 다시 쓰는 대신 그 단어 하나만 수정합니다.

3. "자동 완성(Auto-Correct)"의 반전
논문은 영리한 기술을 언급합니다. 보통 AI가 일련의 토큰(점) 뭉치를 추측했는데 그중 하나가 틀리면, 전체 블록을 버리고 처음부터 다시 시작합니다. 하지만 SSD는 더 똑똑합니다. 틀린 추측들을 "거친 초안"으로 취급합니다. 빠르게 검증(verification) 과정을 거친 뒤, 전체 블록을 버리는 대신 특정 오류들을 제자리에서 즉시 수정합니다. 이는 페이지 전체를 다시 쓰게 하는 대신 오타만 바로 잡아주는 맞춤법 검사기와 같습니다.

결과: 벽화 그리기 속도 높이기

논문은 이 방법을 세 가지 강력한 AI 모델에 테스트했습니다. 결과는 극적이었습니다.

  • 속도: 이미지 생성 속도를 최대 13배까지 높였습니다.
    • 예시: 이미지를 만드는 데 339초(거의 6분)가 걸리던 모델이 이제는 단 25초밖에 걸리지 않습니다.
  • 품질: 이렇게 빨라졌음에도 불구하고, 이미지는 기존의 느린 버전만큼이나 훌로 보입니다. "추측"이 충분히 정확했기 때문에 최종 결과물에서 디테일이 손실되지 않았습니다.
  • 플러그 앤 플레이 (Plug-and-Play): 이 방법은 AI의 두뇌를 새로 구축할 필요가 없습니다. 이는 기존 자동차 엔진에 터보차저를 장착하는 것과 같습니다. 속도가 필요할 때는 켜고, 원치 않을 때는 꺼서 이전과 똑같이 작동하게 할 수 있습니다.

요약

이 논문은 이미지를 1D 선으로 강제하는 대신, 이미지의 자연스러운 2D 형태(상/하 및 좌/우)를 존중함으로써 어떻게 "메모리 벽"을 허물 수 있는지 주장합니다. 여러 개의 점을 동시에 추측하고 실시간으로 작은 실수들을 수정함으로써, SSD는 느린 단계별 프로세스를 빠른 병렬 프로세스로 바꾸어 고품질 AI 예술 생성을 거의 즉각적으로 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →