← 최신 논문
🤖 machine learning

Parallel Decoding Distillation for Fast Image and Video Generation

이 논문은 네트워크 평가당 여러 번의 디노이징 단계를 예측함으로써 이미지 및 비디오 생성을 가속화하고, 4~8회의 함수 평가만으로 최첨단 성능을 달 achievement하며 기존의 증류 기술보다 비디오 다양성을 크게 향상시키는 확장 가능하고 단순화된 궤적 기반 방식인 병렬 디코딩 증류(Parallel Decoding Distillation, PDD)를 소개한다.

원저자: Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 걸작을 그리도록 가르치거나 영화를 감독하도록 가르친다고 상상해 보십시오. 인공지능의 세계에서, 이는 "디퓨전(diffusion)" 또는 "플로우(flow)" 모델을 사용하여 수행됩니다. 이 모델들을 마치 예술가라고 생각하십시오. 이들은 TV의 채널이 맞지 않을 때 나오는 것과 같은 정적 노이즈로 뒤덮인 캔버스에서 시작하여, 단계적으로, 조금씩 깨끗하게 다듬어 선명한 이미지나 비디오가 나타나게 합니다. 문제는 이 정화 과정이 믿기 힘들 정도로 느리다는 점입니다. 고품질의 결과를 얻기 위해, 로봇은 매 단계마다 자신의 작업을 확인하며 수백 번의 미세한 단계를 거쳐야 할 수도 있습니다. 이는 방을 가로지를 때 1밀리미터씩 발을 내디디며 걷는 것과 같습니다. 목적지에 도달할 수는 있겠지만, 시간이 너무 오래 걸릴 것입니다.

이를 가속화하기 위해, 과학자들은 이 로봇들에게 더 큰 도약을 하는 법을 가르치려 노력해 왔습니다. 어떤 방법들은 한 번의 거대한 점프로 최종 목적지를 예측하려 하고, 다른 방법들은 로봇이 가야 할 "경로"를 학습시켜 지루한 중간 과정을 건너뛸 수 있게 하려 합니다. 하지만 현재 비디오 분야의 최선책들은 까다롭습니다. 이들은 종로히 복잡하고 불안정한 학습 기법에 의존하는 경우가 많아, 로봇이 움직이는 법을 잊어버리게 만들 수 있으며, 그 결과 영상은 훌륭해 보일지 몰라도 시간이 멈춘 듯하거나 반복적이고 지루한 패턴으로 무너져 버립니다. 큰 질문은 이것입니다. 우리는 이 모델들에게 창의성의 마법을 잃지 않으면서도 빠르고 부드럽게 움직이는 법을 가르칠 수 있을까요?

이 논문은 **병렬 디코딩 증류(Parallel Decoding Distillation, PDD)**라는 새로운 기술을 소개합니다. 이는 이 AI 예술가들을 위한 매우 효율적인 코치 역할을 합니다. PDD는 로봇에게 한 번에 한 단계씩 움직이라고 강요하는 대신, 한 번의 시선으로 전체 시퀀스를 예측하도록 가르칩니다. 당신이 복도를 걷고 있다고 상상해 보십시오. 일반적인 로봇은 다음 단계로 이동하기 전에 문이 열려 있는지 확인하기 위해 모든 문 앞에서 멈춰 섭니다. 하지만 PDD는 복도 전체를 내려다보고, 다음 열 걸음 동안 발밑의 바닥 느낌이 어떨지를 정확히 예측한 다음, 자신감 있게 성큼성큼 나아가 그 전체 거리를 한 번에 주파합니다.

저자들은 모델이 시간 블록 전체에 대한 "평균 속도(또는 속도)"를 한꺼번에 예측하도록 훈련함으로써, 수백 단계가 보통 필요한 것에 비해 단 **4~8단계(NFE, Function Evaluations라고 불림)**만으로 고품질의 이미지와 비디오를 생성할 수 있다는 것을 발견했습니다. 이는 엄청난 속도 향상입니다. 이전의 방법들이 모델에게 경직된 경로를 따르도록 강요하거나 모델의 다양성을 해치는 복잡한 수학을 사용했던 것과 달리, PDD는 더 단순하고 직접적인 접근 방식을 사용합니다. PDD는 복잡한 미분값을 계산하거나, AI끼리 서로를 개선하기 위해 싸우는 "적대적 게임(adversarial games)"을 필요로 하지 않습니다. 이러한 방식들은 AI가 똑같은 것만을 반복해서 만드는 현상인 "모드 붕괴(mode collapse)"를 일으키는 것으로 알려져 있습니다.

이 논문은 이 방법이 텍스트 투 비디오(text-to-video) 및 텍스트 투 이미지(text-to-image) 콘텐츠를 생성하는 대규모 모델에서 매우 잘 작동함을 보여줍니다. 예를 들어, Wan2.1 비디오 모델에서 PDD는 다른 최고 수준의 방법들보다 더 빠를 뿐만 아니라 더 다양하고 역동적인 영상을 4 NFE로 제작했습니다. 오디오가 포함된 10초 길이의 영상을 만드는 LTX-2.3 모델 테스트에서, PDD는 **120 단계(4 × 30 NFE)**를 거친 교사 모델의 품질을 단 8 NFE만으로 따라잡았습니다. 이 결과는 PDD가 영상의 생동감을 만드는 다양성과 움직임을 희생하지 않으면서도 AI 생성을 빠르게 만드는 견고한 방법임을 시사합니다. 이는 우리가 훌륭한 결과를 얻기 위해 백만 번의 작은 발걸음을 내디딜 필요는 없으며, 때로는 단지 앞길 전체를 보는 법을 배우면 된다는 것을 증명하며, 중요한 진전을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →