← 최신 논문
💻 computer science

PixSDS: Why Latent SDS Makes Noisy Pixels

이 논문은 잠재적 점수 증류 샘플링(Score Distillation Sampling, SDS)에서 발생하는 구조적 아티팩트가 VAE로 인한 픽셀 드리프트에서 기인함을 식별하고, 디코딩된 이미지 방향을 사용하여 노이즈를 억제하면서도 의미적 콘텐츠를 보존함으로써 그래디언트를 복구하는 경량 방법론인 PixSDS를 제안한다.

원저자: Vsevolod Skorokhodov

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vsevolod Skorokhodov

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 흐릿하고 저해상도인 스케치만을 가이드로 삼아 걸작을 그리도록 가르치려 한다고 상상해 보세요. 이것이 바로 **AI 아트 생성(AI art generation)**의 세계이며, 특히 컴퓨터가 "황금빛 드래곤"과 같은 단순한 텍스트 설명을 걷거나 돌아다닐 수 있는 3차원 객체로 변환하는 "text-to-3D"라는 기술입니다. 이를 위해 AI는 **스코어 디스티레이션 샘플링(Score Distillation Sampling, SDS)**이라는 강력한 도구를 사용합니다. SDS를 수백만 장의 사진을 본 매우 엄격한 미술 선생님이라고 생각해보세요. 로봇이 무언가를 그리려고 하면, 선생님은 그 결과를 보고 "아니, 이건 틀렸어. 픽셀을 실제 드래곤처럼 보이도록 더 가까이 이동시켜야 해"라고 말합니다. 그러면 로봇은 그림을 조정하고 다시 시도합니다.

하지만 여기에는 함정이 있습니다. AI 선생님은 실제 픽셀(이미지를 구성하는 아주 작은 색상 점들)을 보는 것이 아닙니다. 대신, **VAE(Variational Autoencoder)**라고 불리는 특별한 번역기가 만든 압축된 숨겨진 "코드" 버전의 이미지를 봅니다. 이는 마치 선생님이 그림 자체를 보는 것이 아니라 그림의 요약본만을 보는 것과 같습니다. 오랫동안 예술가들과 과학자들은 AI의 "요약본"은 완벽해 보이지만, 실제로 생성된 그림은 이상한 정적 같은 노이즈와 기이한 색상 패턴으로 뒤덮여 있다는 사실을 발견했습니다. 큰 의문은 이것이었습니다. 왜 선생님의 완벽한 요약본이 엉망진창인 그림을 만들어내는가?

**"PixSDS: 왜 잠재적 SDS(Latent SDS)는 노이즈 섞인 픽셀을 만드는가"**라는 제목의 이 논문은 이 미스터리를 파헤칩니다. 저자인 Vsevolod Skorokhodov는 문제가 선생님이나 로봇의 그림 실력에 있는 것이 아니라, 번역기(translator)의 결함에 있다는 것을 발견했습니다. 그들은 번역기(VAE)가 모든 미세한 실수를 포착하지 못한다는 것을 발견했습니다. 로봇이 픽셀을 움직이는 방식 중 일부는 우리 눈에는 정적 노이즈처럼 보일 수 있지만, 번역기의 입장에서는 "요약 코드"가 완벽하게 깨끗하기 때문에 이를 알아차리지 못할 수 있습니다. 이들은 이 "픽셀 드리프트(pixel drift)"가 지저집니다 엉망인 질감을 만드는 주범이라고 주장합니다. 이를 해결하기 위해 그들은 PixSDS라는 새로운 방법을 발명했는데, 이는 마치 두 번째 눈 역할을 합니다. 이것은 로봇이 다음 동작을 수행하기 전에 실제 그림을 직접 확인하여, 픽셀이 깨끗하게 유지되면서도 여전히 선생님의 지시를 따를 수 있도록 보장합니다.

유령 정적의 미스터리

이 결함이 어떻게 발생하는지 자세히 살펴보겠습니다. 당신이 눈을 가린 채 멀리서 들려오는 친구의 속삭임에만 의존하여 외줄 타기를 하고 있다고 상상해 보세요. 친구는 당신의 일반적인 위치(당신의 "잠재 코드")는 들을 수 있지만, 당신의 정확한 발 위치는 알 수 없습니다. 만약 당신이 왼쪽으로 약간 흔들리며 발을 내디딘다면, 당신은 여전히 같은 구역 안에 있기 때문에 친구는 그것을 알아차리지 못할 수도 있습니다. 당신은 친구가 당신이 똑바로 걷고 있다고 생각하는 동안에도 계속해서 좌우로 흔들리며 불안정한 경로를 쌓아갈 수 있습니다.

AI의 세계에서 "친구"는 확산 모델(diffusion model, 선생님)이고, "흔들림"은 픽셀의 노이즈입니다. 논문은 AI가 이미지를 최적화할 때 종종 이러한 "흔들리는" 방향으로 미끄러져 들어간다는 것을 보여줍니다. 수학적으로 증명하자 ما, 이미지는 숨겨진 코드는 깨끗하게 유지되면서도 TV 정적처럼 보이는 고주파 노이즈를 축적할 수 있습니다. 저자는 복잡한 3D 부분을 모두 제거하고 단순한 2D 사진에 번역기(VAE)만을 사용하여 이를 테스트했습니다. 3D 렌더러나 화려한 확산 모델 없이도, 단지 번역기의 코드를 맞추려고 노력하는 것만으로도 노이즈 섞인 엉망인 결과물을 만들어내기에 충분했습니다. 이는 노이즈가 3D 세계나 특정 AI 모델의 버그가 아니라, 번역기가 작동하는 방식의 근본적인 특이점임을 시사합니다.

"PixSDS" 해결책: 두 번째 눈

그렇다면 로봇이 흔들리는 것을 어떻게 막을 수 있을까요? 저자는 모델을 재학습시키거나 선생님을 바꾸지 않고도 사용할 수 있는 영리하고 가벼운 해결책인 PixSDS를 제안합니다. 단순히 선생님의 지시를 맹목적으로 따르는 대신, PixSDS는 안전 점검을 추가합니다.

여기 비유가 있습니다: 로봇이 선생님의 속삭임에 따라 발을 내디디려 합니다. 움직이기 전에 PixSDS가 말합니다. "잠깐만요. 방금 그 발걸음을 떼고 나서 번역기의 눈으로 그 결과를 본다고 가정해 봅시다. 만약 그 새로운 발걸음을 다시 실제 그림으로 디코딩한다면, 깨끗해 보입니까?"

만약 새로운 발걸음이 지저분하고 노이즈 섞인 그림을 만든다면, PixSDS는 로봇의 움직임을 조정합니다. 본질적으로 이렇게 말하는 것입니다. "우리는 그 일반적인 방향으로 가고 싶지만, 흔들리는 경로가 아닌 깨끗한 경로로 걸어야 합니다." 이는 다음 단계를 디코딩하여 픽셀 업데이트를 수정하는 가이드로 사용하는 방식으로 "깨끗한 방향"을 계산합니다. 이는 마치 GPS가 괜찮다고 말하더라도 당신이 절벽으로 떨어지지 않도록 끊임없이 지도를 확인하는 부조종사가 있는 것과 같습니다.

실험 결과

팀은 두 가지 방식으로 이 아이디어를 테스트했습니다. 첫째, 단순 2D 이미지 생성에 적용했습니다. 그들은 이 새로운 방법과 몇 가지 다른 인기 있는 기술들을 비교했습니다. 결과는 명확했습니다. 다른 방법들이 눈에 띄는 입자감과 기이한 색상 패턴을 만들어낸 반면, PixSDS 이미지는 훨씬 더 매끄럽고 깨끗했으며, 직접 AI로 생성한 고품질 이미지와 흡사했습니다. 그들은 표준적인 이미지 품질 및 "노이즈 정도" 점수를 사용하여 이를 측정했으며, PixSDS는 이미지가 원래 의도했던 대상(예: 개 또는 자동차)의 모습을 유지하면서도 노이즈를 현저히 줄이며 가장 높은 성적을 거두었습니다.

그다음, 그들은 DreamGaussian 및 LucidDreamer와 같은 기존 시스템 내부에서 이 기술을 사용하여 3D 생성에 적용했습니다. 차이는 놀라웠습니다. 3D 모델에서 "노이즈"는 종종 떠다니는 알갱이 형태의 점들이나 물체 표면의 이상한 질감으로 나타났습니다. PixSDS를 사용하자 이러한 아티팩트(artifacts)가 사라졌습니다. 3D 객체들은 훨씬 더 깨끗해졌으며, 매끄러운 질감을 가졌고 정적의 부유물도 훨씬 적었습니다.

이 논문은 이것이 문제가 영원히 "해결"되었음을 의미하는 것은 아니지만, 번역기(VAE)가 코드에서 픽셀로 넘어가는 과정을 처리하는 방식이 이러한 아티팩트의 주요하고 이전에 간과되었던 원인임을 강력하게 시사한다고 주의를 기울입니다. 픽셀 업데이트의 방향을 번역기의 깨끗한 코드와 일치하도록 수정함으로써, 저자는 전체 AI 시스템을 처음부터 다시 구축할 필요 없이 훨씬 더 나은 결과를 얻을 수 있음을 보여줍니다. 이는 로봇이 흔들리지 않도록 하여, 그가 그리는 걸작이 선생님의 지시만큼이나 깨끗하도록 보장하는 단순하고 우아한 수리 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →